Poolside udostępnia Lagunę S 2.1: otwarty model do agenticznego programowania
Poolside udostępnił dziś Lagunę S 2.1 — otwarty model „open-weight” z 118 mld parametrów, przygotowany do agenticznego programowania. W narzędziach Terminal-Bench 2.1 i SWE-Bench Pro Laguna S 2.1 ma osiągać wyniki takie same lub lepsze niż modele kilka razy większe, w tym DeepSeek-V4-Flash, NVIDIA Nemotron 3 Ultra oraz Thinking Machines Inkling.
Firma deklaruje, że Lagunę S 2.1 da się uruchomić na jednej jednostce NVIDIA DGX Spark. Wagi modelu są dostępne od dziś na Hugging Face na licencji OpenMDW-1.1.
Laguna S 2.1 to pierwsze skalowanie w górę po modelu z wariantu XS, wydanym kilka tygodni temu. Choć model nie jest jeszcze „frontier” (wciąż nie należy do absolutnie najbardziej zaawansowanych rozwiązań), już teraz ma być bardzo sprawny.
Premiera Laguny S 2.1 wpisuje się w szerszą zmianę: pytanie o to, kto dostarcza Zachodowi modele „open-weight”, przestało być domeną środowisk badawczych i trafiło do zarządów oraz Waszyngtonu. W ciągu ostatniego roku korzystanie przez deweloperów wyraźnie przesunęło się w stronę systemów „open-weight”, które zespoły mogą pobrać, przejrzeć i uruchamiać na własnej infrastrukturze. W tej kategorii większość wiodących rozwiązań pochodzi dziś z chińskich laboratoriów. Ponieważ część amerykańskich zespołów przeniosła swoje najbardziej zaawansowane systemy za zamknięte interfejsy API i wdrożenia objęte ograniczeniami rządowymi, Zachód pozostał bez konkurencyjnej opcji „open-weight”.
Laguna S 2.1 ma być właśnie taką odpowiedzią i konkurować z dotychczasowymi rozwiązaniami na warunkach, które — zdaniem kupujących — są teraz kluczowe: koszt, kontrola oraz możliwość utrzymania danych we własnym środowisku.
Wydanie zmienia też akcent w debacie, która koncentrowała się dotąd na możliwościach „frontier” oraz kapitale potrzebnym do osiągnięcia takiego poziomu. Gdy przedsiębiorstwa ograniczają wydatki na tokeny i skupiają się na efektywności oraz zwrocie, do głosu dochodzą pytania o cenę uruchamiania inteligencji na dużą skalę, o to, czy taki system da się wdrożyć samodzielnie w celu zapewnienia suwerenności i zgodności oraz czy biznes stojący za modelem jest trwały. Laguna S 2.1 została zaprojektowana właśnie pod te ograniczenia.
THE EVIDENCE
Poolside udostępnia Lagunę S 2.1 wraz z zestawem kluczowych ocen agenticznego programowania uruchomianych przy użyciu pool — agentowego narzędzia Poolside — dzięki czemu badacze i deweloperzy mogą odtworzyć wyniki na własnym sprzęcie.
Porównania w benchmarkach (najwyższe publicznie wskazane wyniki dla każdego modelu) obejmują m.in.:
- Laguna S 2.1 (118B): A: 70,2% na Terminal-Bench 2.1; 78,5% na SWE-bench Multilingual; 59,4% na SWE-Bench Pro (Public Dataset)
- Laguna M.1 (kwiecień 2026) (225B): 44,9%; 63,1%; 49,2%
- Tencent Hy (3295B): 71,7%; 75,8%; 57,9%
- Thinking Machines Inkling (975B): 63,8%; wynik — dla części pomiarów oraz 54,3% w jednym z testów
- Nemotron 3 Ultra (550B): 55,6%; 67,7%; — w pozostałych polach
- MiniMax M3 (3428B): 66,0%; wynik — w części pomiarów oraz 59,0% w jednym z testów
- DeepSeek V4-Flash Max (284B): 61,8%; 73,3%; 52,6%
- DeepSeek V4-Pro Max (1,6T): 49,0%; 76,2%; 55,4%; 9,0%
- Qwen3.7-Max (—): 74,5%; 78,3%; 60,6%
- Claude Sonnet 5 (—): 80,4%; wynik — oraz 63,2% w jednym z testów; 54,0%
- GPT-5.6 Luna Max (—): 82,5%; wynik — oraz 67,0%
Pełna metodyka, parametry próbkowania oraz szczegóły dla każdego benchmarku zostaną dołączone do premiery.
Dodatkowo jako przykład długofalowego rozumowania Poolside publikuje kompletną trajektorię Laguny S 2.1, niezależnie potwierdzającą rozwiązanie problemu Erdősa #397 — zadania z kombinatoryki, które do niedawna rozwiązywały wyłącznie największe modele „frontier”.
TOKEN ECONOMICS
Uruchamianie Laguny S 2.1 lokalnie zmienia rachunek wdrażania agentów programistycznych. Model jest na tyle mały, by działać na jednej DGX Spark, co pozwala zespołom przenosić dużą część prac agenticznych z rozliczanych według użycia (metered) interfejsów API na sprzęt, który kontrolują. Dla instytucji rządowych, obronnych i innych organizacji działających w warunkach wysokich wymogów regulacyjnych, którym Poolside już służy, samodzielne wdrożenie (self-hosting) utrzymuje wrażliwy kod i dane w ich własnym środowisku. Lagunę S 2.1 wyróżnia też rozmiar, w którym żadne zachodnie laboratorium nie wypuściło modelu „open-weight” przez 11 miesięcy — licząc od wydania gpt-oss-120b w sierpniu ubiegłego roku.
HOW WE BUILD
Lagunę S 2.1 to najnowszy model z Model Factory, wewnętrznej platformy Poolside do trenowania, oceniania i iterowania na modelach foundation. Platforma automatyzuje pracę, która tradycyjnie sprawia, że rozwój modeli trwa wolno — od testów ablacjach architektury po uczenie ze wzmocnieniem na podstawie informacji zwrotnej z wykonania kodu — uruchamiając eksperymenty, które wcześniej zajmowały tygodnie, w mniej niż godzinę. To pozwala Poolside wypuszczać kolejne wersje w rytmie około pięciu tygodni. Dla porównania: trenowanie end-to-end Laguny S 2.1 trwało mniej niż 4 tygodnie na 4 000 procesorach graficznych H200.
„Zachód potrzebuje modeli „open-weight”, którym można ufać, które można uruchamiać i na których da się budować” — powiedział Jason Warner, współdyrektor generalny Poolside. „Lagunę S 2.1 można już dziś wdrażać w produkcji — zarówno w przedsiębiorstwach, jak i w rządach — na własnym sprzęcie, a koszt sprawia, że agenticzne programowanie jest możliwe w praktyce na dużą skalę”.
„Lagunę S 2.1 wykonuje pracę, którą zwykle robią modele kilka razy większe, nie pomimo tego, jak ją zbudowaliśmy, tylko dzięki temu” — powiedział Eiso Kant, współzałożyciel i współdyrektor generalny Poolside. „Model Factory automatyzuje zadania, które tradycyjnie sprawiają, że rozwój modeli jest wolny i podatny na błędy, dzięki czemu nasi badacze mogą przeprowadzać nawet o rząd wielkości więcej eksperymentów”.
AVAILABILITY
Lagunę S 2.1 można już dziś uruchomić. Wagi modelu są dostępne na Hugging Face na licencji OpenMDW-1.1. Model jest też dostępny przez API Poolside oraz na OpenRouter i działa w pool — agentowym narzędziu Poolside.
→ Pobierz wagi na Hugging Face
↗ Użyj na OpenRouter
→ Uruchamiaj w pool
▸ Komentarze (0)
Brak komentarzy. Bądź pierwszy/pierwsza — daj znać co myślisz.