Multiverse Computing ogłosiło wydanie Pulsar 16B, modelu open reasoning z 16,15 mld parametrów, zbudowanego na architekturze NVIDIA Nemotron. Model powstał z wykorzystaniem autorskiej technologii Multiverse Computing oraz narzędzi z ekosystemu NVIDIA w ramach procesu kompresji, m.in. NVIDIA Model Optimizer i Megatron Bridge. Pulsar 16B został zweryfikowany na infrastrukturze przyspieszanych obliczeń NVIDIA.
Według deklaracji firmy Pulsar 16B dostarcza wydajność rozumowania na poziomie najlepszych architektur z segmentu 30B, przy „około połowie” liczby parametrów. Model jest dostępny w precyzjach BF16, FP8 oraz NVFP4 i można go pobrać na HuggingFace na licencji Apache 2.0.
Pulsar 16B ma zachować większość jakości rozumowania, zachowania w podążaniu za instrukcjami oraz interfejsów do używania narzędzi z nie skompresowanego modelu bazowego. Testy niezależnie przeprowadzono na przyspieszanej infrastrukturze NVIDIA.
Wyniki na benchmarkach rozumowania, wiedzy i narzędzi
Na standardowych testach rozumowania, wiedzy, kodowania i użycia narzędzi Pulsar 16B ma odpowiadać swojemu punktowi startowemu klasy 30B i jednocześnie wyprzedzać gpt-oss-20B w niemal każdym mierniku, mimo mniejszego rozmiaru.
- AIME 2025: Pulsar 16B uzyskał 87,22, czyli w granicach jednej dziesiątej punktu od nie skompresowanego modelu bazowego i o 15 punktów lepiej niż gpt-oss-20B.
- GPQA-Diamond (poziom PhD w naukach): 71,41, tyle samo co nie skompresowany model, oraz wyraźnie więcej niż 58,88 dla gpt-oss-20B.
- Funkcje krytyczne dla wdrożeń produkcyjnych: Pulsar 16B ma wyprzedzać gpt-oss-20B o 14 punktów w dopasowaniu do instrukcji (IFBench), 11 punktów w wywołaniach funkcji (BFCL-v4) oraz 15 punktów w rozumowaniu matematycznym (AIME).
Oszczędność pamięci i szybkość wnioskowania
Pulsar 16B ma zapewniać istotne redukcje pamięci potrzebnej do przechowywania wag modelu we wszystkich obsługiwanych precyzjach, w porównaniu do modelu bazowego Nemotron-3-Nano-30B-A3B. Firma podkreśla, że ma to znaczenie szczególnie dla organizacji uruchamiających modele na GPU o ograniczonej pamięci albo w środowiskach jednowsęzłowych.
W konfiguracji z 32 równoległymi żądaniami na GPU NVIDIA Blackwell, Pulsar 16B w precyzji FP8 ma dostarczać 4 808 tokens/sekundę przepustowości systemowej, czyli o 43% więcej niż model bazowy (3 363 tok/s). Jednocześnie czas do pierwszego tokena (TTFT) ma spaść z 2,18 s do 1,24 s.
Dłuższy kontekst i testy retrieval
Multiverse Computing oceniło Pulsar 16B pod kątem pracy w długim kontekście na benchmarkach LongBench, AA-LCR, zestawie RULER oraz wariantach NIAH w coraz dłuższych oknach kontekstowych. Firma wskazuje, że wyszukiwanie typu needle-in-a-haystack pozostaje „w zasadzie idealne” po obu stronach progu 100K tokenów, a Pulsar 16B ściśle śledzi zachowanie nie skompresowanego modelu bazowego na trudniejszych zadaniach RULER przy wydłużonym kontekście.
W zastosowaniach zorientowanych na dokumenty Pulsar 16B ma zachowywać podobne zachowanie jak model pierwotny.
Architektura i podejście do kompresji
Pulsar 16B jest zbudowany na sprężonej i zoptymalizowanej wersji NVIDIA Nemotron 3 Nano – architekturze będącej hybrydą Hybrid Mamba2-Transformer z Mixture-of-Experts. Multiverse Computing (firma będąca członkiem programu NVIDIA Inception) użyło w procesie kompresji bibliotek NVIDIA Model Optimizer i Megatron Bridge w ramach technologii CompactifAI.
Model bazowy nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-BF16 ma mieć 31,6 mld parametrów łącznie i 3,5 mld parametrów aktywnych. Po kompresji Pulsar 16B ma mieć 16,15 mld parametrów łącznie i 3,1 mld parametrów aktywnych, przy czym – jak podaje firma – nie było potrzeby retrainingu od zera.
Multiverse Computing zidentyfikowało i usunęło matematyczną redundancję w wytrenowanej sieci, jednocześnie zachowując zachowania rozumowania wyuczone podczas treningu. Efektem ma być model w rodzinie architektury Nemotron zachowujący format promptu, strukturę wywołań narzędzi i interfejs do rozumowania, ale w skali 16,15 mld parametrów zamiast 31,6 mld.
Wypowiedź zarządu
„Uruchamianie zaawansowanego AI lokalnie historycznie wymagało kompromisu między rozmiarem modelu a wydajnością. To, co pokazujemy dzięki Pulsar 16B, to fakt, że rozumowanie klasy frontier można wdrożyć bez narzutu infrastruktury na poziomie chmury, w śladzie (footprint), który firmy są w stanie realnie uruchamiać i skalować ekonomicznie” – powiedział Enrique Lizaso, współzałożyciel i CEO Multiverse Computing.
Gdzie ma być wdrażany Pulsar 16B
Model jest przygotowany dla zespołów działających w obszarach, gdzie wcześniej koszty i rozmiar obliczeń klasy frontier utrudniały wdrożenia, w tym w zadaniach agentowych o wysokiej równoległości, przy ciągłych pipeline’ach z długimi dokumentami oraz w asystentach kierowanych do klientów. Firma wskazuje na możliwość wdrożeń w konfiguracjach jednowsęzłowych, w środowiskach on-premise regulowanych oraz w systemach wrażliwych na opóźnienia.
Dostępność
Pulsar 16B jest dostępny od dziś na Hugging Face na licencji Apache 2.0. Pełna dokumentacja techniczna, w tym opis metodyki, ustawień ewaluacji oraz wyniki dla poszczególnych benchmarków, znajduje się na multiversecomputing.com. Model można też śledzić w repozytoriach open-source Multiverse Computing na huggingface.co/MultiverseComputingCAI.
Dyskusje o NVDA na forum
Forum spółki →▸ Komentarze (0)
Brak komentarzy. Bądź pierwszy/pierwsza — daj znać co myślisz.