Przejdź do treści
INDEKS ANALIZ BREACHROAD / NOTA TECHNICZNA

NVIDIA Nemotron 3 Super: 120B-A12B, Mamba, LatentMoE i NVFP4

Techniczna analiza Nemotron 3 Super: hybrydowy Mamba-Transformer, 120B/12B MoE, LatentMoE, MTP, native NVFP4, kontekst 1M i self-hosting.

MATERIAŁ PUBLICZNY
AUTOR
/ CEO Breachroad · OSCP · PNPT
PUBLIKACJA
10 marca 2026
CZAS CZYTANIA
16 min czytania
TEMAT
Bezpieczeństwo AI
NVIDIA Nemotron 3 Super: 120B-A12B, Mamba, LatentMoE i NVFP4

10 marca 2026 roku NVIDIA opublikowała Nemotron 3 Super, otwarty model agentowy o 120 mld parametrów łącznie i 12 mld aktywnych na token. Architektura łączy Mamba i Transformer, sparse Mixture-of-Experts, LatentMoE, Multi-Token Prediction oraz pretraining w formacie NVFP4. Producent udostępnił warianty BF16, FP8 i NVFP4, model bazowy, dane post-training oraz raport techniczny.

To release istotny nie dlatego, że „120B pokonuje większe modele”, lecz dlatego, że model, format liczbowy, spekulacyjne dekodowanie i sprzęt zostały projektowane jako jeden stos inferencyjny.

120B-A12B i hybryda Mamba–Transformer

MoE przechowuje dużą liczbę ekspertów, ale router aktywuje podzbiór. 12B active ogranicza FLOPs na token, podczas gdy 120B total nadal wymaga pamięci i dystrybucji wag. W produkcji koszt tworzą również komunikacja między GPU, KV/cache stanu, routing oraz imbalance ekspertów.

Warstwy Mamba wykorzystują model przestrzeni stanów, który efektywnie przenosi informację przez długą sekwencję bez pełnej kwadratowej uwagi w każdym kroku. Warstwy Transformer zachowują dokładne relacje oparte na attention. Hybryda próbuje uzyskać długi kontekst i throughput bez utraty jakości w zadaniach wymagających precyzyjnego odniesienia.

LatentMoE, MTP i NVFP4

LatentMoE ma poprawiać routing i wykorzystanie reprezentacji ekspertów. MTP przewiduje kilka kolejnych tokenów, co umożliwia natywne speculative decoding: dodatkowe tokeny można zaakceptować po weryfikacji, zwiększając decode throughput. Przyspieszenie zależy od acceptance rate i długości; nie jest stałym mnożnikiem.

NVFP4 używa 4-bitowej reprezentacji zoptymalizowanej dla platform NVIDIA. Pretraining z uwzględnieniem niskiej precyzji różni się od naiwnego post-training quantization — model uczy się działać w tych ograniczeniach. Nadal trzeba sprawdzić jakość na konkretnym GPU i runtime, bo format, kernel i kalibracja są współzależne.

NVIDIA deklaruje do 2,2× wyższy throughput od GPT-OSS-120B i 7,5× od Qwen3.5-122B w ustawieniu 8K input/64K output. To wynik producenta dla określonego sprzętu i długiego outputu. Krótkie rozmowy, mały batch lub inny accelerator mogą dać inną kolejność.

Kontekst 1M i RULER

Model wspiera do miliona tokenów, a NVIDIA raportuje przewagę na RULER przy 1M. Pojemność kontekstu nie oznacza, że każde wdrożenie powinno używać maksimum. Prefill, pamięć, latency i ryzyko danych rosną. W praktyce kontekst powinien być budżetem zarządzanym przez retrieval i compaction.

Testuj needle retrieval, zachowanie po wielu narzędziach, cytowanie fragmentów i stabilność instrukcji. Agent, który mieści milion tokenów logów, może nadal wybrać zły dowód.

Otwarte artefakty i reprodukcja

NVIDIA udostępniła checkpointy post-trained i base oraz zestawy syntetyczne i RL/SFT. To poprawia przejrzystość, ale nie znosi supply-chain risk. Pinuj revision i hash, zapisuj licencję każdej części, skanuj kod loadera i nie mieszaj niezweryfikowanych adapterów z produkcją.

Model card, tokenizer, chat template, runtime, quant i wersja sterownika powinny tworzyć jeden rekord w registry. „Nemotron 3 Super” bez tego manifestu nie jest reprodukowalnym wdrożeniem.

Bezpieczny agent na Nemotronie

Otwarte wagi pozwalają uruchomić system w prywatnej sieci, ale agent nadal potrzebuje sandboxu, gateway narzędzi, schema validation i minimalnych credentiali. Długi kontekst może zawierać prompt injection z dokumentu albo repozytorium. Oddziel instrukcje od danych i wymagaj approval dla mutacji.

Zbuduj eval obejmujący agentic reasoning, coding, polski język, 1M retrieval, function calling, odmowy i adversarial inputs. Mierz koszt energii, VRAM, tokens/s, time-to-first-token i poprawność całego zadania. Throughput bez skuteczności jest słabą metryką biznesową.

Plan benchmarku infrastruktury

Porównanie powinno używać tego samego zbioru promptów, długości wejścia i wyjścia, batchu oraz polityki cache. Osobno uruchom cold start, obciążenie ustalone i skok ruchu. Raportuj medianę oraz p95/p99 TTFT, inter-token latency, requestów na sekundę, błędy OOM, pobór energii i koszt poprawnego zadania. Deklaracja przy 8K wejścia i 64K wyjścia nie przewiduje zachowania czatu z odpowiedzią 500 tokenów.

Przy NVFP4 sprawdź jakość per klasa zadania, nie tylko średnią benchmarku. Kwantyzacja może nierówno wpływać na kod, rzadkie języki, ścisły JSON czy długie rozumowanie. Artefakt BF16/FP8 i NVFP4 powinny mieć osobne rekordy registry, osobne wyniki eval oraz możliwość szybkiego rollbacku.

Odporność operacyjna klastra

Przetestuj utratę GPU, restart workera, przepełnienie kolejki i błędną wersję kernela. Scheduler powinien odrzucać ruch zgodnie z priorytetem, a nie degradować wszystkie tenanty. Endpoint health nie może oznaczać tylko „proces działa”: potrzebne są canary prompts kontrolujące tokenizer, generację i tool calling. Kopie wag i cache przechowuj z kontrolą dostępu, ponieważ prywatne adaptery mogą zawierać wiedzę organizacji.

Wdrożenie połącz z rejestrem modeli AI, bezpiecznymi formatami wag i sandboxem agentów. W sprawie niezależnego benchmarku i threat modelu skontaktuj się z BreachRoad.


Źródła pierwotne: NVIDIA Research — Nemotron 3 Super, raport techniczny.

UDOSTĘPNIJ / KOPIUJ