NVIDIA Vera Rubin: 10 razy więcej tokenów na megawat
Vera Rubin wchodzi do produkcji. Analizujemy benchmark 10× tokenów na megawat, architekturę NVL72, koszty, chłodzenie i ryzyka wdrożenia.
- AUTOR
- Karol Rapacz / CEO, Pentester (OSCP, PNPT)
- PUBLIKACJA
- 21 lipca 2026
- CZAS CZYTANIA
- 16 min czytania
- TEMAT
- AI w firmie
NVIDIA ogłosiła 21 lipca 2026 roku, że systemy Vera Rubin NVL72 wchodzą do produkcji i działają już u pierwszych partnerów, w tym CoreWeave, Google Cloud, Microsoft Azure oraz Oracle Cloud Infrastructure. Najgłośniejsza liczba w komunikacie to 10 razy więcej tokenów na sekundę na megawat niż w Grace Blackwell NVL72 podczas benchmarku DeepSeek-R1 przeprowadzonego przez CoreWeave. Dla firm ważniejsza od samego mnożnika jest jednak zmiana sposobu liczenia infrastruktury AI: ograniczeniem coraz częściej nie jest liczba dostępnych GPU, lecz energia, sieć, chłodzenie, przepustowość pamięci i koszt użytecznego wyniku.
NVIDIA opisuje wdrożenia oraz architekturę Vera Rubin jako współprojektowany system rack-scale. Podane wyniki pochodzą od NVIDIA i jej partnerów oraz dotyczą konkretnych konfiguracji i obciążeń. Nie należy przenosić mnożnika 10× bezpośrednio na własny model, region chmurowy albo rachunek. Uczciwa decyzja zakupowa wymaga benchmarku z rzeczywistą długością kontekstu, poziomem współbieżności, jakością odpowiedzi i całym kosztem usługi.
Co zostało potwierdzone 21 lipca
Vera Rubin NVL72 nie jest już wyłącznie zapowiedzią architektury. NVIDIA informuje o ramp-upie produkcji, uruchomionych rackach u operatorów chmurowych oraz łańcuchu dostaw obejmującym ponad 350 zakładów w 30 państwach. Google Cloud uruchomił pierwszą instancję A5X opartą na NVL72, a CoreWeave opublikował pierwsze liczby z działającego sprzętu.
Platforma łączy siedem nowych układów i pięć typów trayów. W warstwie obliczeniowej znajdują się GPU Rubin i procesor Vera, a komunikację zapewniają między innymi NVLink 6, ConnectX-9, Spectrum-6 i BlueField-4. To ważne, ponieważ współczesne obciążenie AI nie kończy się na mnożeniu macierzy. CPU orkiestruje agentów, sieć synchronizuje ekspertów i węzły, DPU izoluje oraz obsługuje dane, a chłodzenie decyduje, czy całość może utrzymać zadany pobór mocy.
| Element | Rola w systemie | Pytanie dla kupującego |
|---|---|---|
| Rubin GPU | trening, post-training i inferencja | jaki model i precyzja były mierzone? |
| Vera CPU | orkiestracja, narzędzia i logika agentów | czy CPU ogranicza współbieżność? |
| NVLink 6 | komunikacja scale-up wewnątrz systemu | jaka jest topologia i oversubscription? |
| Spectrum-X / Spectrum-6 | komunikacja scale-out między rackami | jaki jest koszt sieci w tokenie? |
| BlueField-4 | DPU, sieć, bezpieczeństwo i izolacja | gdzie kończy się tenant i domena zaufania? |
| chłodzenie cieczą | odbiór ciepła przy dużej gęstości | kto odpowiada za wodę, serwis i awarie? |
Co oznacza 10× tokenów na megawat
CoreWeave porównał Vera Rubin NVL72 z Grace Blackwell NVL72 na obciążeniu DeepSeek-R1 i podał dziesięciokrotny wzrost tokenów na sekundę na megawat. Jest to metryka przepustowości energetycznej: ile pracy generatywnej system wykonuje w ramach ograniczonego budżetu mocy. Ma znaczenie w centrach danych, w których dodatkowy megawat wymaga wieloletnich uzgodnień, nowej stacji zasilania lub przebudowy chłodzenia.
Nie jest to jednak kompletna miara wartości. Token nie ma stałej jakości ani ceny biznesowej. Krótka odpowiedź prostego modelu, długi tok rozumowania oraz token multimodalny mogą mieć inną wagę. Porównanie powinno utrzymywać stałe co najmniej: model, wersję, precyzję, długość wejścia i wyjścia, batch, opóźnienie SLO, poziom współbieżności, jakość oraz dostępność funkcji takich jak speculative decoding.
Jeżeli nowa platforma wytwarza więcej tokenów, ale system częściej ponawia zadania albo generuje odpowiedzi odrzucane przez ewaluator, użyteczna ekonomia może być gorsza. Dlatego podejście z artykułu jak mierzyć ROI z AI nadal obowiązuje: liczymy zaakceptowany rezultat procesu, a nie samą objętość inferencji.
Dlaczego DeepSeek-R1 obciąża komunikację
DeepSeek-R1 wykorzystuje architekturę mixture-of-experts. Dla każdego tokenu aktywowana jest część wyspecjalizowanych ekspertów, którzy mogą znajdować się na różnych akceleratorach. Router rozdziela tokeny, a system wykonuje intensywną komunikację all-to-all. Gdy sieć nie nadąża, drogie GPU czekają na dane i ich teoretyczne FLOPS nie zamieniają się w wyniki.
NVIDIA podaje, że NVLink 6 w NVL72 zapewnia 260 TB/s przepustowości all-to-all, dzięki czemu rack ma zachowywać się jak jeden akcelerator. CoreWeave opisuje ponadto fabric oparty na 102,4 Tb/s Spectrum-6, bez oversubscription w topologii spine-leaf. Są to parametry architektury i wdrożenia partnera, nie gwarancja dla każdej usługi chmurowej. Klient powinien pytać, czy kupuje pełny rack, podzielony klaster czy profil z ograniczeniami sąsiedztwa.
Ten problem dotyczy też bezpieczeństwa. Im więcej komponentów uczestniczy w jednej inferencji, tym więcej płaszczyzn zarządzania, firmware, telemetryki i granic tenantów. Audyt bezpieczeństwa chmury powinien objąć nie tylko API usługi, lecz również sieć zarządzającą, obrazy węzłów, rejestr modeli, storage checkpointów i role automatyzacji.
CPU wraca do centrum agentowej AI
Komunikat nie dotyczy wyłącznie GPU. Vera CPU używa rdzeni Olympus i według NVIDIA ma zapewniać dwukrotnie wyższą wydajność jednowątkową, trzykrotnie większą przepustowość core-to-core oraz o 40% niższe opóźnienie pamięci niż porównywane konstrukcje chipletowe. DeepInfra podała w swoim środowisku do 2,2× szybszą orkiestrację i do 1,6× więcej równoczesnych agentów przy tym samym poziomie jakości usługi.
To logiczne: agent wykonuje kod sterujący, parsuje odpowiedzi, komunikuje się z bazami, sprawdza polityki i czeka na narzędzia. GPU może kończyć generowanie szybko, lecz wolny wątek orkiestratora nadal ograniczy cały proces. Własny benchmark powinien rozdzielać czas modelu, kolejki, CPU, narzędzi, sieci i storage. Bez tego dostawca infrastruktury może poprawić jeden element, a aplikacja nie zauważy różnicy.
Architektura agentowa zwiększa też skutki błędu. Większa współbieżność oznacza więcej równoległych operacji na danych i API. Kontrole opisane w przewodniku o tożsamościach agentów AI są więc równie ważne jak wydajność: osobna tożsamość workloadu, krótkie poświadczenia, minimalny zakres i pełny audyt wywołań.
Chłodzenie, woda i gęstość mocy
Vera Rubin NVL72 ma korzystać z projektu trayów bez kabli, wentylatorów i węży wewnątrz modułu obliczeniowego, co według NVIDIA skraca montaż z godzin do minuty. Temperatura wlotowa cieczy na poziomie 45°C pozwala projektować dry coolery bez klasycznego chillera. Producent szacuje oszczędność milionów galonów wody rocznie na megawat w nowych obiektach z zamkniętym obiegiem.
Nie znaczy to, że system nie zużywa zasobów ani że każdy istniejący data center może go przyjąć. Trzeba uwzględnić warunki klimatyczne, temperaturę otoczenia, jakość cieczy, redundancję pomp, wykrywanie wycieków, serwis, gęstość na rack i procedury awaryjnego odstawienia. W PUE łatwo zgubić energię poza IT, a w WUE — lokalny kontekst wodny. Raport ESG powinien rozdzielać dane pomiarowe operatora od uśrednionej deklaracji producenta.
Suwerenność danych nie wynika z lokalizacji GPU
NVIDIA połączyła premierę produkcyjną z europejskimi wdrożeniami Microsoft i Mistral. Komunikat mówi o modelach działających w chmurze publicznej, środowisku połączonym i odłączonej chmurze prywatnej. Dla administracji, finansów i zdrowia jest to istotne, ale „sovereign-ready” nie jest samodzielnym dowodem zgodności.
Organizacja musi ustalić, gdzie znajdują się dane, logi, kopie, klucze, support i personel administracyjny. Potrzebuje kontroli podprocesorów, retencji, transferów transgranicznych, zarządzania kluczami i ścieżki usunięcia danych. W przypadku najbardziej wrażliwych modeli warto rozważyć confidential computing i atestację, pamiętając, że TEE również ma granice i nie zabezpiecza błędnej aplikacji.
Bezpieczeństwo rack-scale AI
Wysoka integracja poprawia wydajność, lecz poszerza zależność od jednego stosu. Aktualizacja firmware przełącznika, DPU, BIOS-u, sterownika, biblioteki komunikacyjnej lub runtime modelu może wpływać na cały klaster. Potrzebny jest inwentarz wersji i kontrolowany canary, a nie jednoczesna aktualizacja wszystkich racków.
Najważniejsze obszary kontroli to:
- oddzielenie sieci zarządzającej, storage, treningu i inferencji;
- MFA odporne na phishing oraz just-in-time dla operatorów;
- podpisane obrazy węzłów, sterowniki i artefakty modelu;
- szyfrowanie danych w spoczynku i tranzycie z kontrolą właściciela klucza;
- limity tenantów, quota i ochrona przed wyczerpaniem zasobów;
- monitoring zbiorczych anomalii sieciowych, nie tylko pojedynczego hosta;
- plan odzyskiwania checkpointów oraz test odtworzenia;
- proces ujawniania i usuwania podatności w firmware oraz bibliotekach.
Warto połączyć te wymagania z Zero Trust. Fizyczna obecność w tym samym racku nie tworzy automatycznie zaufanej strefy, a konto operatora nie powinno dawać stałego dostępu do wszystkich płaszczyzn.
Jak wykonać własny benchmark zakupowy
Najpierw wybierz trzy reprezentatywne procesy: na przykład interaktywny chatbot z niskim opóźnieniem, przetwarzanie wsadowe oraz agent używający narzędzi. Zamroź wersję modelu, parametry dekodowania i zbiór ewaluacyjny. Zmierz nie tylko tokens/s, ale także time-to-first-token, tail latency p95/p99, odsetek udanych zadań, energię, koszt sieci i czas niedostępności.
Następnie wykonaj test odporności. Ogranicz jeden link, wyłącz węzeł, zasymuluj błąd storage i sprawdź, jak szybko scheduler odzyskuje pracę. Zweryfikuj izolację: czy tenant widzi cudzą kolejkę, telemetrię, checkpoint albo identyfikator zadania? Na końcu policz koszt zaakceptowanego wyniku przy realistycznym utilization. Cena katalogowa GPU bez kosztu rezerwacji, energii, sieci, storage, licencji i zespołu nie jest TCO.
Co oznacza premiera dla zwykłej firmy
Większość organizacji nie kupi NVL72. Skorzysta z niego pośrednio przez model API, zarządzany endpoint lub dostawcę chmury. Mimo to nowa generacja wpływa na negocjacje: można wymagać danych o kosztach tokena, energii, lokalizacji, poziomie izolacji i dostępności konkretnych profili sprzętowych.
Nie ma sensu migrować tylko dlatego, że nowy system ma wyższy mnożnik. Jeżeli aplikacja czeka na bazę, ma słabe cache, wysyła nadmierny kontekst albo ponawia błędne zadania, tańszą optymalizacją może być przebudowa procesu. Pomaga w tym model router: trudne zadania trafiają do mocnego modelu, a proste do mniejszego, z jawnymi regułami jakości i poufności.
FAQ
Czy Vera Rubin jest 10 razy szybsza we wszystkim?
Nie. Opublikowany wynik dotyczy tokenów na sekundę na megawat w benchmarku DeepSeek-R1 wykonanym przez CoreWeave względem Grace Blackwell NVL72. Inny model, batch, SLO lub konfiguracja mogą dać inny rezultat.
Czy 10× tokenów na megawat oznacza 10× niższy rachunek?
Nie automatycznie. Rachunek obejmuje amortyzację lub cenę chmury, rezerwację, energię, sieć, storage, licencje, obsługę i wykorzystanie. NVIDIA mówi również o nawet jednej dziesiątej kosztu miliona tokenów w porównaniu z GB200 NVL72, ale własna cena zależy od umowy i obciążenia.
Czy lokalny rack rozwiązuje problem ochrony danych?
Nie. Lokalizacja pomaga, lecz nadal istnieją konta administracyjne, logi, dostawcy serwisu, aktualizacje, klucze i eksport telemetryki. Potrzebny jest pełny model odpowiedzialności.
Najważniejszy wniosek
Vera Rubin pokazuje, że ekonomika AI przenosi się z pojedynczego GPU na kompletny system: CPU, fabric, DPU, chłodzenie i oprogramowanie. Wynik 10× jest wart uwagi, ale powinien otworzyć proces walidacji, a nie go zakończyć. Wygrywa infrastruktura, która dostarcza najwięcej poprawnych i zaakceptowanych rezultatów w danym limicie energii, czasu, ryzyka oraz kosztu.
Planujesz prywatną lub chmurową platformę AI? Zanim podpiszesz długą rezerwację, połącz benchmark wydajności z audytem bezpieczeństwa AI i przeglądem architektury. Skontaktuj się z BreachRoad, aby zbudować mierzalny plan testu.


