Meta MTIA 300–500: cztery układy AI w dwa lata
Meta ujawniła roadmapę MTIA 300, 400, 450 i 500. Analizujemy chiplets, 72 akceleratory, HBM, MX4/MX8, software stack i ryzyko benchmarków.
- AUTOR
- Karol Rapacz / CEO Breachroad · OSCP · PNPT
- PUBLIKACJA
- 11 marca 2026
- CZAS CZYTANIA
- 13 min czytania
- TEMAT
- Bezpieczeństwo AI
11 marca 2026 roku Meta przedstawiła cztery generacje własnych akceleratorów: MTIA 300, 400, 450 i 500. Firma podała, że wcześniej wdrożyła setki tysięcy MTIA, a nowe układy były już używane lub planowane na lata 2026–2027. Strategia nie zakłada jednego projektu na wiele lat; modularne chiplets i krótszy cykl mają reagować na zmieniające się workloady rekomendacji, treningu i generatywnego AI.
MTIA 300 działa produkcyjnie przy treningu ranking/recommendation. MTIA 400 rozszerza zakres na GenAI i ma 72-akceleratorową domenę scale-up; Meta zakończyła testy laboratoryjne i zapowiedziała wdrożenie w data center. MTIA 450, planowana do masowego wdrożenia na początku 2027 roku, podwaja przepustowość HBM względem 400 i dodaje niską precyzję dla inference. MTIA 500, również planowana na 2027, zwiększa HBM bandwidth o kolejne 50%.
Dlaczego inference jest ograniczone pamięcią
Przy generowaniu tokenów wagi modelu są wielokrotnie odczytywane, a liczba operacji na każdy bajt bywa niższa niż w treningu. Dlatego przepustowość HBM może być ważniejsza niż szczytowe FLOPS. Większa pamięć pozwala też utrzymać model i KV cache bez kosztownej komunikacji między układami.
Meta podała wzrost przepustowości HBM 4,5 razy i compute 25 razy między MTIA 300 a 500, ale porównanie compute przechodzi z MX8 do MX4. To różne formaty, więc liczby nie powinny być czytane jako 25-krotne przyspieszenie tej samej aplikacji. Rzeczywisty wynik zależy od modelu, batch size, sparsity, kompilatora i sieci.
Hardware potrzebuje dojrzałego software stacku
Akcelerator ma wartość, gdy framework potrafi zaplanować operatory, debugować błędy i utrzymać zgodność modeli. Meta wskazała integracje z PyTorch, vLLM i Triton, otwarte elementy w OCP oraz sterownik userspace i firmware napisane w Rust. Własny układ daje kontrolę kosztu, ale tworzy też nowy supply chain kompilatora, runtime, firmware i telemetrii.
Z perspektywy bezpieczeństwa warto wymagać:
- podpisanego firmware i kontrolowanego procesu aktualizacji,
- izolacji pamięci między tenantami i wyzerowania po zadaniu,
- atestacji wersji runtime oraz modelu,
- logów błędów bez danych promptu,
- SBOM dla kompilatora i bibliotek komunikacji.
Jak porównywać akceleratory
Nie porównuj jednego wykresu. Mierz zakończone zadania na wat, p95 latency, jakość przy wybranej kwantyzacji, czas kompilacji i stabilność przy długim obciążeniu. Uwzględnij koszt migracji operatorów oraz możliwość powrotu na inny backend. Więcej o ryzyku formatów niskiej precyzji opisujemy w analizie NVFP4 i modeli Nemotron.
MTIA pokazuje pionową integrację: firma projektuje model, runtime, chip i data center. To może obniżyć koszt, ale wymaga niezależnej weryfikacji deklaracji i planu przenośności. W AI infrastructure liczy się całe zadanie, nie sam układ.
Co oznacza domena scale-up 72 akceleratorów
Scale-up łączy układy szybką siecią tak, aby duży model zachowywał się jak na jednym logicznym zasobie. Krytyczne są bandwidth, latency i collectives, np. all-reduce lub all-to-all. Sam rozmiar domeny nie mówi, jaki model działa efektywnie — liczy się topologia, bisection bandwidth i sposób podziału tensorów oraz ekspertów.
Awaria jednego elementu może przerwać całe zadanie, więc runtime potrzebuje wykrywania błędów, checkpointów i degradacji. Przy inference ważne jest, czy scheduler potrafi ominąć wadliwy chip bez utraty wszystkich sesji. Telemetria musi odróżniać błąd modelu, kompilatora, HBM i interconnectu.
Niska precyzja a jakość
MX8 i MX4 zmniejszają koszt pamięci oraz zwiększają throughput, ale kwantyzacja może nierówno wpływać na warstwy. Ewaluuj nie tylko perplexity, lecz realne zadania, długie konteksty, rzadkie języki i tool calling. Dla agentów mały spadek trafności argumentu może wywołać duży błąd skutku.
Zachowaj wersję recepty kwantyzacji i kalibracyjnego datasetu. Dwa artefakty o tej samej nazwie modelu, lecz różnych skalach, nie są tym samym wdrożeniem. Registry powinien łączyć wagi, format, compiler build i akcelerator.
Bezpieczeństwo wielodostępności
Akcelerator inference może obsługiwać żądania różnych użytkowników. Trzeba wyzerować HBM i bufory, izolować DMA/IOMMU oraz zapobiegać współdzieleniu cache bez kontroli. Side-channel i błędny scheduler mogą ujawnić fragmenty poprzedniego kontekstu nawet bez dostępu do modelu.
Czy własny chip oznacza pełną kontrolę supply chain? Nie. Projekt korzysta z partnerów, narzędzi EDA, pamięci, packagingu i firmware. Kontrola rośnie, ale łańcuch pozostaje wielowarstwowy.
Wniosek dla kupującego compute
Klient chmurowy może nigdy nie wybrać MTIA bezpośrednio, lecz skorzysta z niego przez cenę i latency produktu. Wymagaj jednak stabilnych SLO i ewaluacji niezależnych od backendu. Dostawca powinien poinformować o zmianie kwantyzacji lub architektury, jeżeli może ona wpłynąć na jakość, bezpieczeństwo albo rezydencję danych.
Źródło pierwotne: Meta AI — Four MTIA Chips in Two Years.


