Przejdź do treści
INDEKS ANALIZ BREACHROAD / NOTA TECHNICZNA

SAM 3.1 śledzi 16 obiektów naraz: real-time wideo na jednej H100

Meta SAM 3.1 podwaja throughput do 32 FPS dzięki object multiplexing i global reasoning. Techniczna analiza segmentacji, wdrożenia i ryzyk monitoringu.

MATERIAŁ PUBLICZNY
AUTOR
/ CEO Breachroad · OSCP · PNPT
PUBLIKACJA
27 marca 2026
CZAS CZYTANIA
11 min czytania
TEMAT
Bezpieczeństwo AI
SAM 3.1 śledzi 16 obiektów naraz: real-time wideo na jednej H100

27 marca 2026 roku Meta udostępniła SAM 3.1, zgodny zamiennik SAM 3 zoptymalizowany do wideo. Kluczową zmianą jest object multiplexing: śledzenie do 16 obiektów w jednym forward pass zamiast osobnego przebiegu dla każdego. Meta podała wzrost z 16 do 32 klatek na sekundę na jednej H100 dla wideo ze średnią liczbą obiektów.

Wynik pochodzi od producenta i dotyczy określonego profilu obciążenia. Nie gwarantuje 32 FPS dla każdej rozdzielczości, długości filmu i liczby instancji. Mimo to zmiana architektoniczna jest ważna: usuwa powtarzane obliczenia i wąskie gardła pamięci, a global reasoning analizuje obiekty wspólnie.

Segmentacja, detekcja i tracking w jednym przepływie

SAM 3 obsługuje tekstowe nazwy konceptów, przykłady obrazu oraz wskazania wizualne — punkty, ramki i maski. Model wykrywa instancje, tworzy maski pikselowe i przenosi tożsamość obiektu między klatkami. Pytanie „czerwony parasol w paski” nie musi znajdować się na zamkniętej liście klas.

Multiplexing jest szczególnie użyteczny w sporcie, montażu, inspekcji i monitoringu, gdzie wiele obiektów trzeba śledzić naraz. Oszczędność GPU może umożliwić przetwarzanie bliżej źródła albo zwiększyć liczbę strumieni na serwer. Meta udostępniła checkpoint, kod i paper, co ułatwia reprodukcję — nadal trzeba jednak odtworzyć benchmark na własnym materiale.

Jak ocenić jakość poza FPS

Mierz IoU maski, stabilność tożsamości, opóźnienie end-to-end i błędy po zasłonięciu. Ważne są false positives oraz różnice między grupami i warunkami oświetlenia. Przetestuj rzadkie obiekty, tłum, ruch kamery, kompresję i długie zniknięcie z kadru.

W produkcji potrzebujesz wersjonowania modelu i promptu, bufora na spadki przepustowości, monitoringu driftu oraz ścieżki ręcznej weryfikacji. „Real-time” wymaga budżetu całego pipeline: dekodowania, preprocessingu, inference, postprocessingu i wysłania wyniku.

Prywatność i nadużycia

Segmentacja nie jest automatycznie identyfikacją osoby, lecz w połączeniu z re-identification może zasilać śledzenie. Materiał wideo bywa daną osobową; należy ograniczyć retencję, dostęp i cel przetwarzania. Dla zastosowań wysokiego ryzyka konieczna jest analiza prawna i test proporcjonalności, a nie tylko zgoda zespołu technicznego.

SAM 3.1 pokazuje, że innowacja może polegać na efektywniejszym wykonaniu istniejącej zdolności. Wdrożenie warto red-teamować zarówno pod kątem błędów modelu, jak i prywatności oraz kontroli API.

Object multiplexing a planowanie pamięci

Przetwarzanie wielu obiektów w jednym przebiegu pozwala współdzielić cechy obrazu, zamiast wielokrotnie kodować tę samą klatkę. Nadal rośnie jednak pamięć dla masek, historii tracków i obiektów. Limit 16 oznacza konieczność polityki: które obiekty zachować, jak podzielić większy zestaw i co zrobić, gdy liczba dynamicznie przekroczy limit.

Scheduler powinien unikać starvation. Jeden zatłoczony strumień nie może zabierać GPU wszystkim innym. Wprowadź limity per tenant, maksymalną rozdzielczość i kontrolę czasu retencji tracka. Batchowanie poprawia throughput, ale zwiększa latency, więc parametry trzeba dostroić do zastosowania.

Occlusion, identity switch i błąd biznesowy

Po zasłonięciu model może przypisać śledzoną tożsamość innemu obiektowi. W montażu oznacza zły efekt; w monitoringu — błędne zdarzenie przypisane osobie. Mierz identity switches i track fragmentation, nie tylko mask IoU. Dla decyzji wrażliwych wymagaj potwierdzenia drugim sygnałem.

Prompt tekstowy również bywa niejednoznaczny. „Pracownik bez kasku” łączy detekcję osoby, obiektu i relacji przestrzennej. Model segmentacji może znaleźć kask, ale nie dowieść zgodności BHP. Logika domenowa i próg niepewności muszą być osobne.

Bezpieczeństwo API obrazu

Pliki wideo są nieufnym wejściem. Stos dekodowania powinien działać w sandboxie, mieć limit wielkości, klatek i czasu oraz aktualne kodeki. Oddziel URL fetch od inference, blokuj adresy prywatne i skanuj metadane. Ten sam pipeline, który uruchamia model, nie powinien przechowywać kluczy do systemu kamer.

Czy opublikowany checkpoint gwarantuje reprodukcję 32 FPS? Ułatwia ją, ale potrzebne są zgodne sterowniki, framework, preprocessing i profil danych. Raportuj pełne środowisko.

Kryterium wdrożenia

Ustal minimalną jakość maski i trackingu dla każdej klasy zastosowania, maksymalne p95 latency i zachowanie przy przeciążeniu. System powinien odrzucić lub skierować do człowieka klatkę o niskiej pewności, nie wymuszać wynik. Wersję 3.1 uruchom równolegle z dotychczasowym modelem na zapisanym ruchu i porównaj błędy, zanim stanie się jedyną ścieżką.


Źródła pierwotne: Meta AI — SAM 3.1, Meta SAM 3 codebase.

UDOSTĘPNIJ / KOPIUJ