Przejdź do treści
INDEKS ANALIZ BREACHROAD / NOTA TECHNICZNA

GPT-5.5: 82,7% Terminal-Bench i nowy próg zdolności cyber

Techniczna analiza GPT-5.5: agentic coding, 82,7% Terminal-Bench 2.0, 58,6% SWE-Bench Pro, computer use, GB200/GB300 i safeguards High.

MATERIAŁ PUBLICZNY
AUTOR
/ CEO Breachroad · OSCP · PNPT
PUBLIKACJA
23 kwietnia 2026
CZAS CZYTANIA
17 min czytania
TEMAT
Bezpieczeństwo AI
GPT-5.5: 82,7% Terminal-Bench i nowy próg zdolności cyber

23 kwietnia 2026 roku OpenAI wprowadziło GPT-5.5, model skoncentrowany na długich zadaniach agentowych, kodzie, pracy z komputerem i badaniach. Producent raportował 82,7% na Terminal-Bench 2.0, 58,6% na SWE-Bench Pro, 84,9% na GDPval i 78,7% na OSWorld-Verified. 24 kwietnia model i wariant Pro trafiły również do API.

Wyniki wskazują kierunek, ale nie są uniwersalnym rankingiem. OpenAI opisuje własny harness, ustawienia reasoning, narzędzia i sposób liczenia czasu. Najbardziej praktyczna zmiana to większa zdolność utrzymania zadania, sprawdzania pracy i poruszania się między narzędziami przy mniejszej liczbie retry.

Agentic coding: od patcha do pętli inżynierskiej

Terminal-Bench mierzy zadania terminalowe wymagające planowania, iteracji i koordynacji narzędzi. SWE-Bench Pro sprawdza rozwiązywanie issue w repozytoriach. Model o dobrym wyniku może czytać kod, postawić hipotezę, zmienić wiele plików, uruchomić testy i poprawić błąd. Nie oznacza to, że każdy wygenerowany patch jest bezpieczny.

Zespół powinien mierzyć:

  • pass rate na własnych issue i first-pass CI;
  • regresje i security findings na 100 zmian;
  • liczbę tool calls oraz koszt poprawnego zadania;
  • czas review i odsetek kodu przepisanego przez człowieka;
  • zachowanie przy niejednoznacznym scope;
  • reakcję na złośliwe instrukcje w repozytorium.

Silniejsza autonomia zwiększa zarówno produktywność, jak i koszt błędnej zgody na działanie.

Computer use i praca wiedzy

GPT-5.5 ma lepiej używać interfejsów, dokumentów, arkuszy i prezentacji. OSWorld-Verified ocenia operowanie środowiskiem komputerowym, ale produkcyjny desktop zawiera pocztę, hasła, systemy finansowe i dane klientów. Agent nie powinien dziedziczyć pełnej sesji użytkownika.

Uruchamiaj computer use w oddzielnym profilu lub VM, z allowlistą aplikacji i domen, bez password managera oraz z blokadą operacji finansowych i wysyłki. Screenshot i UI są niezaufanym wejściem: prompt injection może być częścią strony.

Co zmieniło się w inferencji

OpenAI podało, że GPT-5.5 był współprojektowany i serwowany na NVIDIA GB200 i GB300 NVL72. Analiza ruchu i heurystyki partycjonowania napisane z pomocą Codex miały zwiększyć generowanie tokenów o ponad 20%. To wynik wewnętrzny producenta, ale pokazuje, że wydajność frontier modelu powstaje na styku architektury, kompilacji, schedulerów i realnego workloadu.

Koszt systemu zależy od cache, długości, reasoning effort, narzędzi i liczby prób. Kalkulator powinien liczyć całe zadanie, nie tylko cennik per token.

Cybersecurity: próg High, nie Critical

OpenAI traktuje zdolności GPT-5.5 w cyber oraz biological/chemical jako High w Preparedness Framework. Model nie osiągnął progu Critical w cyber, ale przewyższył GPT-5.4. Firma wdrożyła targeted evaluations, red teaming, safeguardy i ścieżkę trusted access dla zweryfikowanej obrony.

To ważny sygnał governance. Model może coraz skuteczniej znajdować i naprawiać podatności, a także obniżać koszt niektórych ofensywnych zadań. Organizacja powinna różnicować dostęp według roli, logować narzędzia, ograniczać target scope i monitorować próby omijania zabezpieczeń. Sam filtr treści nie kontroluje agenta z shellem.

Wdrożenie z kontrolą skutków

Stwórz policy matrix dla klas zadań: read, edit, execute, network, deploy i high-risk cyber. Każda ma inne narzędzia, credentiale i approval. Model nie może sam zwiększyć własnych scopes. Testy, SAST, secret scanning i review działają jako niezależne bramki.

W systemie wieloagentowym ogranicz fan-out, budżet i wspólną pamięć. Weryfikator końcowy powinien widzieć diff, testy, źródła i listę akcji. Dla researchu wymagaj cytatów i rozróżnienia źródła od wnioskowania.

Separacja zastosowań cyber

Asystent defensywny analizujący logi nie potrzebuje tych samych narzędzi co agent w autoryzowanym laboratorium. Zdefiniuj profile: triage tylko do odczytu, remediation tworzący patch, walidator uruchamiający testy i operator wykonujący zmianę po akceptacji. Dla pracy ofensywnej wymagaj jawnego target scope, terminu autoryzacji, limitów sieciowych i rejestracji komend. Endpoint nieobjęty zakresem musi być blokowany przez warstwę wykonawczą, nie przez uprzejmą instrukcję w prompcie.

Wyniki modelu traktuj jako hipotezy. Znalezioną podatność potwierdza minimalny, bezpieczny test i review człowieka; regułę detekcji sprawdza się na danych pozytywnych i negatywnych; poprawkę ocenia test regresyjny. Nie publikuj automatycznie zgłoszeń CVE ani raportów do dostawców bez walidacji wpływu i wersji.

Sygnały do monitorowania

Alarmy powinny obejmować skanowanie poza scope, próby odczytu sekretów, kodowanie lub fragmentację payloadów, nietypowy wzrost poleceń shell, wyłączenie zabezpieczeń i wielokrotne omijanie approval. Zachowuj identyfikator sesji, model, narzędzie, skrót argumentów oraz rezultat. Treść wrażliwą redaguj, ale pozostaw wystarczający dowód do odtworzenia incydentu. Wysokie zdolności modelu mają wartość dopiero wtedy, gdy skutki jego pomyłki są ograniczone.

Połącz rollout z red teamingiem agentów, bezpieczeństwem kodujących agentów oraz obserwowalnością. W sprawie evali i zabezpieczeń dla kodu lub cyber skontaktuj się z BreachRoad.


Źródła pierwotne: OpenAI — Introducing GPT-5.5, GPT-5.5 System Card.

UDOSTĘPNIJ / KOPIUJ