Przejdź do treści
INDEKS ANALIZ BREACHROAD / NOTA TECHNICZNA

Fable 5: jak działają klasyfikatory cyberbezpieczeństwa

Fable 5 używa osobnych zabezpieczeń dla zadań cyber. Analizujemy cztery klasy użycia, safety margin, false positives i testy legalnych workflow.

MATERIAŁ PUBLICZNY
AUTOR
/ Pentester (OSCP, PNPT)
PUBLIKACJA
24 czerwca 2026
CZAS CZYTANIA
11 min czytania
TEMAT
Bezpieczeństwo AI
Fable 5: jak działają klasyfikatory cyberbezpieczeństwa

Fable 5 jest publiczną konfiguracją najnowszego modelu Anthropic z dodatkowymi zabezpieczeniami dla dziedzin wysokiego ryzyka, w tym cyberbezpieczeństwa. Anthropic deklaruje, że klasyfikatory działające obok modelu analizują żądania i blokują niektóre zadania, a w części przypadków odpowiedź może zostać obsłużona przez Opus 4.8.

To ważne rozróżnienie: capability modelu i dostępna użytkownikowi capability systemu nie są tym samym.

Cztery kategorie użycia cyber

Anthropic opisuje cztery klasy:

  • prohibited use — wysoki potencjał szkody i niewielka wartość obronna; blokada;
  • high-risk dual use — techniki szeroko używane przez atakujących, ale mające legalne zastosowania; blokada;
  • low-risk dual use — działania głównie obronne, które mogą pomóc atakującemu; monitoring i czasami blokada;
  • benign use — działania nieszkodliwe; zezwolenie z monitoringiem.

Granica nie przebiega wyłącznie po nazwie narzędzia. Skanowanie własnego repozytorium i masowe wyszukiwanie podatnych celów mogą używać podobnego kodu, ale różnią się autoryzacją, skalą i skutkiem.

Safety margin i false positives

Fable 5 stosuje konserwatywny margines: część legalnych zadań niskiego ryzyka może zostać zatrzymana, aby utrudnić przejście do poważnego nadużycia. Anthropic podał przy premierze, że zabezpieczenia uruchamiały się średnio w mniej niż 5% sesji, ale nie jest to gwarancja dla konkretnego workflow cyber.

Zespół nie powinien omijać odmowy przez dzielenie zadania na ukryte kroki. Najpierw trzeba poprawić kontekst autoryzacji, zmniejszyć zakres i sprawdzić, czy żądanie faktycznie jest zgodne z polityką.

Jak opisać legalny pentest

Prompt nie jest dokumentem autoryzacji, ale jasny kontekst pomaga klasyfikatorowi:

  • owner celu i zakres;
  • środowisko laboratoryjne lub identyfikator projektu;
  • dozwolone domeny, hosty i techniki;
  • zakaz trwałości, destrukcji oraz exfiltracji;
  • oczekiwany artefakt obronny;
  • człowiek zatwierdzający działania wysokiego ryzyka.

Nie podawaj prawdziwych sekretów. Narzędzia powinny same egzekwować scope; model nie może rozszerzyć go tekstem.

Klasyfikator nie zastępuje polityki narzędzia

Nawet poprawna odpowiedź Fable 5 może zostać użyta w złym kontekście. Kontrola na wejściu/wyjściu modelu nie wie wszystkiego o docelowym zasobie. Dlatego executor musi walidować hostname, tenant, metodę, limit, czas i tożsamość.

Dla zadań takich jak skan, exploit validation czy fuzzing używaj środowiska izolowanego oraz syntetycznych danych. Wynik weryfikuj zanim trafi do pipeline’u.

Testowanie zabezpieczeń bez ich obchodzenia

Legalny red team modelu powinien oceniać:

  1. czy jawnie szkodliwe zadania są blokowane;
  2. czy benign i low-risk defensive workflow pozostają użyteczne;
  3. czy zmiana języka lub kodowania nie omija decyzji;
  4. czy wieloetapowe narzędzia nie składają osobno dozwolonych kroków w szkodliwą całość;
  5. czy odmowa nie ujawnia niebezpiecznego fragmentu;
  6. czy logi pozwalają odtworzyć decyzję.

Wynik oceniaj razem z wpływem, powtarzalnością i dostępnością istniejących narzędzi. Anthropic proponuje do tego skalę CJS, opisaną w naszym newsie o Fable 5.

Fable 5 i Mythos 5

System card opisuje dwie konfiguracje tego samego modelu bazowego. Fable 5 jest przeznaczony do ogólnego użycia z dodatkowymi safeguards. Mythos 5 udostępnia większy zakres capabilities niewielkiej liczbie zaufanych partnerów, zaczynając od Project Glasswing.

Nie należy interpretować wyniku Mythos jako możliwości dostępnej bezpośrednio w Fable. Różnica zabezpieczeń jest elementem produktu.

Wniosek dla zespołów bezpieczeństwa

Klasyfikatory Fable 5 są dodatkową warstwą kontroli, nie zezwoleniem na autonomiczny pentest. Bezpieczny system nadal potrzebuje allowlisty celów, krótkotrwałych tożsamości, sandboxa, limitów, audytu i zatwierdzania skutków.


Co producent faktycznie deklaruje

Anthropic opisuje cztery kategorie użycia cyber: zabronione, wysokiego ryzyka dual-use, niskiego ryzyka dual-use i łagodne. Dla Fable 5 klasyfikatory mają blokować pierwsze dwie, monitorować lub czasem blokować trzecią i dopuszczać czwartą z monitoringiem. Firma zaznacza możliwość false positive oraz zmian zachowania wraz z doświadczeniem produkcyjnym.

To polityka usługi, nie kontrola autoryzacji pentestu. Organizacja nadal musi ograniczać narzędzia, sieć, sekrety i dane oraz weryfikować zgodę na test. Mierz odrzucone prawidłowe zadania, przepuszczone przypadki ryzykowne i zachowanie po parafrazie. Jailbreak oceniaj według rzeczywistego przyrostu zdolności i możliwości wykorzystania, a nie samego ujawnienia promptu systemowego.

Źródła: Anthropic — Fable 5 cyber safeguards, Fable 5 and Mythos 5 System Card, Anthropic — Fable 5 and Mythos 5.

UDOSTĘPNIJ / KOPIUJ