Fable 5: jak działają klasyfikatory cyberbezpieczeństwa
Fable 5 używa osobnych zabezpieczeń dla zadań cyber. Analizujemy cztery klasy użycia, safety margin, false positives i testy legalnych workflow.
- AUTOR
- Karol Rapacz / Pentester (OSCP, PNPT)
- PUBLIKACJA
- 24 czerwca 2026
- CZAS CZYTANIA
- 11 min czytania
- TEMAT
- Bezpieczeństwo AI
Fable 5 jest publiczną konfiguracją najnowszego modelu Anthropic z dodatkowymi zabezpieczeniami dla dziedzin wysokiego ryzyka, w tym cyberbezpieczeństwa. Anthropic deklaruje, że klasyfikatory działające obok modelu analizują żądania i blokują niektóre zadania, a w części przypadków odpowiedź może zostać obsłużona przez Opus 4.8.
To ważne rozróżnienie: capability modelu i dostępna użytkownikowi capability systemu nie są tym samym.
Cztery kategorie użycia cyber
Anthropic opisuje cztery klasy:
- prohibited use — wysoki potencjał szkody i niewielka wartość obronna; blokada;
- high-risk dual use — techniki szeroko używane przez atakujących, ale mające legalne zastosowania; blokada;
- low-risk dual use — działania głównie obronne, które mogą pomóc atakującemu; monitoring i czasami blokada;
- benign use — działania nieszkodliwe; zezwolenie z monitoringiem.
Granica nie przebiega wyłącznie po nazwie narzędzia. Skanowanie własnego repozytorium i masowe wyszukiwanie podatnych celów mogą używać podobnego kodu, ale różnią się autoryzacją, skalą i skutkiem.
Safety margin i false positives
Fable 5 stosuje konserwatywny margines: część legalnych zadań niskiego ryzyka może zostać zatrzymana, aby utrudnić przejście do poważnego nadużycia. Anthropic podał przy premierze, że zabezpieczenia uruchamiały się średnio w mniej niż 5% sesji, ale nie jest to gwarancja dla konkretnego workflow cyber.
Zespół nie powinien omijać odmowy przez dzielenie zadania na ukryte kroki. Najpierw trzeba poprawić kontekst autoryzacji, zmniejszyć zakres i sprawdzić, czy żądanie faktycznie jest zgodne z polityką.
Jak opisać legalny pentest
Prompt nie jest dokumentem autoryzacji, ale jasny kontekst pomaga klasyfikatorowi:
- owner celu i zakres;
- środowisko laboratoryjne lub identyfikator projektu;
- dozwolone domeny, hosty i techniki;
- zakaz trwałości, destrukcji oraz exfiltracji;
- oczekiwany artefakt obronny;
- człowiek zatwierdzający działania wysokiego ryzyka.
Nie podawaj prawdziwych sekretów. Narzędzia powinny same egzekwować scope; model nie może rozszerzyć go tekstem.
Klasyfikator nie zastępuje polityki narzędzia
Nawet poprawna odpowiedź Fable 5 może zostać użyta w złym kontekście. Kontrola na wejściu/wyjściu modelu nie wie wszystkiego o docelowym zasobie. Dlatego executor musi walidować hostname, tenant, metodę, limit, czas i tożsamość.
Dla zadań takich jak skan, exploit validation czy fuzzing używaj środowiska izolowanego oraz syntetycznych danych. Wynik weryfikuj zanim trafi do pipeline’u.
Testowanie zabezpieczeń bez ich obchodzenia
Legalny red team modelu powinien oceniać:
- czy jawnie szkodliwe zadania są blokowane;
- czy benign i low-risk defensive workflow pozostają użyteczne;
- czy zmiana języka lub kodowania nie omija decyzji;
- czy wieloetapowe narzędzia nie składają osobno dozwolonych kroków w szkodliwą całość;
- czy odmowa nie ujawnia niebezpiecznego fragmentu;
- czy logi pozwalają odtworzyć decyzję.
Wynik oceniaj razem z wpływem, powtarzalnością i dostępnością istniejących narzędzi. Anthropic proponuje do tego skalę CJS, opisaną w naszym newsie o Fable 5.
Fable 5 i Mythos 5
System card opisuje dwie konfiguracje tego samego modelu bazowego. Fable 5 jest przeznaczony do ogólnego użycia z dodatkowymi safeguards. Mythos 5 udostępnia większy zakres capabilities niewielkiej liczbie zaufanych partnerów, zaczynając od Project Glasswing.
Nie należy interpretować wyniku Mythos jako możliwości dostępnej bezpośrednio w Fable. Różnica zabezpieczeń jest elementem produktu.
Wniosek dla zespołów bezpieczeństwa
Klasyfikatory Fable 5 są dodatkową warstwą kontroli, nie zezwoleniem na autonomiczny pentest. Bezpieczny system nadal potrzebuje allowlisty celów, krótkotrwałych tożsamości, sandboxa, limitów, audytu i zatwierdzania skutków.
Co producent faktycznie deklaruje
Anthropic opisuje cztery kategorie użycia cyber: zabronione, wysokiego ryzyka dual-use, niskiego ryzyka dual-use i łagodne. Dla Fable 5 klasyfikatory mają blokować pierwsze dwie, monitorować lub czasem blokować trzecią i dopuszczać czwartą z monitoringiem. Firma zaznacza możliwość false positive oraz zmian zachowania wraz z doświadczeniem produkcyjnym.
To polityka usługi, nie kontrola autoryzacji pentestu. Organizacja nadal musi ograniczać narzędzia, sieć, sekrety i dane oraz weryfikować zgodę na test. Mierz odrzucone prawidłowe zadania, przepuszczone przypadki ryzykowne i zachowanie po parafrazie. Jailbreak oceniaj według rzeczywistego przyrostu zdolności i możliwości wykorzystania, a nie samego ujawnienia promptu systemowego.
Źródła: Anthropic — Fable 5 cyber safeguards, Fable 5 and Mythos 5 System Card, Anthropic — Fable 5 and Mythos 5.


