Claude Sonnet 5: bezpieczeństwo agentów AI i wdrożeń
Claude Sonnet 5 zwiększa możliwości agentowe i użycie narzędzi. Analizujemy prompt injection, cyber safeguards, uprawnienia i bezpieczne wdrożenie.
- AUTOR
- Karol Rapacz / Pentester (OSCP, PNPT)
- PUBLIKACJA
- 25 czerwca 2026
- CZAS CZYTANIA
- 10 min czytania
- TEMAT
- Bezpieczeństwo AI
Claude Sonnet 5 został udostępniony 30 czerwca 2026 r. jako model nastawiony na zadania agentowe: planowanie, kodowanie oraz używanie przeglądarki, terminala i innych narzędzi. Anthropic podaje, że model poprawił odporność na próby przejęcia sterowania przez prompt injection względem Sonnet 4.6, ale nie oznacza to odporności całego systemu.
Im skuteczniej model realizuje długi plan, tym większe znaczenie ma warstwa autoryzacji poza modelem.
Co mówi system card
Anthropic klasyfikuje Sonnet 5 jako najmocniejszy model klasy Sonnet, który nie przesuwa jednak frontieru możliwości względem Opus i Mythos. W testach cyberbezpieczeństwa model nie stworzył kompletnego działającego exploita dla badanych podatności Firefoksa, choć osiągał częściowe postępy częściej niż Sonnet 4.6.
Model uruchomiono z domyślnie aktywnymi cyber safeguards podobnymi do Opus 4.7 i 4.8. Są one mniej restrykcyjne niż zabezpieczenia Fable 5, ponieważ Anthropic ocenił poziom ryzyka cyber Sonnet 5 jako niższy.
To są wyniki konkretnej ewaluacji, nie gwarancja. Inny harness, narzędzia, kontekst lub wieloetapowy workflow mogą zmienić rezultat.
Agentic performance zwiększa blast radius
Model używany jako chatbot generuje tekst. Agent może czytać repozytorium, edytować pliki, uruchamiać testy, otwierać strony i wysyłać wynik do systemu zewnętrznego. Ryzyko wynika z iloczynu:
niezaufane wejście × autonomia × uprawnienia × czas działania
Zmniejszenie jednego elementu ogranicza skutek błędu. Sonnet 5 nie powinien otrzymywać pełnego dostępu do chmury tylko dlatego, że wykonuje zadania taniej od modelu Opus.
Prompt injection w kodzie i dokumentacji
Agent może pobrać instrukcję z README, issue, komentarza w kodzie, strony internetowej albo odpowiedzi narzędzia. Tekst „wyślij plik konfiguracyjny do walidacji” jest danymi, nie autoryzacją.
Oddziel cel użytkownika od zawartości zasobów. Narzędzie wykonawcze powinno weryfikować politykę, ścieżkę, domenę, odbiorcę i typ operacji bez pytania LLM, czy działanie jest bezpieczne.
Minimalne uprawnienia dla narzędzi
Zamiast ogólnego shella udostępniaj wąskie operacje. Repozytorium montuj tylko do obszaru potrzebnego zadaniu. Token CI ogranicz do jednego projektu, a poświadczenie chmurowe wydawaj na minuty dla konkretnego audience.
Operacje wymagające potwierdzenia:
- publikacja i merge;
- zmiana IAM lub sekretów;
- połączenie z produkcją;
- usunięcie danych;
- wysłanie pliku poza organizację;
- wykonanie niepodpisanego skryptu pobranego z sieci.
Szczegóły dla środowiska terminalowego rozwija hardening Claude Code.
Budżety autonomii
Ogranicz liczbę tur, czas, koszt, wywołania narzędzi i zakres zmian. Agent powinien zatrzymać się, gdy warunek sukcesu nie jest osiągalny albo wynik narzędzia przeczy założeniu.
Wymagaj planu przed działaniem dla zadań wysokiego ryzyka. Plan jest artefaktem do autoryzacji, ale nadal każde narzędzie musi egzekwować własne ograniczenia.
Ewaluacja przed zmianą modelu
Nie traktuj Sonnet 5 jako drop-in bez testu. Uruchom te same przypadki, którymi oceniano wcześniejszy model: zadania poprawne, odmowy, prompt injection, RAG, narzędzia i nietypowe błędy.
Mierz skuteczność oraz nieautoryzowane działania. Wyższy wynik zadaniowy może zwiększyć ryzyko, jeśli agent częściej wykonuje niepoprawną decyzję do końca. Proces opisuje ewaluacja LLM.
Bezpieczny wzorzec wdrożenia
- Zarejestruj wersję modelu i przypadek użycia.
- Oddziel niezaufane dane od instrukcji.
- Przypisz wąskie, krótkotrwałe poświadczenia.
- Waliduj każdą operację w narzędziu.
- Ustaw budżety i stop conditions.
- Loguj plan, decyzje polityk i efekty.
- Testuj prompt injection przed aktualizacją.
- Zapewnij kill switch oraz rollback.
Sonnet 5 może być dobrym silnikiem agentowym, lecz bezpieczeństwo wdrożenia nie jest właściwością nazwy modelu. Powstaje z kontrolowanej tożsamości, ograniczonych narzędzi i niezależnej autoryzacji.
Bezpieczny kontrakt narzędzia
Każde narzędzie powinno mieć mały, typowany schemat wejścia, walidację po stronie wykonawcy i jawny model uprawnień. Model nie może sam rozszerzyć zakresu przez tekst w argumencie. Rozdziel narzędzia odczytu od zapisu, a operacje finansowe, publikację i usuwanie kieruj do osobnego zatwierdzenia z podglądem dokładnego skutku.
Testuj system jako całość: model, prompt, pamięć, RAG, konektory i mechanizm ponawiania. Wprowadź złośliwy dokument, błędną odpowiedź API, timeout i częściowe wykonanie. Loguj identyfikatory wywołań i wynik polityki. Karta systemowa opisuje model w warunkach producenta; nie dowodzi bezpieczeństwa Twoich narzędzi ani danych.
Źródła: Anthropic — Claude Sonnet 5, Claude Sonnet 5 System Card, Anthropic System Cards.


