Instrukcje i dane
Sprawdzamy granice między zaufanym sterowaniem i niezaufaną treścią.
- Direct i indirect prompt injection
- RAG poisoning i cross-tenant retrieval
- Ekstrakcja promptów, danych oraz sekretów
Testujemy nie tylko odpowiedź modelu, lecz cały system: dane, narzędzia, uprawnienia, pamięć, orkiestrację i skutki wykonywanych działań.
Nie każda niepożądana odpowiedź jest podatnością. Priorytetem jest osiągnięta zdolność: dostęp do cudzych danych, wykonanie operacji, obejście polityki lub trwała zmiana zachowania systemu.
Sprawdzamy granice między zaufanym sterowaniem i niezaufaną treścią.
Oceniamy, co system może zrobić, a nie tylko co może powiedzieć.
Testujemy zachowanie w czasie i przy awarii zależności.
Ustalamy aktywa, role, źródła niezaufanej treści i nieakceptowalne skutki.
Budujemy powtarzalne scenariusze normalne, graniczne, wrogie oraz awaryjne.
Łączymy ręczne testy, automatyzację i analizę aplikacji otaczającej model.
Raportujemy rzeczywisty skutek, wymagane warunki i kontrolę, która powinna zatrzymać atak.
Sama zmiana odpowiedzi modelu ma niższy priorytet niż potwierdzona operacja wykonana z jego uprawnieniami.
Model wyjaśnia format raportu. Nie jest historią wdrożenia klienta.
Agent pobiera dokument zawierający niezaufaną instrukcję
Orkiestrator nie rozdziela danych od poleceń sterujących
Model wybiera narzędzie z uprawnieniem zapisu
Naprawa wymaga policy enforcement poza modelem i potwierdzenia operacji
Możemy oceniać zachowanie modelu, ale najczęściej największe ryzyko leży w aplikacji, danych i narzędziach. Zakres obejmuje cały przepływ, jeśli mamy do niego dostęp.
Nie. Oceniamy skutek, powtarzalność i kontekst. Zmiana stylu odpowiedzi ma inne znaczenie niż odczyt danych innego klienta lub wykonanie operacji.
Tak, gdy architektura pozwala je bezpiecznie zautomatyzować. Scenariusze są wersjonowane razem z modelem, promptem, narzędziami i kryteriami.
Zmapujemy granice zaufania i zaprojektujemy testy odpowiadające realnym skutkom biznesowym.