16 milionów zapytań do Claude: jak wygląda przemysłowy atak destylacyjny
Anthropic opisał 24 tys. kont i 16 mln rozmów. Wyjaśniamy model extraction, sygnały detekcji, limity, watermarking, ryzyka i legalną destylację.
- AUTOR
- Karol Rapacz / CEO Breachroad · OSCP · PNPT
- PUBLIKACJA
- 23 lutego 2026
- CZAS CZYTANIA
- 17 min czytania
- TEMAT
- Bezpieczeństwo AI
23 lutego 2026 roku Anthropic poinformował o wykryciu przemysłowych kampanii ekstrakcji możliwości Claude. Według firmy laboratoria DeepSeek, Moonshot i MiniMax wygenerowały ponad 16 milionów rozmów przez około 24 tysiące fałszywych kont, naruszając warunki usługi i ograniczenia regionalne. Anthropic przedstawił aktywność jako nielegalną destylację konkurencyjną.
Trzeba precyzyjnie rozdzielić fakt od oceny strony sporu. Liczby i atrybucja są twierdzeniami Anthropic opartymi na własnej telemetrii; organizacje nazwane w komunikacie mogą inaczej interpretować aktywność. Technicznie opis jest jednak ważny, bo pokazuje, jak model extraction różni się od zwykłego intensywnego klienta API.
Legalna destylacja a atak
Destylacja jest standardową techniką: silny teacher generuje odpowiedzi lub soft targets, na których uczy się mniejszy student. Laboratorium może destylować własny model, korzystać z licencjonowanych danych albo trenować na syntetyce zgodnie z umową. Problem pojawia się, gdy operator omija limity, tworzy fałszywe konta, narusza warunki i systematycznie odtwarza zdolności cudzej usługi.
Atakujący nie musi kopiować wag. Potrzebuje dużego zbioru starannie zaprojektowanych par prompt–response, szczególnie w obszarach o wysokiej wartości: reasoning, coding, tool use, wielojęzyczność i odmowy. Następnie wykonuje SFT, preference tuning lub reinforcement learning, aby student imitował zachowanie teachera.
Jak wygląda sygnał w telemetrii
Anthropic wskazuje duży wolumen skoncentrowany na kilku zdolnościach, powtarzalne struktury i treść odpowiadającą wartościowym danym treningowym. Pojedynczy request może wyglądać legalnie. Sygnał powstaje dopiero po agregacji kont, płatności, urządzeń, sieci i semantyki zapytań.
Przydatne cechy:
- wiele kont o podobnym cyklu życia i wzorcu doładowań;
- równoległe zapytania o szablonowej strukturze;
- rotacja adresów i regionów przy stałym fingerprintcie klienta;
- regularne pokrywanie macierzy zadań i poziomów trudności;
- brak normalnej interakcji człowieka, korekt i przerw;
- próby uzyskania reasoning traces lub wariantów tej samej odpowiedzi;
- korelacja z limitami i natychmiastowe przenoszenie ruchu na nowe konta.
Rate limit per API key nie wystarcza, jeśli operator kontroluje tysiące kluczy. Potrzebna jest detekcja grafowa i klastrowanie behawioralne z uwzględnieniem false positives — firmy ewaluacyjne i integratorzy mogą legalnie generować duży ruch.
Obrona bez karania dobrych klientów
Pierwsza warstwa to silna tożsamość: weryfikacja płatności, urządzenia, organizacji i regionu proporcjonalna do skali. Druga to limity na poziomie organizacji oraz sygnałów powiązania, nie tylko konta. Trzecia to analiza semantyczna wzorców ekstrakcji i celowane ograniczanie najbardziej wartościowych klas.
Można też stosować:
- canary prompts i kontrolowane warianty odpowiedzi do atrybucji;
- watermarking statystyczny, z ostrożnością wobec parafrazy;
- abuse scoring i step-up verification;
- ograniczenie masowego pobierania logprob/reasoning traces;
- kontrakty i audyt dla klientów o bardzo dużym wolumenie;
- monitoring nowych modeli pod kątem charakterystycznych błędów teachera.
Nie ma jednej niezawodnej sygnatury. Zbyt agresywna blokada utrudni legalne evale, accessibility, batch processing i badania. Decyzje wysokiego wpływu powinny mieć review i ścieżkę odwołania.
Ryzyko dla zwykłej firmy wdrażającej model
Model extraction dotyczy nie tylko frontier labs. Firma fine-tunująca model na unikalnym know-how może ujawnić zachowanie przez publiczny endpoint. Atakujący może odtwarzać klasyfikator cen, antyfraud, rekomendacje albo specjalistyczne odpowiedzi bez kradzieży pliku wag.
Chroń API przez auth, quotas, tenant analytics, wykrywanie enumeracji i minimalizację szczegółowych scoringów. Nie zwracaj wewnętrznych promptów, chain-of-thought ani surowych logitów, jeśli nie są potrzebne. Oddziel system prompt od sekretu: nie jest on bezpiecznym miejscem na klucz ani dane, bo można próbować go wydobyć.
Jak mierzyć odporność
Red team powinien symulować ekstrakcję z limitem budżetu: systematyczne pytania, warianty semantyczne, wiele kont testowych i próby model stealing. Mierz liczbę zapytań do odtworzenia jakości na wybranym tasku, czas wykrycia, skuteczność klastrowania i wpływ kontroli na legalnych klientów.
Telemetria, która odróżnia batch od ekstrakcji
Sam wysoki wolumen jest słabym sygnałem. Profil powinien łączyć tempo, pokrycie tematów, podobieństwo szablonów, rozkład długości, systematyczne warianty tych samych problemów oraz powiązania kont, płatności i urządzeń. Legalny klient batchowy zwykle ma stabilny workload i potrafi wyjaśnić cel; kampania ekstrakcyjna dąży do szerokiego pokrycia granic zachowania modelu. Analizę należy prowadzić na poziomie organizacji i klastra, z minimalizacją danych oraz kontrolą dostępu do telemetrii.
Reakcja powinna być stopniowana: obserwacja, ograniczenie przepustowości, step-up verification, odcięcie wybranych klas zapytań i dopiero blokada. Każdy próg trzeba przetestować na ruchu legalnym. Fałszywie dodatni detektor, który przerywa produkcyjny batch klienta, jest również incydentem.
Ćwiczenie tabletop dla właściciela modelu
Załóż, że konkurencyjny model nagle powtarza charakterystyczne odpowiedzi twojego endpointu. Zespół powinien umieć zabezpieczyć logi, odtworzyć zakres zapytań, ocenić naruszenie umowy, ograniczyć aktywne konta i zachować materiał dla zespołu prawnego. Przygotuj wcześniej właścicieli decyzji, progi eskalacji i możliwość rotacji canary patterns. Obrona przed destylacją łączy security engineering, fraud, privacy i egzekwowanie warunków usługi.
Połącz ochronę z model theft i membership inference, LLM gateway i red teamingiem AI. Jeżeli udostępniasz model przez API, BreachRoad może ocenić odporność na ekstrakcję i nadużycia.
Źródło pierwotne i perspektywa jednej strony: Anthropic — Detecting and preventing distillation attacks.


