Przejdź do treści
INDEKS ANALIZ BREACHROAD / NOTA TECHNICZNA

16 milionów zapytań do Claude: jak wygląda przemysłowy atak destylacyjny

Anthropic opisał 24 tys. kont i 16 mln rozmów. Wyjaśniamy model extraction, sygnały detekcji, limity, watermarking, ryzyka i legalną destylację.

MATERIAŁ PUBLICZNY
AUTOR
/ CEO Breachroad · OSCP · PNPT
PUBLIKACJA
23 lutego 2026
CZAS CZYTANIA
17 min czytania
TEMAT
Bezpieczeństwo AI
16 milionów zapytań do Claude: jak wygląda przemysłowy atak destylacyjny

23 lutego 2026 roku Anthropic poinformował o wykryciu przemysłowych kampanii ekstrakcji możliwości Claude. Według firmy laboratoria DeepSeek, Moonshot i MiniMax wygenerowały ponad 16 milionów rozmów przez około 24 tysiące fałszywych kont, naruszając warunki usługi i ograniczenia regionalne. Anthropic przedstawił aktywność jako nielegalną destylację konkurencyjną.

Trzeba precyzyjnie rozdzielić fakt od oceny strony sporu. Liczby i atrybucja są twierdzeniami Anthropic opartymi na własnej telemetrii; organizacje nazwane w komunikacie mogą inaczej interpretować aktywność. Technicznie opis jest jednak ważny, bo pokazuje, jak model extraction różni się od zwykłego intensywnego klienta API.

Legalna destylacja a atak

Destylacja jest standardową techniką: silny teacher generuje odpowiedzi lub soft targets, na których uczy się mniejszy student. Laboratorium może destylować własny model, korzystać z licencjonowanych danych albo trenować na syntetyce zgodnie z umową. Problem pojawia się, gdy operator omija limity, tworzy fałszywe konta, narusza warunki i systematycznie odtwarza zdolności cudzej usługi.

Atakujący nie musi kopiować wag. Potrzebuje dużego zbioru starannie zaprojektowanych par prompt–response, szczególnie w obszarach o wysokiej wartości: reasoning, coding, tool use, wielojęzyczność i odmowy. Następnie wykonuje SFT, preference tuning lub reinforcement learning, aby student imitował zachowanie teachera.

Jak wygląda sygnał w telemetrii

Anthropic wskazuje duży wolumen skoncentrowany na kilku zdolnościach, powtarzalne struktury i treść odpowiadającą wartościowym danym treningowym. Pojedynczy request może wyglądać legalnie. Sygnał powstaje dopiero po agregacji kont, płatności, urządzeń, sieci i semantyki zapytań.

Przydatne cechy:

  • wiele kont o podobnym cyklu życia i wzorcu doładowań;
  • równoległe zapytania o szablonowej strukturze;
  • rotacja adresów i regionów przy stałym fingerprintcie klienta;
  • regularne pokrywanie macierzy zadań i poziomów trudności;
  • brak normalnej interakcji człowieka, korekt i przerw;
  • próby uzyskania reasoning traces lub wariantów tej samej odpowiedzi;
  • korelacja z limitami i natychmiastowe przenoszenie ruchu na nowe konta.

Rate limit per API key nie wystarcza, jeśli operator kontroluje tysiące kluczy. Potrzebna jest detekcja grafowa i klastrowanie behawioralne z uwzględnieniem false positives — firmy ewaluacyjne i integratorzy mogą legalnie generować duży ruch.

Obrona bez karania dobrych klientów

Pierwsza warstwa to silna tożsamość: weryfikacja płatności, urządzenia, organizacji i regionu proporcjonalna do skali. Druga to limity na poziomie organizacji oraz sygnałów powiązania, nie tylko konta. Trzecia to analiza semantyczna wzorców ekstrakcji i celowane ograniczanie najbardziej wartościowych klas.

Można też stosować:

  • canary prompts i kontrolowane warianty odpowiedzi do atrybucji;
  • watermarking statystyczny, z ostrożnością wobec parafrazy;
  • abuse scoring i step-up verification;
  • ograniczenie masowego pobierania logprob/reasoning traces;
  • kontrakty i audyt dla klientów o bardzo dużym wolumenie;
  • monitoring nowych modeli pod kątem charakterystycznych błędów teachera.

Nie ma jednej niezawodnej sygnatury. Zbyt agresywna blokada utrudni legalne evale, accessibility, batch processing i badania. Decyzje wysokiego wpływu powinny mieć review i ścieżkę odwołania.

Ryzyko dla zwykłej firmy wdrażającej model

Model extraction dotyczy nie tylko frontier labs. Firma fine-tunująca model na unikalnym know-how może ujawnić zachowanie przez publiczny endpoint. Atakujący może odtwarzać klasyfikator cen, antyfraud, rekomendacje albo specjalistyczne odpowiedzi bez kradzieży pliku wag.

Chroń API przez auth, quotas, tenant analytics, wykrywanie enumeracji i minimalizację szczegółowych scoringów. Nie zwracaj wewnętrznych promptów, chain-of-thought ani surowych logitów, jeśli nie są potrzebne. Oddziel system prompt od sekretu: nie jest on bezpiecznym miejscem na klucz ani dane, bo można próbować go wydobyć.

Jak mierzyć odporność

Red team powinien symulować ekstrakcję z limitem budżetu: systematyczne pytania, warianty semantyczne, wiele kont testowych i próby model stealing. Mierz liczbę zapytań do odtworzenia jakości na wybranym tasku, czas wykrycia, skuteczność klastrowania i wpływ kontroli na legalnych klientów.

Telemetria, która odróżnia batch od ekstrakcji

Sam wysoki wolumen jest słabym sygnałem. Profil powinien łączyć tempo, pokrycie tematów, podobieństwo szablonów, rozkład długości, systematyczne warianty tych samych problemów oraz powiązania kont, płatności i urządzeń. Legalny klient batchowy zwykle ma stabilny workload i potrafi wyjaśnić cel; kampania ekstrakcyjna dąży do szerokiego pokrycia granic zachowania modelu. Analizę należy prowadzić na poziomie organizacji i klastra, z minimalizacją danych oraz kontrolą dostępu do telemetrii.

Reakcja powinna być stopniowana: obserwacja, ograniczenie przepustowości, step-up verification, odcięcie wybranych klas zapytań i dopiero blokada. Każdy próg trzeba przetestować na ruchu legalnym. Fałszywie dodatni detektor, który przerywa produkcyjny batch klienta, jest również incydentem.

Ćwiczenie tabletop dla właściciela modelu

Załóż, że konkurencyjny model nagle powtarza charakterystyczne odpowiedzi twojego endpointu. Zespół powinien umieć zabezpieczyć logi, odtworzyć zakres zapytań, ocenić naruszenie umowy, ograniczyć aktywne konta i zachować materiał dla zespołu prawnego. Przygotuj wcześniej właścicieli decyzji, progi eskalacji i możliwość rotacji canary patterns. Obrona przed destylacją łączy security engineering, fraud, privacy i egzekwowanie warunków usługi.

Połącz ochronę z model theft i membership inference, LLM gateway i red teamingiem AI. Jeżeli udostępniasz model przez API, BreachRoad może ocenić odporność na ekstrakcję i nadużycia.


Źródło pierwotne i perspektywa jednej strony: Anthropic — Detecting and preventing distillation attacks.

UDOSTĘPNIJ / KOPIUJ