Przejdź do treści
INDEKS ANALIZ BREACHROAD / NOTA TECHNICZNA

Qwen3.5: 397B-A17B, Gated DeltaNet i multimodalni agenci open weight

Techniczna analiza Qwen3.5: 397B-A17B MoE, native vision-language, hybrid attention, 201 języków, rodzina modeli i bezpieczny self-hosting.

MATERIAŁ PUBLICZNY
AUTOR
/ CEO Breachroad · OSCP · PNPT
PUBLIKACJA
16 lutego 2026
CZAS CZYTANIA
16 min czytania
TEMAT
Bezpieczeństwo AI
Qwen3.5: 397B-A17B, Gated DeltaNet i multimodalni agenci open weight

16 lutego 2026 roku zespół Qwen udostępnił Qwen3.5, zaczynając od modelu MoE 397B-A17B. W kolejnych dniach pojawiły się 122B-A10B, 35B-A3B, 27B oraz mniejsze warianty 9B, 4B, 2B i 0.8B. Rodzina łączy natywny vision-language, hybrydową architekturę z Gated Delta Networks, sparse MoE i otwarte wagi na licencji Apache 2.0.

„397B-A17B” oznacza około 397 mld parametrów łącznie i 17 mld aktywnych przy tokenie. Takie nazewnictwo jest ważne w planowaniu: pamięć na wagi zależy od total, a obliczenia kroku w dużej mierze od active — wraz z kosztem routera, uwagi i komunikacji.

Hybrydowa uwaga i multimodalność

Dokumentacja Qwen opisuje połączenie Gated Delta Networks z okresową pełną uwagą. Liniowy mechanizm zmniejsza koszt długiej sekwencji, a attention zachowuje zdolność precyzyjnego odnoszenia odległych elementów. To kompromis architektoniczny, nie darmowy kontekst: wydajność zależy od kerneli, batchingu, długości i rodzaju modelu.

Qwen3.5 trenowano early-fusion na bilionach tokenów multimodalnych. Jeden model ma analizować tekst, obrazy i wideo, wykonywać reasoning, kodować i używać narzędzi. Zespół deklaruje wsparcie 201 języków i dialektów. Dla polskiej organizacji to hipoteza do testu na własnych dokumentach, fleksji, terminologii prawnej i kodzie, nie obietnica jakości równej angielskiemu.

Rodzina zamiast jednego checkpointu

Duży 397B-A17B celuje w maksymalną jakość przy rozproszonym serwowaniu. 122B-A10B i 35B-A3B obniżają koszt aktywacji, 27B daje prostszą dense ścieżkę, a małe warianty pozwalają na edge i specjalizację. Wybór powinien bazować na evalach i SLA, nie na największej liczbie.

Porównuj:

  • jakość tekstu, vision i tool use osobno;
  • VRAM przy rzeczywistym quant i długości;
  • prefill/decode latency oraz throughput;
  • stabilność parsera function calling;
  • jakość reasoning po wyłączeniu thinking;
  • zachowanie KV cache w rozmowach wieloturowych;
  • licencję modelu i zależności inferencyjnych.

Projekt sam ewoluował szybko: repozytorium Qwen3.5 zostało później przekierowane do Qwen3.6. Dlatego registry powinien pinować konkretny model ID, revision, tokenizer, chat template i wersję runtime. Nazwa „Qwen3.5” bez tych danych nie wystarcza do reprodukcji.

Self-hosting nie kończy problemu prywatności

Lokalne wagi ograniczają transfer promptów do zewnętrznego dostawcy, lecz dane nadal mogą wyciekać przez logi, tracing, cache, narzędzia, telemetry SDK i wyjścia agentów. Endpoint OpenAI-compatible bywa wdrażany bez uwierzytelnienia w płaskiej sieci. Dodaj mTLS lub bramę tożsamości, rate limit, tenant isolation i egress policy.

Wagi oraz adaptery pobieraj z oficjalnego źródła i bezpiecznego formatu. Pinuj hash/revision, skanuj obraz runtime, oddziel cache modeli od danych użytkowników i nie włączaj trust_remote_code bez review. Kwantyzowany artefakt od osoby trzeciej jest osobnym elementem supply chain.

Bezpieczeństwo multimodalnego agenta

Obraz może zawierać prompt injection, QR kierujący do złośliwej domeny, UI nakłaniające do kliknięcia albo sekret widoczny w tle. Model nie powinien bezpośrednio przekazywać odczytanej instrukcji do narzędzia. Warstwa polityki musi rozróżniać dane, polecenie użytkownika i output narzędzia.

Dla agenta stosuj allowlistę domen, schema validation, approval dla mutacji, osobne credentiale oraz memory hygiene. Testuj instrukcje w obrazie sprzeczne z promptem systemowym, zasłonięte teksty, mieszanie języków i wieloetapowe exfiltration.

Jak zbudować rzetelny eval

Użyj co najmniej 100 przykładów reprezentujących realny rozkład: dokumenty PL/EN, screenshoty, wykresy, kod, function calling i długie konteksty. Oceniaj fakt, cytowanie, refusal, format JSON, liczbę niepotrzebnych tool calls i koszt infrastruktury. Uruchom kilka prób, bo sampling i router MoE wprowadzają wariancję.

Warstwa inferencyjna: co faktycznie trzeba mierzyć

Dla MoE średnia liczba aktywnych parametrów nie wystarcza do planowania pojemności. Zbieraj rozkład obciążenia ekspertów, wykorzystanie pamięci, ruch między GPU, długość kolejki i skuteczność prefix cache. Nierówny routing może stworzyć gorących ekspertów i obniżyć throughput mimo wolnej pamięci na innych urządzeniach. Osobno mierz prefill dla obrazu i tekstu, czas pierwszego tokena oraz degradację przy rosnącym batchu.

Test wdrożeniowy powinien pinować identyczny tokenizer, chat template, wersję Transformers/vLLM, dtype i parametry generacji. Zmiana jednego z tych elementów może zmienić function calling lub użycie tokenów bez zmiany nazwy modelu. Canary rollout kierujący mały procent ruchu do nowej rewizji ułatwia wykrycie regresji przed pełnym przełączeniem.

Minimalny model zagrożeń dla otwartych wag

Rozpatrz podmianę checkpointu, kod wykonany przez loader, podatny serwer inferencyjny, nieautoryzowany endpoint, cross-tenant cache oraz exfiltration przez narzędzie. Artefakty pobieraj do kwarantanny, sprawdzaj podpis lub hash, generuj SBOM obrazu i promuj dokładnie ten sam digest między środowiskami. Self-hosting daje kontrolę nad danymi tylko wtedy, gdy cała ścieżka — od gatewaya po telemetrykę — pozostaje pod kontrolą.

Benchmark producenta jest dobrym filtrem, ale decyzję biznesową powinien wspierać rejestr i governance modeli, bezpieczny format wag oraz LLM gateway. Jeśli potrzebujesz porównania checkpointów na polskich danych, BreachRoad przygotuje test techniczny.


Źródła pierwotne: QwenLM — oficjalne repozytorium Qwen3.5/3.6, Qwen3.5 model documentation.

UDOSTĘPNIJ / KOPIUJ