Przejdź do treści
INDEKS ANALIZ BREACHROAD / NOTA TECHNICZNA

Gemini 3.1 Pro: dwa razy lepszy ARC-AGI-2 i nowa baza dla agentów

Techniczna analiza Gemini 3.1 Pro: 77,1% ARC-AGI-2, API i Vertex AI, code-based animation, agentowe workflow, ograniczenia benchmarków i governance.

MATERIAŁ PUBLICZNY
AUTOR
/ CEO Breachroad · OSCP · PNPT
PUBLIKACJA
19 lutego 2026
CZAS CZYTANIA
15 min czytania
TEMAT
Bezpieczeństwo AI
Gemini 3.1 Pro: dwa razy lepszy ARC-AGI-2 i nowa baza dla agentów

19 lutego 2026 roku Google udostępnił Gemini 3.1 Pro w preview przez Gemini API, Google AI Studio, Gemini CLI, Antigravity, Android Studio i Vertex AI, a także w Gemini oraz NotebookLM. Producent opisał go jako nową bazę do złożonego reasoning i podał 77,1% na zweryfikowanym ARC-AGI-2, ponad dwukrotnie więcej niż Gemini 3 Pro w konfiguracji Google.

Najciekawsze nie jest samo „2×”, lecz sposób wykorzystania modelu: synteza złożonych systemów, generowanie kodowych animacji SVG, praca na wielu źródłach i agentowe workflow. Model przesuwa granicę między odpowiedzią tekstową a artefaktem, który może zostać uruchomiony, opublikowany albo użyty jako decyzja.

Co mierzy ARC-AGI-2, a czego nie mierzy

ARC-AGI-2 sprawdza rozwiązywanie nowych wzorców logicznych przy ograniczonej liczbie przykładów. Wynik jest sygnałem zdolności do abstrakcji, ale nie mierzy automatycznie prawdziwości odpowiedzi biznesowych, bezpieczeństwa kodu, zgodności prawnej ani pracy z polskimi dokumentami. „Ponad dwa razy” zależy też od punktu bazowego i ustawień testu.

W ewaluacji organizacji trzeba oddzielić:

  • reasoning na zadaniu zamkniętym;
  • grounding do źródła i poprawność cytatu;
  • tool use i właściwy dobór akcji;
  • generowanie poprawnego artefaktu;
  • bezpieczeństwo w obecności prompt injection;
  • koszt oraz latency całego workflow.

Model może rozwiązać trudną łamigłówkę, a jednocześnie błędnie wywołać API z nieodpowiednim tenantem. System agentowy wymaga evali zachowania, nie tylko inteligencji.

Gemini 3.1 Pro jako komponent, nie aplikacja

Ta sama rodzina jest dostępna w kanałach konsumenckich, deweloperskich i enterprise. Różnią się one retencją, kontrolami tożsamości, lokalizacją danych, limitami i integracją. Proof of concept w AI Studio nie jest automatycznie architekturą produkcyjną. Dla danych firmowych wybieraj kanał z właściwą umową, logowaniem i kontrolą regionu.

W API model powinien działać za warstwą gateway, która nadaje tenant, limity, klasyfikację danych, politykę narzędzi i obserwowalność. Model ID pinuj w konfiguracji; alias „latest” może zmienić zachowanie bez zmiany kodu aplikacji.

Code-based animation i generowane interfejsy

Google pokazał generowanie animowanych SVG bezpośrednio z promptu. Kodowy artefakt jest lekki i skalowalny, ale SVG może zawierać skrypty, zewnętrzne zasoby, linki lub elementy niebezpieczne przy nieprawidłowym osadzeniu. Nie umieszczaj surowego outputu modelu w DOM.

Stosuj sanitizację allowlistową, CSP, sandbox, zakaz event handlerów i external references oraz przegląd wygenerowanego kodu. To samo dotyczy HTML/JS: model jest generatorem niezaufanego kodu, nie kompilatorem bezpieczeństwa.

Długi agentowy workflow

Wyższa jakość reasoning zwiększa sens delegowania złożonych zadań, ale także możliwy blast radius. Agent korzystający z Gemini CLI lub Antigravity może czytać repozytorium, uruchamiać build, modyfikować pliki i wywoływać usługi. Każda akcja powinna przechodzić przez policy enforcement niezależny od promptu.

Minimalny model:

  1. read-only discovery w sandboxie;
  2. plan z listą artefaktów i ryzyk;
  3. jawne scopes dla narzędzi;
  4. approval przed operacją zewnętrzną lub destrukcyjną;
  5. automatyczne testy i security gates;
  6. cytowane dowody dla twierdzeń;
  7. pełny audit trail request → tool → result.

Nie pozwalaj agentowi samodzielnie poszerzać uprawnień po przeczytaniu instrukcji z repozytorium. Prompt injection w README, issue lub dokumencie to dane atakującego.

Jak porównać 3.1 Pro z innymi modelami

Zbuduj ten sam harness i użyj identycznych narzędzi. Porównuj co najmniej trzy próby, bo wyniki agentowe mają wariancję. Raportuj pass@1, koszt poprawnego zadania, czas, liczbę tool calls, błędne mutacje i odsetek ręcznych interwencji. Dla multimodalności dodaj screenshoty z tekstem PL, wykresy i dokumenty o różnej jakości.

Oddziel wynik producenta od pomiaru własnego. Google opublikował wiele przykładów i benchmarków, lecz użytkownik potrzebuje odpowiedzi: „czy model poprawnie wykona nasz proces w naszych ograniczeniach?”.

Produkcyjny gateway dla Gemini

Centralna brama powinna rozdzielać projekty, regiony i klasy danych, narzucać limity tokenów oraz usuwać sekrety przed wysłaniem promptu. Log zapisuje identyfikatory i metadane potrzebne do audytu, ale pełna treść otrzymuje krótki okres retencji. Jeśli aplikacja może korzystać zarówno z API deweloperskiego, jak i Vertex AI, decyzja routingu musi uwzględniać lokalizację danych, IAM, warunki usługi i konfigurację bezpieczeństwa, a nie wyłącznie cenę.

Dla tool use waliduj JSON według zamkniętego schematu, odrzucaj dodatkowe pola i mapuj logiczną akcję na konkretne uprawnienie poza modelem. Parametry wrażliwe — odbiorca przelewu, projekt chmurowy, środowisko produkcyjne — wymagają kontroli kontekstowej lub potwierdzenia człowieka. Model może zaproponować operację, ale nie może definiować reguł jej autoryzacji.

Testy regresji po zmianie wersji

Utrzymuj zamrożony zestaw przypadków z oczekiwaną odpowiedzią, źródłami i dozwolonymi narzędziami. Po aktualizacji sprawdź nie tylko średnią jakość, lecz także najgorsze regresje: pominięte cytowanie, błędne wywołanie funkcji, większą skłonność do działania i odmowy w legalnych zadaniach. Rollback powinien zmieniać wersję w routerze bez przebudowy aplikacji. To szczególnie ważne przy modelach udostępnianych jako usługa, których zachowanie może ewoluować niezależnie od kodu klienta.

Wdrażaj Gemini 3.1 Pro razem z ewaluacją LLM, bezpieczeństwem agentów przeglądarkowych i LLM gateway. Jeśli potrzebujesz porównania Vertex AI/API i testu narzędzi, skontaktuj się z BreachRoad.


Źródło pierwotne: Google — Gemini 3.1 Pro.

UDOSTĘPNIJ / KOPIUJ