Google od dłuższego czasu borykało się z zarzutami dotyczących braku zaawansowania w dziedzinie sztucznej inteligencji, jednak nadszedł moment przełomowy: Gemini 4 Argon. Wyniki testów plasują ten model w ścisłej czołówce, przy czym pierwsi będą mogli z niego skorzystać eksperci zajmujący się cyberobroną.
Gemini 4 Argon, zgodnie z aktualnymi trendami, ma być efektywny podczas długotrwałych, złożonych zadań, które wymagają wielu kolejnych działań. Google stworzyło zatem swój najbardziej zaawansowany model po długim okresie rozwijania szybszych i tańszych wariantów Flash. Argon już teraz przyczynił się do uwolnienia setek terabajtów pamięci w centrach danych, co nie wymagało zakupu dodatkowego sprzętu. Co więcej, cieszy się on także zainteresowaniem badaczy komputerów kwantowych w ramach Alphabetu.
DeepSWE ocenia skuteczność Argona
Wynik na poziomie 77,9 proc. w teście DeepSWE v1.1 był zaskoczeniem dla branży. Benchmark ten obejmuje 113 autorskich zadań związanych z 91 repozytoriami oraz pięcioma językami programowania. Model ma na celu efektywne zarządzanie projektem oraz dostarczenie rozwiązania, którego skuteczność weryfikują przygotowane testy. Przejście testu wymaga znajomości kodu oraz intensywnej pracy w dłuższym okresie. Zakres i struktura zadań są ustalane przez twórców DeepSWE.
Jednakże wyniki DeepSWE nie są tak jednoznaczne, jak mogłoby się wydawać. W audycie opublikowanym we wrześniu przez Epoch AI zidentyfikowano problemy w co najmniej 23 z 113 zadań w DeepSWE v1.1. Audytorzy zauważyli występowanie fałszywie negatywnych ocen, które ich zdaniem nie powinny być uznawane za błędne. Wskazuje to na zastrzeżenia dotyczące konstrukcji benchmarku: mimo że inne czołowe modele również przeszły ten sam test, wielu chciałoby, aby DeepSWE był wolny od tych niedociągnięć. Pierwsze miejsce jest bez wątpienia zaszczytem, chociaż wiele osób podkreśli, że to miejsce jest nieco kontrowersyjne, ponieważ czasami test odrzuca rozwiązania, które nie powinny być uznawane za niewłaściwe.
Vals Index ocenia przydatność w kluczowych branżach
Argon uzyskuje 68,90 proc., wyprzedzając Claude Sonnet 5.5, który osiągnął wynik 67,04 proc., oraz Claude Opus 5.5 z wynikiem 66,97 proc. W zestawieniu GPT-6 Astra plasuje się na końcu ze zaledwie 63,13 proc. Agregowane są tutaj dane z aż ośmiu benchmarków skupiających się na finansach, programowaniu, prawie i podatkach, a ich wagi wynikają z udziału poszczególnych sektorów w amerykańskim PKB.
To z kolei ułatwia porównania modeli przeznaczonych do pracy zawodowej, niemniej jednak nie ukazuje bezpośrednio, w jaki sposób (i czy) wpływają one na gospodarkę. Umówmy się, że jest to jedynie reprezentacja ich potencjału. Testy zawierają prywatne zestawy ewaluacji, do których zewnętrzni badacze nie mają pełnego dostępu, co utrudnia niezależne odtworzenie ocen. Na szczęście Vals publikuje metodologię oraz dane dotyczące kosztów i czasu realizacji.
Cyberbezpieczeństwo na czołowej pozycji
W obszarze cyberobrony Argon dzieli pierwsze miejsce z GPT-6 Astra i Grokiem 4.7, uzyskując solidne 68 proc. w testach pojedynczego podejścia do zadań CWE-bench v1. Test wymaga przeprowadzenia audytu w repozytorium oraz naprawienia podatności bez wskazywania modelowi LLM konkretnie, gdzie występuje problem. Weryfikacja ocenia następnie, czy lukę skutecznie zablokowano oraz czy testy oprogramowania nadal przechodzą pomyślnie. Remis w tej kategorii nikogo nie dziwi, bowiem benchmark publikował również wyniki z wielokrotnych prób oraz odrębnych paneli ocennych.
Czytaj również: Początek końca Anthropic? Firma odpowiedzialna za model Claude może znaleźć się na czarnej liście.
Właśnie z tego powodu Google postanowiło „przytrzymać” Argona i oddać go najpierw zespołom zajmującym się cyberbezpieczeństwem, które są uznawane za zasłużone i działające dla naszego wspólnego dobra. Dodatkowo, firma bierze udział w amerykańskim procesie ocen przed szerszą premierą. Zapowiedziano już wzmacnianie ochrony przed nadużyciami oraz atakami polegającymi na przemycaniu instrukcji mających na celu przejęcie kontroli nad zachowaniem agenta i skłonienie go do działań potencjalnie niebezpiecznych. Opinie pierwszych testerów będą kluczowe w kontekście dalszej dostępności LLM-a dla innych użytkowników. Argon wkracza do rywalizacji z silnymi wynikami, ale na razie jego dostępność jest ograniczona, co dla wielu entuzjastów jest ogromnym rozczarowaniem. Niemniej jednak, żyjemy w czasach, gdzie potężne modele wiążą się także z odpowiedzialnością za ich wykorzystanie. Biorąc pod uwagę to, co Argon prezentuje w benchmarkach, jego wyniki są z pewnością solidne. Dlatego też mówienie, że Google wreszcie wychodzi z dziwnie długiego okresu stagnacji, jest jak najbardziej uzasadnione.
