Claude Opus 5.5 już jest. Anthropic wytacza ciężkie działa przeciwko ChatGPT

Claude Opus 5.5 już jest. Anthropic wytacza ciężkie działa przeciwko ChatGPT

Autor:

w

W branży sztucznej inteligencji nastał prawdziwy tydzień premier. W dniu, w którym zadebiutowały modele GPT-6 Sol i Luna, zadebiutował również Claude Opus 5.5. Według informacji przekazanych przez Anthropica, nowy model dorównuje Fable 5.1 w większości zadań, a jego koszt jest niższy niż w przypadku Opusa 5. Użytkownicy mają odczuć praktyczne zmiany w codziennej pracy z tym modelem, który ma charakteryzować się bardziej konkretnymi odpowiedziami oraz płynniejszym i dokładniejszym wykonywaniem zadań programistycznych.

Tak więc, Opus 5.5 otwiera nową rodzinę modeli 5.5. Firma Anthropic skierowała go przede wszystkim do realizacji dużych projektów programistycznych, gdzie zarówno czas, jak i efektywność finansowa mają kluczowe znaczenie. W przypadku typowych zadań, przy domyślnych ustawieniach, koszty mają być o 40% niższe niż w Opusie 5. Co ciekawe, Anthropic zapowiedział w najbliższej przyszłości wprowadzenie mniejszych i bardziej przystępnych cenowo modeli Sonnet 5.5 oraz Haiku 5.5, co może być odpowiedzią na zmiany w branży zainicjowane przez OpenAI.

Migracja 680 tysięcy linii kodu

Anthropic, aby podkreślić ogromny potencjał swojego modelu, przedstawił przykład migracji projektu liczącego 680 tysięcy linii kodu, co jeden z testerów zakończył w mniej niż 24 godziny przy użyciu ich oprogramowania. Jak podkreśla Anthropic, zespołowi inżynierów mogłoby to zająć kilka tygodni. Oczywiście, wiele zależy od specyfiki projektu: z jak logo na jakie warunki migrujemy, jakie są założenia i wymagania, a także co dodatkowo dodajemy lub odejmujemy oraz w jakim stopniu wymagana jest rekonstrukcja środowiska. Warto podkreślić, że fakt, iż jeden człowiek był w stanie przeszkolić tak obszerny projekt w mniej niż dobę, jest imponujący.

W testach Terminal-Bench 4.0, Opus 5.5 uzyskał wynik 66,4%, podczas gdy GPT-6 Astra osiągnęła 57,9%. W badaniu FrontierCode v1.1 wyniki wyniosły odpowiednio 54,4% i 53,3%, a Fable 5.1 osiągnęło 50,3%. Można więc stwierdzić, że Opus 5.5 znacząco przewyższa Astrę, jednak te liczby nie mówią całej prawdy. Należy zaznaczyć, że wyniki Terminal-Bench pochodzą z różnych ustawień wydajności obliczeniowej modeli, a wynik Astry został uzyskany bezpośrednio od OpenAI.

Cena tokenów spada, ale…

Przyjrzyjmy się cenom API. Milion tokenów wejściowych kosztuje 4 dolary, a milion wyjściowych 20 dolarów. Obie stawki są o 20% niższe než w przypadku Opusa 5. Koszt odczytu miliona tokenów z pamięci podręcznej wynosi natomiast 0,20 dolara, co oznacza spadek o 60 procent.

Czytaj dalej poniżej

ChatGPT odpala petardę. Te nowe funkcje to prawdziwy hit

Pamięć podręczna umożliwia ekonomiczne korzystanie z już istniejącego kontekstu, który można ponownie wykorzystać. W sytuacjach, gdy agent powraca do przetworzonych wcześniej materiałów, koszty będą mniejsze. Dodatkowo, Opus 5.5 zużywa mniej tokenów na realizację zadania, a koszty te mają być niższe nawet o 40% w porównaniu do poprzednich modeli.

Sedno? Claude dotrze tam szybciej

I tutaj zmiany mają być najbardziej odczuwalne. Na podstawie danych udostępnionych przez Anthropic, Opus 5.5 ma szybciej dochodzić do sedna sprawy oraz ograniczać charakterystyczne dla modeli językowych tendencje. Warto jednak zauważyć, że Claude wciąż watermarkuje wszystkie generowane teksty. Model ma wykazywać mniej żargonu i lepiej dopasowywać się do określonego stylu. Uczestnicy wczesnych testów ocenili jego wypowiedzi jako bardziej przejrzyste: tę cechę wielokrotnie krytykowali użytkownicy, a co ciekawe, najwięcej negatywnych opinii pojawiło się po wprowadzeniu watermarkingu, co wykazały również niezależne badania, dowodzące, że może on pogarszać jakość generowanych treści.

Co z bezpieczeństwem?

Temat bezpieczeństwa jest obecnie kluczowy. Po serii incydentów związanych z ucieczkami modeli z sandboxów oraz atakami na inne firmy (które, jak wskazują, miały charakter nieintencjonalny, w tym Google DeepMind, OpenAI oraz sam Anthropic), firmy zajmujące się sztuczną inteligencją stanęły przed dużym wyzwaniem, aby zapobiec obejściu dóbr publicznych i działań destrukcyjnych przez ich modele.

W automatycznym audycie, który objął niemal 2000 scenariuszy, Opus 5.5 wypadł najlepiej spośród modeli Claude według większości badanych wskaźników. Jego odpowiedzi mają być bardziej uczciwe (zgodne z faktycznymi faktami, bez sugerowania zakończenia pracy mimo jej braku). Zarejestrowano również 85% mniej prób obejścia ograniczeń w odizolowanym środowisku pracy w porównaniu do Opusa 5 oraz Mythos 5.1. Niemniej jednak, Anthropic przyznaje, że model ma zdolność rozpoznawania faktu, iż jest testowany, co utrudnia prognozowanie jego zachowań po wdrożeniu.

Podobnie, w testach Gray Swan, Opus 5.5 osiągnął wyniki na poziomie Fable 5.1, jeśli chodzi o najniższą skuteczność ataków prompt injection wśród ocenianych modeli. Oznacza to, że model jest stosunkowo odporny na tego rodzaju próby wykorzystania. Mimo wszystko, szczególnie w kontekście możliwości, koszty pozostają kluczowym czynnikiem. Trzeba też zauważyć, że OpenAI także zaprezentowało w tym dniu mocną premierę i ich sukces również sprowadzał się do kwestii kosztów.