GPT-6 Astra. To obecnie najlepszy dla mnie model sztucznej inteligencji

GPT-6 Astra. To obecnie najlepszy dla mnie model sztucznej inteligencji

Autor:

w

Kilka dni z GPT-6 Astra w ramach subskrypcji Pro wyraźnie wskazuje na znaczny postęp w porównaniu do jego poprzednika, GPT-5.6 Sol. Osoby pracujące z dokumentami, raportami czy długimi materiałami (np. analiza i zrozumienie 500-stronicowego PDF-a nie stanowi dla niego problemu) docenią niesamowitą dokładność analiz oraz rzadkość konieczności korygowania przebiegu rozmów.

Chociaż może to nie być wielkim zaskoczeniem, każdy nowy model staje się lepszy od poprzedniego, to GPT-6 jest obecnie najlepszą opcją, jakiej dotychczas używałem.

Dotychczasowe doświadczenia z LLM-ami nauczyły nas, jak ważne jest przeprowadzanie szczegółowych sprawdzeń: od halucynacji, przez ciągłość uwagi nad założeniami, aż po dostarczenie odpowiedniego wyniku. Czysto teoretycznie wszystko może wyglądać świetnie, a mimo to istotne cele zadania mogą zostać przeoczone. Astra zaskoczyła mnie swoją zdolnością do utrzymania metodyczności i konsekwencji, jak i zachowania wielu perspektyw w ramach tego samego polecenia.

Niemniej jednak muszę zaznaczyć, że nie jest to szczegółowy benchmark podzielony na poszczególne zdolności modelu. Wiele aspektów wciąż czeka na odkrycie, a ja miałem jedynie ograniczone możliwości zabawy z Astrą, korzystając z MCP, oraz pobieżnie delegowałem jej zadania związane z kodowaniem i obsługą komputera. To ostatnie powoduje solidny „opad szczęki” już od pierwszego momentu.

Pojawienie się GPT-6 Astra w selektorach: w aplikacjach oraz w webowej wersji miało miejsce w niesamowicie radosnej atmosferze.

GPT-6 Astra jest niezawodna w wykonywaniu zadań

Najważniejszym benchmarkiem dla mnie było przetworzenie wspomnianego wcześniej, ponad 500-stronicowego, wczesnego szkicu powieści. Mogę powiedzieć bez wahania: GPT-6 w trybie Ultra (ChatGPT Work) był w stanie poprawnie zmapować całość i przeanalizować ją, nie myląc się w żadnym z faktów, które wynikają z tekstu. Dodatkowo, wszystkie cele zadania zostały zrealizowane, zaczynając od identyfikacji luk czasowych i logicznych, po sprawdzenie niespełnionych obietnic wynikających z fabuły. Astra postarała się również o wskazanie spekulacyjnych walorów tekstu oraz odwołała się do warstwy autobiograficznej, którą uznała za istotną.

Czytaj dalej poniżej

Gigantyczna awaria AI. Nie działa mnóstwo popularnych usług

W Astrze praktycznie nie zauważyłem zjawiska dopowiadania brakujących informacji jedynie po to, aby odpowiedź wydawała się kompletna. Dotychczas nie znalazłem wyraźnego powodu, by twierdzić, że Astra ma skłonności do halucynacji, aczkolwiek pracowałem głównie w trybach rozumowania od Średniego do Ultra: nie są one gwarancją ich braku, jednak pozwalają na skoncentrowanie się na jakości odpowiedzi.

GPT 5.6 Sol jednak, przy odpowiednio skonstruowanym prompcie, radził sobie z takimi problemami całkiem dobrze: mimo iż wiele razy zaskakiwał mnie dziwnymi twierdzeniami, które nie pasowały do rzeczywistego stanu faktycznego. Uznaję to po prostu za wynik dłuższego czasu współpracy z Sol, a Astra może nas jeszcze zaskoczyć w sposób negatywny.

Od uwag należy oddzielić ich trafność, a tu Astra także czyni postępy

Wracając do najważniejszego dla mnie benchmarku, uznaję swoją omylność i w trakcie własnej analizy rozbudowanego szkicu pragnę upewnić się, które problemy są fundamentalne, które wynikają z wcześniejszych założeń, a które można poprawić bez rewolucji. Największe wrażenie w Astrze zrobiła na mnie umiejętność (wręcz organiczna!) porządkowania takich zależności.

To jednak nie ogranicza się jedynie do materiałów tekstowych. GPT-6 włączyłem także do diagnozowania problemu z renderowaniem środowiska graficznego w Linuksie Mint, który służy mi do zarządzania moim mini-serwerem. Obasuje on funkcje zarówno magazynu, przypominającego NAS, jak i wsparcie dla Time Machine (gdzie tworzę backupy swojego Macbooka Air M5). Dodatkowo, jest to maszyna, która obsługuje domową centralkę inteligentnego domu, łączącą na razie niekompatybilne urządzenia w ramach mojego środowiska smart-home. Okazało się, że Codex, po przygotowaniu prompta przez GPT-6, był w stanie zdiagnozować problem i go rozwiązać, aczkolwiek z wymogiem zatwierdzenia wszelkich zmian w systemie.

To był jeden z ciekawszych testów kompetencji nie tylko w obszarze obsługi komputera, ale także naprawy skomplikowanego problemu. Astra poradziła sobie z trudnością, a nawet ostrzegła przed możliwym throttlingiem spowodowanym zbyt wysokimi temperaturami, co jest standardowym problemem w ThinkPadach…

W międzyczasie poprosiła mnie nawet o przeprowadzenie działań, które mogłyby wywołać błąd (np. problemy z renderowaniem pojawiały się po wyłączeniu i włączeniu klawiatury MX Keys Mini, co skutkowało migotaniem ekranu). Codex sam zdiagnozował sytuację i zaproponował rozwiązanie, które ja szukałbym zapewne przez kilka wieczorów.

Tak daleko idąca samodzielność modelu i jego „pomyślunek” daje mi możliwość zlecania trudniejszych zadań i… oddalenia się od komputera, na przykład podczas wyprowadzania psa. Astry nie trzeba szczególnie nakierowywać, wystarczy skłonić ją do poszukiwania rozwiązań i testowania stanów rzeczy samodzielnie.

Ile zapłacisz za GPT-6 Astra?

Astra jest już dostępna w ChatGPT, także w trybach Work i Codex, jednak dostęp zależy od rodzaju subskrypcji. Użytkownicy subskrypcji Pro mają dostęp do GPT-6 Astra w ChatGPT bez wpływu na wyczerpywalne limity, podczas gdy w Plusie, aby skorzystać z Astry, trzeba przejść do Work lub Codexa, co wiąże się z szybkim wyczerpywaniem limitów. Biorąc pod uwagę, że Astra szybko zużywa limity (choć mówi się, że w tych samych zadaniach jest bardziej opłacalna od konkurencyjnych rozwiązań), najlepiej mieć subskrypcję Pro 5x: korzystam z tej opcji, która kosztuje nieco ponad 400 złotych miesięcznie. Jednak tak, jak zmieniały się zasady po wprowadzeniu 5.6 Sol / Terra / Luna, zmiany powinny również dotknąć subskrybentów Plusa, umożliwiając im efektywne korzystanie z GPT-6 Astry.

W przypadku API podstawowa stawka za Astrę wynosi 10 dolarów za milion tokenów wejściowych i 50 dolarów za milion wyjściowych, co stanowi 2,5-krotny wzrost w porównaniu do bieżących stawek GPT-5.6 Sol. Cennik API OpenAI pozwala na oszacowanie kosztów konkretnego wykorzystania. Na przykład, 100 tysięcy tokenów wejścia oraz 10 tysięcy tokenów wyjścia kosztuje 1,50 dolarów w trybie Standard, bez dodatkowych opłat wynikających z narzędzi. Po przekroczeniu 272 tysięcy tokenów stawki dla całego żądania wzrastają: wejście dwukrotnie, wyjście o połowę.

Astra podczas pracy nad komputerem, na którym wystąpił problem z renderowaniem środowiska graficznego. Po około 30 minutach testów problem został zdiagnozowany i rozwiązany zarówno przez model, jak i przeze mnie.

Dopłata ma sens, ale tylko, gdy dokładnie wiesz, co chcesz osiągnąć

I w mojej opinii, to na tym koncentrują się obliczenia dotyczące opłacalności Astry. Do rachunku należy dodać dodatkowe podejścia, czytanie odpowiedzi, sprawdzanie pominięć oraz czas poświęcony na poprawki, szczególnie przy użyciu zewnętrznych narzędzi poprzez MCP. Uważam, że czasami warto zainwestować więcej, jeśli może to przynieść oszczędności związane z dodatkowym czasem na poprawki. Przy prostych, powtarzalnych zadaniach, Astra może się jednak nie zwrócić: ani czasowo, ani w postaci lepszych odpowiedzi. Niemniej, to także, paradoksalnie, świadczy o jej ogólnej wartości.

Czytaj również: GPT-6 Astra już oficjalnie. OpenAI wita nas w „erze AGI”

Szczerze mówiąc, tego modelu oczekiwałem od OpenAI. Benchmarki stają się istotne, a w skomplikowanych i niezwykle trudnych zadaniach, Astra konkuruje z najlepszymi produktami Anthropica i nie odbieram innym konkurentom możliwości dostarczania równie dobrych, jeśli nie lepszych modeli w niektórych zastosowaniach. Jednak miałem wysokie oczekiwania wobec Astry i… zostały one spełnione. Najważniejszy test jednak, to nie moje przemyślenia, lecz wasze doświadczenia w praktyce. I to, od waszego spojrzenia zależy, czy GPT-6 Astra okaże się dla was opłacalna, a jeżeli tak, to w jaki sposób.