Kilka dni z GPT-6 Astra w ramach subskrypcji Pro wyraźnie wskazuje na znaczny postęp w porównaniu do jego poprzednika, GPT-5.6 Sol. Osoby pracujące z dokumentami, raportami czy długimi materiałami (np. analiza i zrozumienie 500-stronicowego PDF-a nie stanowi dla niego problemu) docenią niesamowitą dokładność analiz oraz rzadkość konieczności korygowania przebiegu rozmów.
Chociaż może to nie być wielkim zaskoczeniem, każdy nowy model staje się lepszy od poprzedniego, to GPT-6 jest obecnie najlepszą opcją, jakiej dotychczas używałem.
Dotychczasowe doświadczenia z LLM-ami nauczyły nas, jak ważne jest przeprowadzanie szczegółowych sprawdzeń: od halucynacji, przez ciągłość uwagi nad założeniami, aż po dostarczenie odpowiedniego wyniku. Czysto teoretycznie wszystko może wyglądać świetnie, a mimo to istotne cele zadania mogą zostać przeoczone. Astra zaskoczyła mnie swoją zdolnością do utrzymania metodyczności i konsekwencji, jak i zachowania wielu perspektyw w ramach tego samego polecenia.
Niemniej jednak muszę zaznaczyć, że nie jest to szczegółowy benchmark podzielony na poszczególne zdolności modelu. Wiele aspektów wciąż czeka na odkrycie, a ja miałem jedynie ograniczone możliwości zabawy z Astrą, korzystając z MCP, oraz pobieżnie delegowałem jej zadania związane z kodowaniem i obsługą komputera. To ostatnie powoduje solidny „opad szczęki” już od pierwszego momentu.
GPT-6 Astra jest niezawodna w wykonywaniu zadań
Najważniejszym benchmarkiem dla mnie było przetworzenie wspomnianego wcześniej, ponad 500-stronicowego, wczesnego szkicu powieści. Mogę powiedzieć bez wahania: GPT-6 w trybie Ultra (ChatGPT Work) był w stanie poprawnie zmapować całość i przeanalizować ją, nie myląc się w żadnym z faktów, które wynikają z tekstu. Dodatkowo, wszystkie cele zadania zostały zrealizowane, zaczynając od identyfikacji luk czasowych i logicznych, po sprawdzenie niespełnionych obietnic wynikających z fabuły. Astra postarała się również o wskazanie spekulacyjnych walorów tekstu oraz odwołała się do warstwy autobiograficznej, którą uznała za istotną.

W Astrze praktycznie nie zauważyłem zjawiska dopowiadania brakujących informacji jedynie po to, aby odpowiedź wydawała się kompletna. Dotychczas nie znalazłem wyraźnego powodu, by twierdzić, że Astra ma skłonności do halucynacji, aczkolwiek pracowałem głównie w trybach rozumowania od Średniego do Ultra: nie są one gwarancją ich braku, jednak pozwalają na skoncentrowanie się na jakości odpowiedzi.
GPT 5.6 Sol jednak, przy odpowiednio skonstruowanym prompcie, radził sobie z takimi problemami całkiem dobrze: mimo iż wiele razy zaskakiwał mnie dziwnymi twierdzeniami, które nie pasowały do rzeczywistego stanu faktycznego. Uznaję to po prostu za wynik dłuższego czasu współpracy z Sol, a Astra może nas jeszcze zaskoczyć w sposób negatywny.
Od uwag należy oddzielić ich trafność, a tu Astra także czyni postępy
Wracając do najważniejszego dla mnie benchmarku, uznaję swoją omylność i w trakcie własnej analizy rozbudowanego szkicu pragnę upewnić się, które problemy są fundamentalne, które wynikają z wcześniejszych założeń, a które można poprawić bez rewolucji. Największe wrażenie w Astrze zrobiła na mnie umiejętność (wręcz organiczna!) porządkowania takich zależności.
To jednak nie ogranicza się jedynie do materiałów tekstowych. GPT-6 włączyłem także do diagnozowania problemu z renderowaniem środowiska graficznego w Linuksie Mint, który służy mi do zarządzania moim mini-serwerem. Obasuje on funkcje zarówno magazynu, przypominającego NAS, jak i wsparcie dla Time Machine (gdzie tworzę backupy swojego Macbooka Air M5). Dodatkowo, jest to maszyna, która obsługuje domową centralkę inteligentnego domu, łączącą na razie niekompatybilne urządzenia w ramach mojego środowiska smart-home. Okazało się, że Codex, po przygotowaniu prompta przez GPT-6, był w stanie zdiagnozować problem i go rozwiązać, aczkolwiek z wymogiem zatwierdzenia wszelkich zmian w systemie.
W międzyczasie poprosiła mnie nawet o przeprowadzenie działań, które mogłyby wywołać błąd (np. problemy z renderowaniem pojawiały się po wyłączeniu i włączeniu klawiatury MX Keys Mini, co skutkowało migotaniem ekranu). Codex sam zdiagnozował sytuację i zaproponował rozwiązanie, które ja szukałbym zapewne przez kilka wieczorów.
Tak daleko idąca samodzielność modelu i jego „pomyślunek” daje mi możliwość zlecania trudniejszych zadań i… oddalenia się od komputera, na przykład podczas wyprowadzania psa. Astry nie trzeba szczególnie nakierowywać, wystarczy skłonić ją do poszukiwania rozwiązań i testowania stanów rzeczy samodzielnie.
Ile zapłacisz za GPT-6 Astra?
Astra jest już dostępna w ChatGPT, także w trybach Work i Codex, jednak dostęp zależy od rodzaju subskrypcji. Użytkownicy subskrypcji Pro mają dostęp do GPT-6 Astra w ChatGPT bez wpływu na wyczerpywalne limity, podczas gdy w Plusie, aby skorzystać z Astry, trzeba przejść do Work lub Codexa, co wiąże się z szybkim wyczerpywaniem limitów. Biorąc pod uwagę, że Astra szybko zużywa limity (choć mówi się, że w tych samych zadaniach jest bardziej opłacalna od konkurencyjnych rozwiązań), najlepiej mieć subskrypcję Pro 5x: korzystam z tej opcji, która kosztuje nieco ponad 400 złotych miesięcznie. Jednak tak, jak zmieniały się zasady po wprowadzeniu 5.6 Sol / Terra / Luna, zmiany powinny również dotknąć subskrybentów Plusa, umożliwiając im efektywne korzystanie z GPT-6 Astry.
W przypadku API podstawowa stawka za Astrę wynosi 10 dolarów za milion tokenów wejściowych i 50 dolarów za milion wyjściowych, co stanowi 2,5-krotny wzrost w porównaniu do bieżących stawek GPT-5.6 Sol. Cennik API OpenAI pozwala na oszacowanie kosztów konkretnego wykorzystania. Na przykład, 100 tysięcy tokenów wejścia oraz 10 tysięcy tokenów wyjścia kosztuje 1,50 dolarów w trybie Standard, bez dodatkowych opłat wynikających z narzędzi. Po przekroczeniu 272 tysięcy tokenów stawki dla całego żądania wzrastają: wejście dwukrotnie, wyjście o połowę.
Dopłata ma sens, ale tylko, gdy dokładnie wiesz, co chcesz osiągnąć
I w mojej opinii, to na tym koncentrują się obliczenia dotyczące opłacalności Astry. Do rachunku należy dodać dodatkowe podejścia, czytanie odpowiedzi, sprawdzanie pominięć oraz czas poświęcony na poprawki, szczególnie przy użyciu zewnętrznych narzędzi poprzez MCP. Uważam, że czasami warto zainwestować więcej, jeśli może to przynieść oszczędności związane z dodatkowym czasem na poprawki. Przy prostych, powtarzalnych zadaniach, Astra może się jednak nie zwrócić: ani czasowo, ani w postaci lepszych odpowiedzi. Niemniej, to także, paradoksalnie, świadczy o jej ogólnej wartości.
Czytaj również: GPT-6 Astra już oficjalnie. OpenAI wita nas w „erze AGI”
Szczerze mówiąc, tego modelu oczekiwałem od OpenAI. Benchmarki stają się istotne, a w skomplikowanych i niezwykle trudnych zadaniach, Astra konkuruje z najlepszymi produktami Anthropica i nie odbieram innym konkurentom możliwości dostarczania równie dobrych, jeśli nie lepszych modeli w niektórych zastosowaniach. Jednak miałem wysokie oczekiwania wobec Astry i… zostały one spełnione. Najważniejszy test jednak, to nie moje przemyślenia, lecz wasze doświadczenia w praktyce. I to, od waszego spojrzenia zależy, czy GPT-6 Astra okaże się dla was opłacalna, a jeżeli tak, to w jaki sposób.
