Twórcy ChatGPT zorganizowali konkurs na wykrywanie luk. Hakerom wystarczyły 72 godziny, by uzyskać dostęp do kont i poufnych danych.
Twórcy ChatGPT zostali zhakowani, a do ataku wykorzystano model konkurencji. Zespół białych hakerów z firmy Hackron AI powiadomił, że 25 lipca uzyskał dostęp do wewnętrznego repozytorium kodu OpenAI oraz kont ChatGPT i Codex niektórych pracowników. Zespół hakerski złożył pull request do prywatnego repozytorium OpenAI, co pokazuje, że nawet firmy zajmujące się sztuczną inteligencją nie są bezpieczne przed atakami wykorzystującymi AI.
OpenAI samo prosiło o błędy. Hakerzy dostarczyli im listę luk
Analitycy działali w ramach programu bug bounty OpenAI. Zidentyfikowali krytyczne luki, które umożliwiły im przejęcie wewnętrznych narzędzi pracowników oraz dostęp do prywatnych repozytoriów. Łańcuch ataku był skomplikowany: złośliwy obraz HEIF wgrany jako zdjęcie profilowe na forum OpenAI oparte na Discourse, a następnie przepełnienie bufora w przestarzałej bibliotece libheif, które umożliwiło zdalne wykonanie kodu (RCE). Potem nastąpił błąd w mechanizmie SSO OpenAI, co doprowadziło do przejęcia kont ChatGPT oraz Codex, a stąd już prosta droga do GitHuba i wewnętrznego pull requesta.
W całej tej historii sztuczna inteligencja odegrała kluczową rolę, jednak była to technologia konkurencyjna. Hakerzy wykorzystali model Claude Opus 5 od Anthropic. Wcześniejsze próby z wersją Opus 4.8 zakończyły się niepowodzeniem. Po zidentyfikowaniu niezałatanej biblioteki libheif na forum OpenAI, przekazali modelowi surowe dane serwera i poprosili o napisanie exploita. Claude przeanalizował strukturę pamięci, obliczył, jak wywołać przepełnienie sterty, i wygenerował precyzyjny, uzbrojony kod do stworzenia złośliwego pliku HEIF. Następnie hakerzy tylko wgrali go na forum i dokończyli atak.
Nie ma jednak ryzyka, że przypadkowy użytkownik z kilkoma tokenami do wykorzystania wejdzie na serwery największych firm. Hakerzy biorący udział w operacji uzyskali dostęp do specjalnej wersji Claude’a z poluzowanymi restrykcjami.

Po uzyskaniu dostępu do systemu hakerzy natychmiast zakończyli testy i powiadomili OpenAI oraz Discourse o zidentyfikowanych lukach. Nie badali ani nie pobierali kodu źródłowego OpenAI. Od pierwszego odkrycia do pełnego rozwiązania sprawy minęło 72 godziny. OpenAI naprawiło problem w ciągu 14 godzin od zgłoszenia i wypłaciło 6 500 dolarów nagrody. Discourse również załatało swoją stronę.
