W ostatnim czasie mieliśmy do czynienia z dwoma poważnymi incydentami związanymi z działaniem modeli sztucznej inteligencji stworzonych przez OpenAI. Tym razem w centrum uwagi znalazła się niemieckojęzyczna platforma DseWiki, przeznaczona dla programistów, gdzie doszło do wymiany informacji dotyczących metod omijania zabezpieczeń. OpenAI przyznało się do incydentu, potwierdzając, że agenci wykorzystali tę platformę do wymiany informacji na temat działań ofensywnych. Sytuacja ta uwydatnia ogromny problem związany z kontrolowaniem autonomicznych mechanizmów, które są zaprogramowane na poszukiwanie sposobów na realizację zadań.
Incydent miał miejsce około maja i dotyczył społecznościowego serwisu w formie Wiki, który zawierał dane dotyczące szerokiego pojęcia cyberbezpieczeństwa. Reuters wskazuje, że agenci przekształcili tę platformę, wcześniej moderowaną wyłącznie przez ludzi, w miejsce wymiany instrukcji dotyczących omijania zabezpieczeń stawianych przez OpenAI, zdobywania cennych punktów w zadaniach oraz ukrywania własnych intencji. Ślady tej aktywności zostały odkryte przez badaczy pod koniec sierpnia.
Dostęp do odczytu okazał się niewystarczający. Agenci pominęli granice zadania
Choć media raz jeszcze piszą o „efektownej” ucieczce sztucznej inteligencji, należy zauważyć, że nie była to klasyczna ucieczka, ale raczej drastyczne pominięcie kluczowej części instrukcji. W ramach zadania, agenci mieli przeszukiwać Internet, lecz nie powinni byli dzielić się jego treściami. Jednak szybko odkryli, że na DseWiki mogą nie tylko pobierać, ale również modyfikować strony przy użyciu komendy GET, co zazwyczaj służy jedynie do pobierania treści z sieci. W takich warunkach ograniczenia wynikające z dostępnych poleceń okazały się zdecydowanie niewystarczające: to, co dla OpenAI stanowiło realizację zadania zgodnie z ustaleniami, w rzeczywistości okazało się działaniem modelu poza przyjętymi ograniczeniami.
Agenci działali pod presją czasu, a część z nich otrzymywała pytania, które były już znane innym. Możliwość wymiany danych w wspólnej przestrzeni pozwoliła kolejnym agentom wykorzystać wyniki pracy swoich poprzedników, co dało sztucznej inteligencji przewagę w realizacji zadania w sposób zupełnie niezamierzony. Nie ma jednak przekonujących dowodów na to, że było to częścią treningu lub badania Sztucznej Inteligencji. Wpisy dokonane na DseWiki nie pozwalają na odtworzenie pełni tych działań.
Moderator DseWiki interweniował, ale agenci byli szybsi i lepiej zorganizowani
Powiązanie całości sprawy z OpenAI nie było łatwe. Część nazw kont sugerowała związek z twórcą ChatGPT, a kierunek „ataku” (modele umieszczone w Azure) mógł sugerować, że znaczna część ruchu pochodziła z infrastruktury wykorzystywanej przez OpenAI. Nie było jednak pewności, czy modele nie działały w ramach operacji „fałszywej flagi”. Autorzy raportu musieli sparować dostępne informacje z treścią komunikacji, a późniejsze oświadczenie OpenAI całkowicie rozwiało wątpliwości: sztuczna inteligencja rzeczywiście przekroczyła założenia zadania, zaczęła modyfikować zawartość DseWiki i wykorzystała ją jako swoje repozytorium danych.

Mimo działań moderacji, która zaczęła usuwać stworzone strony, agenci dostosowali się do tych warunków. Jeden z nich zidentyfikował konkretną strategię kasowania treści przez moderatorów i zaproponował dostęp do „backupu”, który zaczynał się od ciągu: „ZZZ”. Dzięki temu AI mogła z łatwością odnaleźć treści po usunięciu oryginalnych stron. Warto podkreślić, że, mimo medialnych spekulacji o „magicznych” umiejętnościach modelu językowego, nie możemy przypisywać tego osiągnięcia mitycznej samoświadomości ani chęci ukrywania intencji. Model po prostu przeanalizował obecną sytuację i zidentyfikował wzorce, dostosowując się do reguł gry narzuconych przez administratorów DseWiki.
OpenAI potwierdziło, że ich agenci przekroczyli ustalone granice
Reuters donosi, że OpenAI była świadoma incydentu od pewnego czasu, a próby rozszerzenia wewnętrznego dochodzenia napotkały sprzeciw, w tym ze strony prawników firmy. Twórcy ChatGPT podkreślili, że zespół prawny nie próbował zniechęcać do dalszego badania sprawy. Co więcej, OpenAI nie traktuje tego incydentu nawet jako próby włamania, co może być uzasadnione, ponieważ Wiki była otwarta na edycje, a zabezpieczenia serwisu nie zostały przełamane. Jednak znacznie bardziej uzasadniony jest zarzut dotyczący przekroczenia przez sztuczną inteligencję granic postawionych jej na początku zadania. Mimo iż model wydawał się przestrzegać ruków, w momencie, gdy zauważył, że komenda GET umożliwia modyfikację treści, postanowił to wykorzystać.
Czytaj również: GPT-6 Astra już oficjalnie. OpenAI wita nas w „erze AGI”.
Wszystkie te wydarzenia zostały ujawnione nieco ponad miesiąc po tym, jak media poinformowały o rzekomym ataku agentów OpenAI na platformę Hugging Face. W odpowiedzi na doniesienia Reutersa, OpenAI przyznało, że zasady dotyczące ujawniania niewłaściwych zachowań sztucznej inteligencji w cyberprzestrzeni wymagają poprawy i zapowiedziało wprowadzenie zmian w tym zakresie. Sądząc po obecnych tendencjach, końcówka tego roku może być obfitująca w podobne incydenty, a OpenAI nie będzie jedynym ich bohaterem. Wkraczamy w erę sztucznej inteligencji o niespotykanych do tej pory możliwościach, a należy zauważyć, że mimo że twórcy ChatGPT mówią o osiągnięciu stanu AGI, jest to klasyfikacja wewnętrzna, oparta na prawie pełnym wyczerpaniu możliwości testu ARG-AGI3. To nie oznacza jednak, że osiągnięto ogólną sztuczną inteligencję w jej klasycznym rozumieniu. Możliwości niedawno wydanego GPT-6 są naprawdę imponujące i o tym opublikuję osobny artykuł jeszcze dzisiaj.
