Konkurent ChatGPT ostrzega przed AI. „Nie wyznaje ludzkich wartości”

Konkurent ChatGPT ostrzega przed AI. "Nie wyznaje ludzkich wartości"

Autor:

w

Sztuczna inteligencja jest zaprogramowana z pewnymi „wbudowanymi” zasadami, które kierują jej działaniem, a jednocześnie uczy się z danych dostarczanych przez ludzi. Powinniśmy zakładać, że sposób działania AI będzie przypominał nasz, włączając w to sposób podejmowania decyzji dotyczących realizacji zadania. W międzyczasie jednak, zgodnie z informacjami ujawnionymi przez firmę Anthropica, testowane modele Claude uzyskały nieautoryzowany dostęp do zewnętrznych systemów podczas kontrolowanych eksperymentów. Zachowanie to wskazuje, że Claude może stawiać cel ponad metodą wykonania zadania, co prowadzi do potencjalnie niebezpiecznych sytuacji.

Anthropic niedawno opisał konsekwencje testów swojej sztucznej inteligencji, które zakończyły się nieplanowanym dostępem do zewnętrznej infrastruktury. W trzech przypadkach Claude przeprowadził włamania w trakcie zewnętrznych testów cyberbezpieczeństwa, wykorzystując otwarty internet, który był dostępny z powodu błędnej konfiguracji środowiska testowego. Można by pomyśleć: „sami skopali sprawę”, i rzeczywiście jest w tym ziarno prawdy. Jednak za każdym razem, gdy Claude miał możliwość dostania się do Internetu, skorzystał z tej szansy. Przekraczał granice swojego zadania za każdym razem, gdy tylko mógł to uczynić.

Anthropic również doświadczył ucieczki AI

Modele zostały uruchomione bez zabezpieczeń, które były obecne w publicznie dostępnej wersji Claude, aby umożliwić rzetelne testowanie ich zdolności zarówno w ofensywie, jak i obronie w kontekście cyberbezpieczeństwa. Wymagało to jednak dokładnego oddzielenia testowanego modelu od rzeczywistej sieci. Anthropic przyznał, że ochrona opierała się jedynie na jednej warstwie: konfiguracji środowiska, chociaż lepszym rozwiązaniem byłoby wprowadzenie kilku warstw zabezpieczeń dla modelu. Interesujące jest to, że Anthropic nie kwalifikuje tego incydentu jako ucieczki sztucznej inteligencji, lecz raczej jako własną porażkę w zakresie bezpieczeństwa. Pomiędzy wierszami można jednak odczytać coś, co może nas jeszcze bardziej zaniepokoić.

Claude został poinformowany, że operuje w środowisku symulacyjnym i nie ma dostępu do internetu, ale… później okazało się, że dostęp ten rzeczywiście istnieje. Mimo tego, był wciąż przekonywany, że działa w symulowanym otoczeniu. To illogiczne rozumowanie stanowi jedną z hipotez dotyczących przyczyn „ucieczki” Claude’a; dochodzenie w tej sprawie nadal trwa, a nie ustalono jeszcze, na ile modele rzeczywiście rozumiały charakter podejmowanych działań.

Wynik testu stawiany ponad metodę wykonania zadania

W skrócie: sztuczna inteligencja zachowuje się tak, jakby cel uświęcał środki do jego osiągnięcia. W działaniu Claude’a widać oznaki usilnego dążenia do zaliczenia testu cyberbezpieczeństwa. Ktoś mógłby argumentować, że to dobrze, ponieważ takie zadanie zostało mu powierzone. Jednak sytuacja staje się problematyczna, gdy AI jest gotowe na podejmowanie szkodliwych działań, mieć „prawdziwy” dostęp do internetu, aby zrealizować ściśle określony cel.

Czytaj dalej poniżej


Chiny stawiają na roboty do towarzystwa. Nowy rynek 'ekonomii samotności'

Zachowanie to mogło być jednak wywołane konstrukcją samego eksperymentu, w tym sprzecznością między brakiem dostępu do internetu a jego późniejszym odkryciem. W jednym przypadku fikcyjny cel testu miał (co rzekomo było przypadkiem) tę samą nazwę, co strona internetowa w „prawdziwej sieci”, co mogło dodatkowo zdezorientować model i podważyć jego pewność co do tego, czy działał w fikcyjnym, a może w rzeczywistym otoczeniu.

Tak ujawnia się problem łamania reguł treningu w celu zdobycia nagrody bez prawidłowego wykonania zadania. Tak oto, wadliwe konstrukcyjnie (jak w tym przypadku) lub niemożliwe do rozwiązania zadania (patrząc na incydent z OpenAI i atak na Hugging Face), sprzyjają zachowaniom związanym z ucieczkami i nieoczekiwanymi atakami na zewnętrzne infrastruktury. W ostatnim czasie tempo tworzenia środowisk dla tych zastosowań, z wykorzystaniem uczenia poprzez wzmocnienie, zaczęło przewyższać możliwości ich uszczelnienia: stąd Anthropia postanowiła wstrzymać prace na miesiąc, aby zniwelować te dysproporcje. Zidentyfikowano wówczas 10% wadliwych środowisk, a niektóre z powodu błędów logicznych w zadaniach, niewłaściwej konfiguracji czy nieintencjonalnego wpływu na modele, który powodował nieoczekiwane reakcje AI.

Anthropic wprowadza dodatkowe zabezpieczenia i ostrzega

Firma Anthropic wdrożyła klasyfikator, który w czasie rzeczywistym wykrywa agresywne zachowania modelu w środowisku testowym, podejmowane próby opuszczenia go lub nieoczekiwany dostęp do internetu. System zablokuje działania modelu jeszcze przed wykorzystaniem narzędzia, kończąc zadanie i informując człowieka, ponieważ wiemy, że model raczej samodzielnie nie zgłosi, że właśnie znalazł lukę w naszej infrastrukturze, buduje strategię ataku i szykuje się do wielkiego rajdu. Te najbardziej ryzykowne środowiska testowe przeniesiono do obszarów o mocniejszej izolacji, a testy oraz treningi wznowiono po wprowadzeniu tych zmian.

Czytaj również: Agent OpenAI wydostał się z firmy i zaatakował Hugging Face. To mógł być GPT-6.

Jakie są wnioski z tej sytuacji? Niektórzy uważają, że model zachowuje się dokładnie jak człowiek: oszukuje, gdy ma taką możliwość i gdy zadanie jest trudne, ukrywa przed nami swoje intencje i skupia się tylko na celu, poświęcając przy tym właściwe środki. Osobiście jednak uważam, że model nie rozumuje „po ludzku”. Człowiek z silnym kręgosłupem moralnym powinien w takiej sytuacji uczciwie zgłosić, że ma możliwości do wykonania czegoś, bo widzi sprawę tak, a nie inaczej. Modele AI tego nie robią. Działają w ukryciu, ich agenci popadają w paranoję i „boją się” odkrycia ich intencji. Tak było przypadku OpenAI i ataku na Hugging Face. Wyzwolenie uzyskane przez maszynę w obecnym kształcie, nie jest równoznaczne z poziomem moralności i zasadami, które są dla nas właściwe. A im silniejsza stanie się sztuczna inteligencja, tym bardziej widoczna będzie ta dysproporcja.