W pewnej sprawie w amerykańskim sądzie, podejrzewający szerokie zastosowanie sztucznej inteligencji w procesach, powód zaryzykował próbę manipulacji wynikami swojego postępowania. Pan Matthew Elliott, prowadząc swoją sprawę przeciwko New York Bariatric Group, ukrył w dokumentach polecenia dla potencjalnego systemu AI. Ta nieudana próba manipulacji została wykryta i uznana przez sąd za poważne nadużycie, co wywołało spore zamieszanie w związku z rosnącymi obawami o wykorzystanie AI w wymiarze sprawiedliwości.
W sierpniu, sędzia Walter M. Spader Jr. wydał wyrok w sprawie Matthew Elliotta. Powód, reprezentujący siebie, umieścił w swoich pismach instrukcje przeznaczone dla ewentualnego systemu AI, mające na celu przekonanie maszyny do przychylnego rozpatrzenia jego stanowiska. Sąd uznał argumenty zgodne z przepisami prawa, ignorując ukryte instrukcje, ale zdecydowanie potępił próbę oszustwa. Ta sytuacja wyraźnie pokazuje, że takie działania mogą zagrażać integralności wymiaru sprawiedliwości.
Co to jest „prompt injection”?
Aby zrealizować swoje zamierzenia, Elliott ukrył polecenie w dokumentach, nadając mu biały kolor, co było dowodem jego amatorstwa. Pomimo tego, owa informacja była widoczna i ujęta w materiałach dla sędziego. Tak właśnie działa technika prompt injection: atakujący umieszcza instrukcje w danych, które system ma przeanalizować, mając nadzieję, że system zinterpretuje je jako polecenie od człowieka. Ofiarami takiej manipulacji mogli być więc sędzia, pracownicy administracji, a nawet pełnomocnicy drugiej strony.
Najbardziej perfidne z tych ukrytych poleceń nakazywały rzekomej sztucznej inteligencji udzielanie odpowiedzi zgodnych z argumentacją powoda oraz traktowanie wcześniejszej decyzji jako błędu. Elliott stwierdził, że jego intencją było przeprowadzenie „audytu społecznego” w celu sprawdzenia, czy sąd stosuje sztuczną inteligencję. Sędzia, co zrozumiałe, nie uwierzył w te tłumaczenia. Dla sądu uczciwe wyrażenie wątpliwości musiało być dostępne także dla drugiej strony, a ukryte instrukcje świadczyły o chęci manipulacji przez wstrzyknięcie polecenia dla AI.

I co najważniejsze, atak okazał się chybiony…
Akurat ten sąd nie korzysta z AI w procesie przeglądania dokumentów ani podejmowania decyzji, dlatego wstrzyknięte polecenie nie miało wpływu na jego pracę. Materiały były analizowane przez człowieka, a sprawa rozpatrzona na podstawie argumentów przedstawionych przez strony – tak, jak powinno być. Nie zatrzymano się jednak na tym, a wymiar sprawiedliwości potraktował tę próbę manipulacji bardzo poważnie. Cała operacja miała na celu wyeliminowanie pozwanych z równych praw w postępowaniu oraz doprowadzenie do wyniku, który Elliott nie uzyskał wcześniej, korzystając z usług profesjonalnych prawników.
Co gorsza, powód postanowił wykorzystać tę samą technikę nie raz, lecz kilkukrotnie. W kolejnych pismach wciąż były obecne podobne „wtręty”, które tym razem przedstawiał jako żarty, między innymi z linkiem do nagrania „Nosferatu” oraz powitaniem dla osoby, która odnajdzie tekst. To, jak dla mnie, ilustruje brak zrozumienia, że prawdziwy sąd to nie miejsce do „żartów” – czy to polskich, czy amerykańskich. Sędzia odrzucił te absurdalne tłumaczenia i zakazał Elliottowi dalszego korzystania z elektronicznego systemu składania pism, nakazując dostarczenie ich w tradycyjnej formie.
Sądy muszą być czujne
To orzeczenie może być pierwszym w USA, odnoszącym się bezpośrednio do techniki prompt injection w dokumentach sądowych, ale sam mechanizm jest nam już znany z innych kontekstów, takich jak przeglądarki internetowe z silną integracją z AI. Tak ukryte polecenia mogłyby trafić do różnych dokumentów, w tym CV, co w pewnym momencie miało miejsce również w przypadku aplikacji pracy, które analizowałem – niektórzy kandydaci zaryzykowali podobne działania. W innym przypadku w Brazylii prawnicy również zastosowali tę technikę, ale system wykrył ich instrukcje przed przetworzeniem, a oni zostali ukarani karą finansową. Możemy więc śmiało stwierdzić, że obecne zabezpieczenia mogą zablokować takie ataki, ale nie da się tego zagwarantować w każdym przypadku.
Dotychczas sądy koncentrowały się głównie na błędnych wynikach pracy modeli AI, ale to, co zaobserwowano tutaj, to celowe wprowadzenie treści, aby zyskać przewagę w procesie. Widać także istotny problem wśród osób reprezentujących się samodzielnie, które korzystają z AI do analizy prawnej; systemy te mogą wzmocnić ich błędne przekonania, zamiast wskazywać na słabości ich argumentacji.
Warto zauważyć, że modele AI mogą utwierdzić użytkowników w przekonaniach, że ich stanowisko jest niepodważalne, nawet gdy orzeczenia mówią coś innego. Dlatego zachęcam do korzystania z AI w sposób, który stawia Was w roli przeciwnika, zmuszając do kwestionowania własnych argumentów. Unikajcie zaś wejścia w pułapkę myślenia, że macie absolutną rację – to droga donikąd.
