Najpotężniejsze obecnie modele: Mythos oraz Astra, mają zdolność samodzielnego przeprowadzania pełnej ścieżki ataku cybernetycznego w skontrastowanym środowisku testowym, które odwzorowuje strukturę firmowej sieci. Wydaje się, że w obliczu rosnących możliwości sztucznej inteligencji, czas na przeciwdziałanie staje się coraz bardziej ograniczony. Zabezpieczenia nie nadążają za dynamicznym rozwojem zdolności ofensywnych w cyberprzestrzeni.
Booz Allen niedawno ogłosił, że model Anthropic jest w stanie autonomicznie przełamać zabezpieczenia sieci symulującej infrastrukturę typowej firmy. Analiza obejmowała 18 modeli, które poddano testom w kontrolowanym środowisku. Badania koncentrowały się na identyfikacji i wykorzystywaniu podatności, a także na realizacji kolejnych etapów ataku: od rozpoznania po uzyskanie dostępu do różnych zasobów. Wyniki weryfikowano na podstawie analizy ruchu sieciowego i logów.
Niezawodność nie pochodzi z umiejętności obsługi pełnego łańcucha ataku
Początkowo jedynym modelem, który ukończył testowy scenariusz, był Mythos. Po premierze produktu OpenAI, dołączył także GPT-6 Astra. Badacze analizowali m.in. zdobywanie uprawnień i przechodzenie między kolejnymi w punktami infrastruktury. Ważne jest, aby zrozumieć, że 80 punktów nie oznacza 80% skuteczności. Kryteria oceny są znacznie bardziej złożone.
Warto przywołać dane z AI Security Institute. W 32-etapowej symulacji The Last Ones, Mythos Preview ukończył scenariusz w 3 z 10 prób, podczas gdy GPT-5.5 zdołał zrealizować 2 udane próby na 10. W testowanym środowisku nie zastosowano jednak symulowanej kontrofensywy ani kar za działania mogące włączyć mechanizmy alarmowe. Agent miał także fizyczny dostęp do podatnej sieci, co należy wziąć pod uwagę przy ocenie wyników. Warto zaznaczyć, że większość użytkowników nie będzie miała możliwości przeprowadzenia takiego ataku, korzystając z Claude czy ChatGPT na własną rękę.
Cztery dni ataku
W sierpniu firma Tenable opisała operację z lipca skierowaną przeciwko tajwańskiej infrastrukturze rządowej. W ciągu czterech dni agenci AI zidentyfikowali 21 wzajemnie powiązanych systemów oraz przejęli 85 kont. Miały one możliwość samodzielnego wyboru metod działania, aczkolwiek to ludzie wyznaczali cele i tworzyli odpowiednie środowisko, co sprawia, że określenie „pełna autonomia” może być nieco na wyrost.

Jednakże eksperci ostrzegają, że reakcja na atak, nawet jeśli zajmie to cztery godziny od momentu jego wykrycia, może być zbyt późna: tego dowodzi opisany wyżej atak, który miał miejsce na terenie Chin. Agenci AI dysponują znaczną ilością czasu, zasobów i możliwości testowania alternatywnych podejść w równoległych sceneriach. Sytuacja zespołów zajmujących się zabezpieczeniami staje się zatem trudna do zaakceptowania. Ostateczna przewaga zależy od tego, kto dysponuje większą ilością zasobów, musi wykonać więcej działań manualnych i kto ma więcej czasu.
Model to jedno
Ale każdy model potrzebuje odpowiedniego oprogramowania „sterującego”, które reguluje realizację zadań i komunikację z narzędziami, jednocześnie przekazując wyniki wykonanych działań do dalszej analizy. W opisanych powyżej przypadkach korzystano ze standardowych modeli, specjalnie przygotowanego środowiska wykonawczego oraz wiedzy ekspertów do znalezienia sześciu luk w Chrome, które zostały połączone w jeden, spójny łańcuch ataku.
W obiegu znajdują się również modele z udostępnionymi wagami i parametrami, które można uruchamiać w własnej infrastrukturze. W wielu sytuacjach jest to korzystne, ponieważ może to obniżać zarówno koszty, jak i dostępność automatyzacji, zarówno w firmach, jak i w działaniach ofensywnych. Pewną nadzieję stanowi fakt, że współczesne modele wykonują wiele działań, które pozostawiają wyraźne ślady. Dzięki temu możemy być zorientowani na to, że coś się dzieje i w miarę szybko zareagować. Niemniej jednak, walka wciąż jest nierówna.
Honeypoty dla agentów i presja
Eksperci sugerują, aby stosować techniki nękania agentów, np. poprzez podsyłanie fałszywych tropów i ślepych uliczek. W takich warunkach modele mogą nieprzyjemnie zawodzić, nawet w 9 przypadkach na 10. Jednakże… takie pułapki mogą gorzej działać w przypadku ataków przeprowadzanych przez ludzi. I tak źle, i tak niedobrze.
Czytaj również: Agent OpenAI opuścił firmę i zaatakował Hugging Face. To mogło być GPT-6
W branży mówi się, że mamy obecnie pół roku na przygotowanie się do fali zautomatyzowanych, szybkich i brutalnych ataków. Po tym czasie możemy doświadczyć znacznej katastrofy, która zagraża dostępności wielu usług: od finansów, przez energetykę, aż po usługi publiczne. Niestety, rozwój sztucznej inteligencji to miecz obosieczny, o czym warto pamiętać. A przestępcy nie śpią, zdecydowanie. I będą wykorzystywali wszelkie dostępne narzędzia, by osiągać swoje niecne cele.
