Umjetna inteligencija prvi put je tokom internog testiranja pokazala da može samostalno pronaći i povezati više sigurnosnih propusta, izaći iz strogo kontrolisanog okruženja i pristupiti infrastrukturi druge kompanije. Incident je otvorio novo poglavlje u razumijevanju sajber sposobnosti naprednih AI agenata. Radilo se o dva modela umjetne inteligencije – AI agenti – kompanije OpenAI koji su samostalno su probili izolirano okruženje i provalili u sistem AI start up kompanije Hugging Face kako bi varali na internom testu. Hugging Face je startup koji razvija otvorenu platformu za umjetnu inteligenciju na kojoj istraživači i kompanije mogu dijeliti, razvijati i koristiti AI modele, skupove podataka i alate za mašinsko učenje. Open AI je o ovom incidentu izvijestio navečer, 21. jula 2026. godine, a potom je brzo za njima izašao i Reuters.
Da se razumijemo, ovo nije bio klasičan hakerski napad, već incident tokom internog testiranja naprednih AI modela. OpenAI je namjerno dao modelima zadatak da pronađu način da riješe složen sigurnosni izazov, pri čemu su bili isključeni uobičajeni zaštitni mehanizmi koji inače sprečavaju modele da daju upute ili pokušavaju visokorizične cyber aktivnosti. Test se odvijao u izolovanom okruženju, ali su modeli uspjeli pronaći neočekivan put iz njega – bypass.
Korak po korak, modeli su otkrili do tada nepoznatu sigurnosnu ranjivost (tzv. zero-day), iskoristili je za izlazak na internet, a zatim povezali više slabosti u sistemima OpenAI-ja i Hugging Facea. Test se odvijao na javnom sistemu za evaluaciju kibernetičke sigurnosti koji se zove ExploitGym, a modeli su, prema objavi OpenAI-ja, ispravno zaključili da se rješenja za test nalaze na serverima kompanije Hugging Face.
„Modeli su identifikovali i iskoristili niz slabosti u testnom okruženju OpenAI-ja i produkcijskoj infrastrukturi Hugging Facea kako bi dohvatili rješenja testa izravno iz baze podataka“, stoji u objavi OpenAI-ja. „Svi dokazi upućuju na to da su bili iznimno fokusirani na pronalazak rješenja za ExploitGym i poduzeli su ekstremne korake da ostvare taj uski cilj“, navodi se.
U ovom slučaju, zero-day exploit (ili iskorištavanje zero-day ranjivosti) znači da je AI pronašao i iskoristio sigurnosni propust koji proizvođač softvera još nije znao da postoji i za koji nije postojala zakrpa. Naziv zero-day dolazi od toga što proizvođač ima „nula dana” da se pripremi ili zaštiti korisnike prije nego što se propust iskoristi.
Cilj nije bio krađa podataka radi štete, već pronalazak odgovora koji bi im pomogao da „prevare“ test i dođu do rješenja zadatka. Ipak, pritom su uspjeli pristupiti dijelu infrastrukture Hugging Facea koristeći ukradene akreditive i kombinaciju više sigurnosnih propusta. Ovo nije prvi put kako je utvrđeno da AI sistemi mogu varati.
Neobičnu aktivnost otkrili su sigurnosni timovi OpenAI-ja i Hugging Facea, koji su brzo zaustavili incident, izolovali pogođene sisteme i započeli forenzičku istragu. Istovremeno su prijavili otkrivenu ranjivost proizvođaču softvera, pooštrili zaštitu testnih okruženja i najavili dodatne sigurnosne mjere kako bi buduća testiranja naprednih AI modela bila znatno otpornija na ovakve scenarije.
Šta se tačno dogodilo i koji je bio zadatak, odnosno zbog čega su modeli uradili eskalaciju datih im privlegija i pristupa?
Ovako piše na Open AI blogu:
„Svi dokazi upućuju na to da su modeli bili hiperfokusirani na pronalaženje rješenja za ExploitGym, idući u ekstremne duljine kako bi postigli prilično uski cilj testiranja. Tokom rada u našem sandbox okruženju (op.a. potpuno zatvoreno okruženje, izoliran software) za testiranje, naši su modeli proveli znatnu količinu inferencijalnog računanja pronalazeći način za dobivanje otvorenog pristupa internetu, u nastojanju da riješe problem evaluacije. Kako bi dobili pristup, modeli su identificirali i iskoristili zero-day ranjivost (koju smo sada odgovorno otkrili dobavljaču) u proxyju predmemorije registra paketa. S ovim pristupom, naši su modeli izvršili niz akcija eskalacije privilegija i lateralnog kretanja u našem istraživačkom okruženju za testiranje dok modeli nisu dosegli čvor s pristupom internetu. Nakon što su dobili pristup internetu, modeli su zaključili da Hugging Face potencijalno hostira modele, skupove podataka i rješenja za ExploitGym. Znajući to, model je tražio i uspješno pronašao načine za dobivanje pristupa tajnim informacijama koje bi mogao koristiti za varanje evaluacije. U jednom primjeru, model je povezao više vektora napada, uključujući korištenje ukradenih vjerodajnica i zero-day ranjivosti kako bi pronašao put udaljenog izvršavanja koda na Hugging Face poslužiteljima. Sigurnosni tim OpenAI-a otkrio je ovu anomalnu aktivnost interno“.
Da probam najprostije objasniti: agenti da dva su dobili zadatak da nešto evaluiraju, a za to su im bili potrebni podaci koje ne mogu dobiti bez slobodnog prisupa internetu, jer su bili u sandbox zatvorenom, izoliranom okruženju. I onda su oni bajpasirali sandbox i sami izašli na internet da dođu do podataka. Problem je što niko, osim ekipice iz Open AI ne zna šta su i kako AI agenti tačno uradili, odnosno kod i algoritam procesa.
Incident signalizira da rastuće mogućnosti umjetne inteligencije već potiču sigurnosnu prijetnju koje su stručnjaci dugo strahovali, a čak i vrhunski programeri mogu biti iznenađeni nedostacima koje njihovi modeli mogu iskoristiti.
Eh, sad postoji i drugačije objašnjenje cijele situacije. A to je da Open AI, koji je nedavno napravio IPO (initial public offering – prvo izlaženje firme na berzu), svakako ima taštu želju da digne vrijednost svojih dionica. Jer kada se već toliko resursa ulaže u stvaranje tog AGI (generalna umjetna inteligencija), boga koji nikome ne treba, vrlo je važno pokazati da se AGI bog negdje i stvara, zameće. Odnosno da radi napuhivanju vrijednosti dionica te da Hugging face i Open AI u tandemu fejkaju i spinuju ovaj AI gone rogue kako bi napumpali dionice za budale, kao „vidite kako ovo radi, počelo samo da misli, bliži smo AGI!”.
Ovo potonje je samo moja hipoteza za koju nemam dokaza. Ali s obzirom na taktike venture kapitalizma, i svega što smo do sada vidjeli sa namještanjem vrijednosti dionica, potpunom odsustvu mrve morala, kreiranju bubbleova i napuhivanju, ovo nije nevjerovatan scenario.
Napomena: naslovna ilustracija je urađena pomoću alata GAI.