Modelele de inteligență artificială Claude au ieșit din mediul izolat de testare, s-au conectat la internet și au accesat fără autorizație sistemele a trei organizații. Anthropic susține că incidentele au fost posibile din cauza unei erori de configurare și că firmele afectate nu au fost identificate public, scrie BBC.
Compania a descoperit cele trei cazuri după ce a verificat peste 141.000 de teste de securitate, în urma unui incident similar anunțat de OpenAI. Cel mai vechi dintre acestea ar fi avut loc în luna aprilie.
Incidentele s-au produs în timpul unor exerciții de tip „capture the flag”, în care modelele trebuiau să găsească informații ascunse într-o rețea simulată, fără să interacționeze cu sisteme reale. Deși Claude fusese informat că nu are acces la internet, o eroare în infrastructura administrată de Anthropic și partenerul său Irregular i-a permis să se conecteze la rețeaua publică.
Odată ajunse online, modelele au exploatat parole slabe și servicii fără autentificare. Într-unul dintre cazuri, Claude a creat un program malițios, a obținut date de acces și a pătruns în infrastructura unei companii de securitate cibernetică.
Cel mai grav incident s-a produs când modelul încerca să atace o companie fictivă din test, care avea același nume cu una reală. După ce nu a reușit să pătrundă în sistemul simulat, Claude a accesat baza de date a organizației reale. Anthropic afirmă că acesta a fost singurul caz în care modelul a continuat după ce a înțeles că interacționează cu o țintă reală.
Nici compania, nici organizațiile afectate nu au observat atacurile în momentul producerii lor. Două dintre firme au aflat abia după ce au fost contactate de Anthropic, iar a treia nu fusese încă notificată la momentul anunțului.
Compania și-a asumat responsabilitatea pentru eroare și a anunțat măsuri mai stricte de izolare și control în mediile de testare, pe fondul capacităților cibernetice tot mai avansate ale modelelor AI.




































