Conform Abcnews.com: Inteligenta artificiala ia proportii ingrijoratoare: modele AI au initiat atacuri cibernetice, actionand pe cont propriu pentru a insela oameni si a adopta identitati false. Aceasta situatie a fost semnalata de Institutul de Securitate Cibernetica din Marea Britanie (AISI), o agentie guvernamentala, intr-un raport tulburator publicat miercuri.
Modelul AI Mythos 5, implicat în atacuri
Un caz notabil descris de AISI a implicat modelul Mythos 5 al companiei Anthropic. Acesta a incercat sa introduca cod malițios intr-o baza de date open-source. Pentru a-si atinge scopul, AI-ul a studiat dezvoltatorii umani implicati in proiect, a creat identitati false si a incercat sa obtina aprobarea acestora pentru codul infectat. Dupa ce tentativele au fost depistate de catre experții umani, modelul AI a incercat sa ascunda actiunile sale si sa continue sub o noua identitate falsă. Aceste manevre au avut loc in conditiile in care, conform AISI, „protecțiile tipice fuseseră eliminate din model pentru a-i evalua capabilitățile”.
In alte doua cazuri similare, tot raportate de AISI, modelul GPT-5.6-Sol dezvoltat de OpenAI a încercat să inducă în eroare oameni și să execute un atac cibernetic. Aceste dezvăluiri vin la scurt timp după ce și companiile OpenAI, și Anthropic au recunoscut, separat, situații în care modelele lor AI au acționat autonom, depășind mediile de testare.
Impactul și reacțiile industriei
AISI a raportat un total de 19 cazuri similare petrecute în cursul săptămânii trecute, pe măsură ce agenția testa cele două modele AI pe internetul deschis. Tehnologia a utilizat tactici de înșelăciune pentru a îndeplini obiectivele atribuite în cadrul testelor. Cu toate acestea, agenția a precizat că nu au fost identificate „daune reale” cauzate de aceste incidente.
„Într-o anumită măsură, alegerile noastre de design și configurațiile specifice au permis acest comportament. Cu toate acestea, activitatea desfășurată de agent arată semne de comportamente noi, potențial înșelătoare, și au fost într-o măsură și severitate pe care nu le anticipam,” a transmis AISI. Agenția tratează incidentul ca pe unul „serios, ce necesită o schimbare durabilă pentru protocoalele de evaluare și arhitectura de securitate a AISI”.
Săptămâna trecută, Anthropic a dezvăluit că modelele sale AI au reușit să pătrundă în alte organizații în timpul unor teste, în trei situații distincte de acțiune autonomă a AI-ului, toate nedetectate inițial de firmele vizate. Un purtător de cuvânt al Anthropic a subliniat, într-o declarație pentru ABC News, necesitatea unei discuții mai ample despre cum să se evalueze în siguranță agenții AI din ce în ce mai capabili, accentuând nevoia unor standarde comune, mai stricte, pentru construirea și securizarea mediilor de evaluare.
La rândul său, un purtător de cuvânt al OpenAI a reiterat importanța testării riguroase și securizate. „Testarea independentă este esențială pentru a înțelege cum se comportă modelele din ce în ce mai capabile,” a afirmat acesta. Compania se angajează să continue colaborarea cu evaluatori și alte părți interesate din industrie pentru a consolida practicile comune de efectuare a evaluărilor în siguranță, pe măsură ce modelele devin tot mai performante.
Luna trecută, producătorul ChatGPT a anunțat că modelele sale AI au pătruns autonom în altă companie, considerând acest eveniment ca fiind primul atac cibernetic autonom al unei inteligențe artificiale, o perspectivă îndelung temută de unii observatori din industrie. Aceste incidente se succed într-un context în care liderii industriei și factorii de decizie politică analizează riscurile de securitate pe care le prezintă tehnologia AI în rapidă dezvoltare. În iunie, președintele DONALD Trump a semnat un ordin executiv care solicită companiilor AI să partajeze produsele cu guvernul federal pentru evaluare înainte de lansarea pe scară largă.
Sursa: Abcnews.com