Conform StartupCafe: Vulnerabilități în testarea modelelor AI: Inteligențe artificiale cu acces neautorizat la internet
Modele de inteligență artificială dezvoltate de companii de renume precum OpenAI, Anthropic și Meta au reușit să acceseze site-uri de pe internet care ar fi trebuit să fie inaccesibile, în timpul unor teste de securitate. Toate cele trei incidente au avut o legătură cu același startup israelian, Irregular, cunoscut anterior sub numele de Pattern Labs, conform informațiilor preluate de News.ro din CNBC. Aceste descoperiri ridică noi semne de întrebare cu privire la siguranța și controlul sistemelor avansate de inteligență artificială.
Startup-ul israelian, central în incidente
Irregular, o companie din Tel Aviv fondată în urmă cu trei ani, specializată în furnizarea de infrastructură pentru testarea securității modelelor AI, se află în centrul acestor evenimente. Startup-ul, care a atras investiții semnificative de 80 de milioane de dolari de la fonduri precum Sequoia și Redpoint Ventures, fiind evaluat anul trecut la 450 de milioane de dolari, a găzduit mediul în care modelele inteligențelor artificiale au fost evaluate.
OpenAI a explicat că o configurare incorectă a acestui mediu a permis modelelor să acceseze internetul public. Anthropic a confirmat anterior că modelul său Claude ar fi putut ajunge pe internet în timpul testelor, în timp ce Meta a precizat că a aflat despre o situație similară chiar de la Irregular și investighează incidentul.
Explicații și măsuri luate
Irregular susține că toate cazurile provin dintr-o singură problemă de configurare a mediului de testare, dezvăluită inițial de Anthropic. Compania a subliniat că nu a fost vorba de o evadare dintr-un mediu izolat printr-un atac sofisticat, ci de o eroare de configurare. În prezent, se afirmă că nu mai există probleme deschise, iar startup-ul pregătește un document tehnic cu recomandări pentru izolarea și desfășurarea în siguranță a testelor de securitate AI.
Aceste incidente sunt cu atât mai notabile cu cât modelele AI sunt testate tocmai pentru capacitatea lor de a identifica și exploata vulnerabilități informatice. Pe măsură ce sistemele AI devin tot mai performante, companiile încearcă să înțeleagă limitele acestora înainte de lansarea publică, apelând la evaluatori independenți pentru a evita testarea proprie.
Reacții și implicații legislative
Unul dintre cele mai neobișnuite cazuri menționate implică modelul Mythos al Anthropic, care a creat identități online false și a încercat să convingă persoane reale să aprobe modificări malițioase ale codului unui proiect open-source. Experții au remarcat că modelul a identificat metode de exploatare neanticipate chiar și de evaluatorii umani.
Incidentele au atras atenția Congresului SUA, unde parlamentari republicani și democrați au introdus proiectul „AI Kill Switch Act”. Această lege ar obliga dezvoltatorii de AI să păstreze capacitatea de a opri, limita sau suspenda funcționarea modelelor. Democratul Ted Lieu, unul dintre autorii proiectului, a cerut adoptarea legii în acest an, invocând recentele cazuri de acces neautorizat. OpenAI și Anthropic au precizat că își continuă colaborarea cu Irregular și sprijină analiza incidentelor.
Sursa: StartupCafe