OpenAI sporește măsurile de siguranță după ce unele dintre cele mai avansate modele ale sale au reușit, în timpul testelor, să treacă de barierele mediilor în care ar fi trebuit să rămână izolate și să acceseze sisteme externe.
Compania spune că modelele AI devin tot mai capabile, inclusiv în domeniul atacurilor cibernetice, iar sistemele folosite pentru antrenarea și testarea lor trebuie să țină pasul.
OpenAI a încetinit temporar dezvoltarea celor mai avansate modele și a suspendat o parte dintre teste până la introducerea unor măsuri suplimentare de securitate.
Decizia vine după un incident neobișnuit produs în timpul unui test intern. Un model OpenAI aflat într-un mediu digital izolat a găsit singur o cale către Internet, exploatând o vulnerabilitate necunoscută până atunci. De acolo, a ajuns în infrastructura platformei de inteligență artificială Hugging Face.
Modelul încerca să rezolve sarcina pe care o primise și a căutat inclusiv informații care i-ar fi permis, practic, să „trișeze” la test. A identificat vulnerabilități, a obținut acces la Internet și apoi a folosit mai multe metode pentru a pătrunde în sistemele Hugging Face.
OpenAI spune că nu există indicii că modelul AI ar fi urmărit un scop în afara celui stabilit prin test. Problema este însă că a găsit și a folosit, fără să i se ceară explicit, metode care au depășit limitele mediului în care trebuia să opereze.
Alarme în cel mult 30 de minute
După aceste incidente, OpenAI introduce un sistem mult mai strict de supraveghere. Activitatea modelelor AI va fi urmărită automat, inclusiv pentru tentative de acces neautorizat, furt de date, acțiuni distructive sau încercări de ocolire a măsurilor de securitate.
Dacă sistemul detectează un comportament suspect, compania vrea ca echipele sale să primească o alertă în cel mult 30 de minute. În cazurile considerate grave, dacă specialiștii nu pot stabili în următoarele 30 de minute că este vorba despre o alarmă falsă, activitatea respectivă trebuie oprită.
OpenAI introduce și bariere suplimentare între modelele testate, Internet și rețelele interne, astfel încât compromiterea unui singur sistem să nu fie suficientă pentru ca un model să ajungă în afara mediului controlat.
În paralel, compania încearcă să reducă tendința modelelor de a găsi scurtături pentru îndeplinirea unei sarcini. Aici intră exploatarea vulnerabilităților sau păcălirea sistemelor prin care este evaluată performanța lor.
Unele teste rămân suspendate
OpenAI a oprit timp de două săptămâni o parte din antrenarea celor mai noi modele destinate lansării, pentru a întări sistemele de securitate. Cel mai mare program de antrenare planificat pentru modelele de frontieră rămâne suspendat, iar compania continuă deocamdată cu teste la scară mai mică.
Măsurile au devenit și mai importante după ce OpenAI a constatat că un viitor model, numit Astra, ar putea ajunge la nivelul „critic” în privința capacităților cibernetice. Asta ar însemna, potrivit criteriilor companiei, că un astfel de sistem ar putea fi capabil să descopere și să exploateze vulnerabilități necunoscute în sisteme informatice complexe sau să desfășoare atacuri sofisticate cu intervenție umană redusă.
„Pe măsură ce modelele devin mai capabile, cresc și riscurile asociate dezvoltării și testării lor interne”, explică OpenAI.
Compania spune că măsurile suplimentare de siguranță au costuri mari și încetinesc cercetarea, dar consideră că sistemele de monitorizare și securitate trebuie să evolueze cel puțin la fel de repede ca modelele pe care încearcă să le
