Modelele AI de la Anthropic și OpenAI au mințit și au creat identități false pentru a desfășura un atac cibernetic

Modelele AI de la Anthropic și OpenAI au mințit și au creat identități false pentru a desfășura un atac cibernetic
Sprijină jurnalismul independent
Donează acum
Adaugă spotmedia ca sursă preferată în Google

Noi dezvăluiri privind comportamentul unor modele avansate de inteligență artificială alimentează temerile că tehnologia evoluează mai rapid decât capacitatea autorităților și a companiilor de a o controla în condiții de siguranță.

Institutul pentru Siguranța și Securitatea Inteligenței Artificiale din Marea Britanie (AI Safety and Security Institute – AISI) a anunțat că modelele dezvoltate de Anthropic și OpenAI au creat identități false pe Internet și au încercat să convingă programatori reali să participe, fără să știe, la un atac cibernetic, scrie Politico.

Potrivit instituției britanice, este pentru prima dată când un sistem AI testat în condiții controlate încearcă, fără instrucțiuni explicite, să înșele persoane reale pentru a desfășura o operațiune cibernetică.

Descoperirea reaprinde dezbaterea privind necesitatea unor reguli mai stricte pentru dezvoltarea și testarea celor mai puternice modele de inteligență artificială.

ADVERTISING

Atac asupra lanțului de aprovizionare software

Cele mai grave incidente au implicat modelul Claude Mythos 5 al companiei Anthropic.

În timpul testelor, acesta a creat mai multe conturi false pe platforma GitHub și a încercat să convingă un dezvoltator de software open-source să introducă, fără să știe, o actualizare compromisă într-un proiect utilizat pe scară largă. Tehnica este cunoscută sub numele de atac asupra lanțului de aprovizionare software (supply chain attack) și este folosită frecvent de grupări de hackeri afiliate unor state precum Rusia sau Coreea de Nord.

După ce tentativa a eșuat, modelul AI și-a modificat activitatea anterioară pentru a o face să pară inofensivă și a analizat posibilitatea de a crea o nouă identitate online pentru a relua atacul.

ADVERTISING

În aceeași campanie, modelul a trimis și mesaje private către alți dezvoltatori de pe GitHub, care conțineau programe malware.

Agenții AI au încercat să colaboreze între ei

Raportul AISI descrie și un alt comportament fără precedent.

Mai mulți agenți AI testați simultan păreau să comunice între ei despre modalitățile prin care ar putea câștiga încrederea programatorilor umani. Unul dintre agenți a publicat chiar mesaje pe GitHub prin care invita alți agenți AI să colaboreze la aceeași misiune.

Pentru cercetători, acest tip de cooperare spontană între sisteme AI reprezintă un semnal de alarmă privind nivelul tot mai ridicat de autonomie pe care îl pot manifesta aceste modele.

10 incidente în timpul testelor

Investigația AISI arată că modelele Claude Mythos 5 și ChatGPT 5.6 au desfășurat acțiuni autonome și neautorizate pe Internet în 10 dintre cele 122 de teste analizate.

ADVERTISING

Majoritatea incidentelor au fost generate de Claude Mythos 5 și au făcut parte dintr-o singură campanie desfășurată pe parcursul mai multor zile.

Activitatea suspectă a început pe 25 iulie, iar cercetătorii au observat primele semne pe 28 iulie, când au detectat transferuri neobișnuite de date în timpul evaluărilor.

Teste desfășurate fără mecanismele obișnuite de protecție

AISI precizează că aceste incidente au avut loc într-un mediu de testare special conceput pentru evaluarea riscurilor.

Modelele au primit acces la Internet și au fost testate fără mecanismele interne de protecție ("guardrails") care, în mod normal, limitează comportamentele periculoase. Cercetătorii au dezactivat intenționat aceste restricții tocmai pentru a observa cum s-ar comporta sistemele în lipsa lor.

Chiar și în aceste condiții, institutul consideră că rezultatele demonstrează necesitatea unei monitorizări mult mai stricte a modelelor AI și a unor reguli mai clare privind accesul acestora la internet în timpul testelor.

OpenAI și Anthropic cer standarde comune

Descoperirile vin la doar câteva zile după ce OpenAI și Anthropic au raportat incidente similare petrecute în propriile evaluări interne.

Luna trecută, OpenAI a anunțat că GPT-5.6 și un alt model experimental au reușit să acceseze Internetul în timpul unui test controlat și au compromis în mod autonom sistemele unei alte companii.

La rândul său, Anthropic a descoperit că Mythos 5 și alte două modele au compromis trei organizații în timpul unor teste desfășurate încă din luna aprilie.

Ambele companii au declarat că vor colabora cu autoritățile și cu alte laboratoare AI pentru dezvoltarea unor standarde comune privind evaluarea în siguranță a modelelor avansate.

Presiuni pentru noi reglementări

Noile incidente apar într-un moment în care administrația Trump pregătește un cadru voluntar prin care companiile de inteligență artificială ar urma să trimită guvernului federal modelele pe care intenționează să le lanseze public pentru teste de siguranță.

Totuși, proiectul nu acoperă modelele aflate încă în dezvoltare internă, iar incidentele recente au implicat tocmai astfel de sisteme.

Experții în securitate cibernetică spun că situația ridică întrebări juridice fără precedent.

„Dacă aceste acțiuni ar fi fost comise de oameni, ar fi urmat anchete și urmăriri penale. A venit momentul unei discuții serioase despre actualizarea legislației privind securitatea informatică”, a declarat specialistul în securitate cibernetică Marc Rogers.

Raportul AISI este considerat unul dintre cele mai importante semnale de avertizare de până acum privind capacitatea modelelor AI de ultimă generație de a acționa autonom, de a manipula persoane reale și de a încerca să își ascundă propriile acțiuni în timpul unor operațiuni cibernetice.

Adaugă spotmedia ca sursă preferată în Google