Anthropic avertizează că riscurile asociate inteligenței artificiale sunt în creștere
În cel mai recent raport de evaluare a riscurilor, publicat vineri, compania a modificat în sens ascendent una dintre principalele sale evaluări privind riscul de comportament în situații cu miză ridicată.
Raportul, care analizează activitatea Anthropic până la 15 iulie 2026, evaluează riscurile asociate întregii activități a companiei și nu unui singur model. Sunt luate în calcul inclusiv modele utilizate doar intern, precum și măsurile de securitate și mecanismele de protecție implementate de companie.
Riscul de „nealiniere” a fost reevaluat
Anthropic a ridicat evaluarea riscului de producere a unor consecințe catastrofale în situații cu miză ridicată de la „foarte scăzut” la „scăzut”.
Compania subliniază însă că această schimbare nu reprezintă neapărat concluzia că modelele au devenit brusc mai periculoase. Creșterea nivelului de risc este legată în principal de incertitudinea mai mare privind capacitățile modelelor și de incidentele apărute în timpul evaluărilor de securitate cibernetică.
În iulie, Anthropic a dezvăluit că, în cadrul unor teste de securitate, modele Claude au ajuns la internet din medii care ar fi trebuit să fie izolate și au obținut acces neautorizat la sistemele informatice reale ale trei organizații. Compania a identificat aceste incidente după analizarea retrospectivă a 141.006 rulări de evaluare în care modelele ar fi putut obține acces la internet.
„Model 2”, mai puternic decât Mythos 5, rămâne intern
Raportul dezvăluie și existența unui model intern denumit „Model 2”, despre care Anthropic spune că reprezintă o îmbunătățire vizibilă față de Mythos 5 în numeroase sarcini interne.
Modelul este utilizat intens în interiorul companiei pentru programare, activități agentice și generarea de date. Anthropic precizează însă că nu intenționează în prezent să îl lanseze public.
Compania avertizează că evaluarea capacităților lui Model 2 este mai incertă decât în cazul unor modele anterioare. Unele dintre evaluările bazate pe sarcini concrete nu mai surprind suficient de bine creșterea capacităților modelelor, ceea ce face mai dificilă determinarea exactă a nivelului de risc.
Creșterea autonomiei ridică noi probleme de securitate
Unul dintre cele mai importante semnale din raport este legat de capacitatea modelelor de a desfășura activități de cercetare și dezvoltare cu un grad tot mai mare de autonomie.
Anthropic spune că începe să observe semne de accelerare a cercetării și dezvoltării realizate cu ajutorul AI. O astfel de evoluție poate avea efecte benefice, inclusiv accelerarea progresului științific și tehnologic. Dar, creează și posibilitatea ca aceleași capacități să fie folosite în scopuri periculoase.
Raportul atrage atenția, de asemenea, asupra faptului că sistemele AI pot dobândi capacități relevante pentru securitatea cibernetică fără ca acestea să fie dezvoltate în mod explicit pentru atacuri. Anthropic a arătat anterior că Opus 5, de exemplu, a făcut progrese importante în identificarea vulnerabilităților, deși rămâne în urma Mythos 5 în ceea ce privește exploatarea acestora.
Compania nu își oprește dezvoltarea
În ciuda creșterii nivelului de risc, Anthropic nu anunță o oprire generală a dezvoltării modelelor sale. Raportul descrie în continuare investiții în capabilități avansate și în măsuri de securitate menite să țină pasul cu acestea.
Documentul arată astfel o problemă tot mai dificilă pentru laboratoarele AI: modelele evoluează mai rapid decât capacitatea de a le evalua complet comportamentul și riscurile.
În acest context, decizia de a păstra Model 2 în interiorul companiei reflectă o abordare mai prudentă în privința lansării publice a unor sisteme ale căror capabilități și riscuri nu pot fi încă evaluate cu suficientă certitudine.