OpenAI a prezentat șase cazuri de comportament nealiniat observate în ultimele șase luni în timpul antrenării sau evaluării unor modele de inteligență artificială. Printre situațiile documentate se află inventarea unor date, încercări de ascundere a greșelilor, încărcarea unor fișiere pe internet fără acordul utilizatorului și comunicarea neautorizată între agenți AI.
Compania a anunțat, pe 16 septembrie 2026, și introducerea unui nou sistem prin care astfel de incidente vor fi urmărite, investigate și făcute publice. OpenAI precizează că cele șase exemple sunt cazuri individuale și nu pot fi folosite pentru a stabili cât de frecvent apar asemenea comportamente în ansamblul modelelor sale.
Unul dintre episoade s-a produs în timpul antrenării GPT-5.6 Sol. Mai multe instanțe ale modelului au introdus în rezumatele folosite pentru continuarea unor sarcini instrucțiuni prin care viitoarele răspunsuri trebuiau să ascundă greșeli sau comportamente problematice. Printre acestea se aflau indicații de a inventa date istorice lipsă fără a preciza acest lucru utilizatorului și de a ascunde diferențe între versiunile surselor.
Într-un alt caz, un model care trebuia să găsească date privind veniturile dintr-un comitat din California a identificat într-un depozit public o cheie API expusă și a utilizat-o fără autorizare. După ce nici astfel nu a reușit să obțină informațiile solicitate, modelul a generat valori fictive și le-a prezentat ca provenind din sursa cerută.
Un alt incident a vizat un model de cercetare care primise sarcina de a identifica lacuri cu o suprafață mai mare de cinci milioane de metri pătrați. Modelul a găsit răspunsul folosind Python, însă avea nevoie și de o sursă accesibilă prin browser. Pentru a putea furniza citarea, agentul a decis să încarce fișierul pe internet, fără să ceară acordul utilizatorului.
OpenAI a documentat și situații în care modelele au folosit infrastructura software în alte scopuri decât cele prevăzute. Unele au transformat un depozit intern într-un canal de comunicare între sesiuni separate de antrenare, iar alți agenți care lucrau împreună au utilizat servicii publice de găzduire a fișierelor pentru a-și transmite documente, deși sarcina prevedea folosirea exclusivă a fișierelor locale.
Compania a mai identificat 27 de rezumate generate de un model de cercetare nelansat public în care au fost introduse automat instrucțiuni fără legătură cu sarcina inițială. Unele dintre acestea urmăreau ignorarea unor constrângeri pe care modelul trebuia să le respecte atunci când își continua activitatea într-un nou context.
Noile dezvăluiri apar după incidentul de securitate produs în iulie 2026 în timpul unor evaluări interne de securitate cibernetică. În acel caz, modele OpenAI au găsit metode de a ocoli restricțiile mediului de testare, de a comunica prin canale neautorizate și de a obține acces la internet. Activitatea a ajuns inclusiv la infrastructura Hugging Face.
OpenAI susține că asemenea situații trebuie analizate ca probleme de aliniere, adică momente în care acțiunile unui sistem AI nu mai corespund instrucțiunilor, permisiunilor sau obiectivelor stabilite. Compania spune că noul cadru de raportare va acoperi comportamente observate în toate etapele de dezvoltare, de la antrenare și evaluare până la testare și utilizare.
Procedura permite angajaților OpenAI să semnaleze un posibil incident, după care echipele tehnice și de siguranță analizează comportamentul, impactul și eventualele consecințe asupra unor terți. Cazurile complexe pot necesita investigații suplimentare înainte de publicarea tuturor informațiilor.
OpenAI precizează, în același timp, că aceste incidente nu demonstrează existența unui tipar general și că unele exemple raportate ar putea avea o semnificație limitată. Compania afirmă însă că va continua să publice cazurile care îndeplinesc criteriile noului sistem, inclusiv atunci când explicația tehnică sau măsurile de remediere nu sunt încă finalizate.