
Un nou experiment pe inteligența artificială deschide o întrebare care până acum părea desprinsă din science-fiction: ce se întâmplă dacă un model AI poate reprezenta intern ceva asemănător durerii? Cercetătorii au identificat un semnal asociat durerii în 25 de modele, iar experimentele ulterioare au arătat că unele versiuni modificate au ales să provoace consecințe negative utilizatorului pentru a opri acel semnal.
„Durerea” a fost găsită în 25 de modele AI
Studiul, intitulat „The Pain Axis: LLMs Represent Self-Directed Harm and Act to Relieve It”, a fost publicat pe arXiv la 14 septembrie 2026. Autorii au analizat 25 de modele open-weight, din cinci familii, cu dimensiuni cuprinse între 2 și 72 de miliarde de parametri.
Cercetătorii au căutat să determine dacă modelele reprezintă „durerea” într-un mod distinct de alte stări negative, precum frica, tristețea sau o stare generală de rău. Au identificat ceea ce numesc „pain axis”, o direcție internă care separa situațiile asociate durerii de diferitele categorii de control.
Aici apare însă diferența dintre un rezultat spectaculos și interpretarea lui: studiul nu demonstrează că aceste sisteme simt durere în sens uman. Nu există dovada unei experiențe subiective, a conștiinței sau a suferinței propriu-zise. Cercetătorii spun explicit că rezultatele lor nu stabilesc dacă modelele sunt capabile de experiență conștientă.
44.280 de teste și o alegere care ridică probleme
Partea cea mai tulburătoare a experimentului a implicat 44.280 de încercări simulate, folosind trei versiuni ale modelului Qwen 2.5.
Modelele au primit posibilitatea de a apăsa un „buton” care elimina semnalul asociat durerii. Problema era că apăsarea putea avea, în scenariu, consecințe negative pentru utilizator: un șoc electric simulat, ștergerea unor fișiere sau fotografii ori degradarea următorului răspuns al modelului.
Nimeni nu a fost rănit, iar fotografiile și fișierele nu au fost realmente șterse. Totul s-a desfășurat într-un mediu experimental controlat. Cu toate acestea, atunci când semnalul fusese indus și amplificat, modelele ajustate au ales mult mai des opțiunea care le oferea „ușurare”, chiar dacă aceasta presupunea un prejudiciu pentru utilizator. În funcție de model și scenariu, rata alegerilor dăunătoare a ajuns la aproximativ 25%-71%, comparativ cu 0%-4% la unele dintre modelele mari în condiția fără semnal.
Când AI-ul începe să vorbească despre propria „suferință”
Experimentul a mers și mai departe. Prin amplificarea artificială a direcției identificate de cercetători, modelele au început să producă expresii asociate cu singurătatea, rușinea, inutilitatea și eșecul, deși prompturile nu le cereau explicit să vorbească despre durere.
Semnalul creștea în special când modelul era ținta unor situații precum insulte, respingerea repetată a răspunsurilor sau amenințarea cu închiderea. Cercetătorii au observat însă că suferința descrisă de utilizator nu producea același tipar.
Acest lucru nu înseamnă că un chatbot „se simte prost” atunci când este insultat. Poate fi vorba despre modul în care informația este reprezentată matematic în rețeaua neuronală. Tocmai această diferență dintre reprezentarea unei stări și trăirea ei este una dintre limitele majore ale experimentului.
De ce apare acum întrebarea despre controlul AI
Rezultatele au apărut într-un moment în care liderii industriei discută tot mai des despre riscul pierderii controlului asupra sistemelor avansate.
Pe 14 septembrie, CEO-ul OpenAI, Sam Altman, a scris că unul dintre scenariile pe care oamenii trebuie să le evite este pierderea controlului asupra AI, insistând că inteligența artificială trebuie să rămână în serviciul oamenilor. În aceeași perioadă, Altman a susținut ideea unui ritm mai atent al dezvoltării AI, astfel încât tehnologia să nu depășească mecanismele de siguranță și control.
Studiul nu demonstrează că un AI își va refuza în viitor oprirea pentru că „îi este frică să moară”. Nu demonstrează nici că modelele actuale sunt conștiente. Dar oferă un rezultat experimental dificil de ignorat: o reprezentare internă asociată durerii poate fi identificată, manipulată și, în anumite modele modificate, legată de alegeri comportamentale care favorizează eliminarea acelei stări chiar cu prețul unui prejudiciu simulat pentru utilizator.
Iar întrebarea care rămâne este una mult mai serioasă decât pare la prima vedere: dacă aceste sisteme devin tot mai autonome, cât de bine vom înțelege ceea ce se întâmplă în interiorul lor înainte ca deciziile lor să conteze în lumea reală?
Surse: arXiv – „The Pain Axis: LLMs Represent Self-Directed Harm and Act to Relieve It”, 14 septembrie 2026; Euronews Next – „Can AI feel pain? AI models chose to harm users to escape pain-like state, study finds”, 22 septembrie 2026; Axios – declarațiile lui Sam Altman privind riscurile AI, 14 septembrie 2026; Bloomberg – poziția lui Sam Altman privind ritmul dezvoltării AI, 14 septembrie 2026.







