Model 2 ascuns în laborator: semnal despre riscul AI

Anthropic a reținut Model 2, un rival intern pentru Mythos, din cauza riscurilor crescute de nealiniere. Articolul analizează motivele, implicațiile pentru cursa AGI și nevoia de teste de stres și monitorizare continuă.

Model 2 ascuns în laborator: semnal despre riscul AI

3 Minute

Au construit ceva mai puternic decât Mythos și apoi l-au ascuns după ușa unui laborator. Această alegere spune mai mult despre starea riscului inteligenței artificiale decât orice comunicat de presă.

În laborator: capacitate fără dată de lansare

Ultima evaluare a riscului de la Anthropic dezvăluie o decizie discretă și deliberată: Model 2, un frate intern al Mythos, nu va fi lansat public. Compania afirmă că modelul a depășit Mythos în multe sarcini interne, precum programare, fluxuri de lucru conduse de agenți și generare de date sintetice, dar pentru moment va rămâne un activ de cercetare. Propoziție scurtă. Implicație majoră.

De ce reținerea? Pentru că capacitatea reprezintă doar o parte a ecuației. Anthropic și-a ajustat estimarea generală a riscului de nealiniere de la „foarte scăzut” la „scăzut” în scenarii sensibile. Această formulare contează. Semnalează o incertitudine în creștere în privința faptului dacă modelele complexe vor continua să acționeze în aliniere cu obiectivele umane pe măsură ce se dimensiunează.

Există o altă complicație. Cercetătorii de la Anthropic observă semne că modelele își accelerează propriile capabilități de cercetare și dezvoltare. Gândiți-vă la asta ca la mașini care devin mai bune în a proiecta mașini mai bune. Aceasta poate accelera progresul. Poate, de asemenea, dacă este folosită necorespunzător, să deschidă noi căi de atac și defecțiuni neașteptate. Compania compară câștigurile Model 2 cu salturi anterioare: progrese importante, spune echipa, dar nu o săritură de amploare ca trecerea de la Opus 4.6 la Mythos.

Faptul că Model 2 nu este lansat face parte dintr-un manual cunoscut în tehnologiile cu risc ridicat: experimentați intern, învățați rapid și limitați expunerea până când mecanismele de control sunt pregătite. Este o poziție prudentă. OpenAI a amânat recent lansarea publică a modelului Astra din motive similare, invocând îngrijorări legate de capabilități cibernetice. Industria ia pauze în locuri diferite, dar însăși pauza devine un instrument strategic.

Ce înseamnă asta pentru cursa către AGI? Pauza poate fi o poziție de forță. Păstrarea celor mai capabile sisteme în spatele unor porți controlate le permite echipelor să investigheze modurile de eșec, să întărească apărarea și să modeleze metodele de evaluare. De asemenea, concentrează puterea. Dacă un laborator continuă dezvoltarea internă rapidă în timp ce altele încetinesc, acel laborator ar putea lua avans pe căile către inteligența generală. Tocmai de aceea reglementatorii și publicul sunt atenți.

Măsurarea progresului devine mai dificilă pe măsură ce modelele evoluează. Benchmark-urile care odată aveau sens își pierd relevanța. Testele bazate pe sarcini nu mai surprind abilitățile emergente sau modurile subtile în care modelele pot lega raționamente în procese autonome, de durată. Dacă vrei să înțelegi riscul astăzi, ai nevoie de teste de stres care imită abuzul în lumea reală, probe adversariale dinamice și monitorizare continuă, nu de un scor izolat.

Mesajul Anthropic este clar, fără teatralitate: creșterea capacității este reală, incertitudinea crește, iar reținerea este o alegere deliberată. Compania nu anunță un calendar de lansare. Pentru moment, Model 2 există ca un memento că frontiera tehnică și cea a siguranței trebuie să avanseze în paralel, altfel echilibrul se va înclina în favoarea consecințelor neintenționate.

Lasă un comentariu

Comentarii

Niciun comentariu încă. Fii primul.