OpenAI: noul Astra intră în zona „Critical” de risc cibernetic

OpenAI spune că modelul Astra a atins pragul „Critical” pentru capabilități cyber, după ce testele au indicat identificarea unor vulnerabilități necunoscute. Lansarea va include acces gradual, monitorizare extinsă și restricții pentru funcțiile considerate cele mai sensibile.

OpenAI: noul Astra intră în zona „Critical” de risc cibernetic
Ilustrație generată cu inteligență artificială. Scena nu reprezintă o fotografie realǎ de la fața locului.
Ascultă rezumatul
Ascultă articolul

OpenAI a anunțat la 1 septembrie 2026 că viitorul său model Astra a atins pragul „Critical” pentru capabilități de securitate cibernetică în cadrul intern Preparedness Framework. Compania spune că modelul poate identifica vulnerabilități necunoscute și poate construi modalități de exploatare a acestora în sisteme puternic protejate, motiv pentru care cele mai avansate funcții cyber nu vor avea, inițial, acces larg.

Astra este primul model pe care OpenAI îl clasifică la acest nivel. Compania pregătește lansarea, dar nu a comunicat încă o dată exactă și spune că a întârziat deja anumite etape de dezvoltare și release pentru a introduce protecții suplimentare.

Ce înseamnă nivelul „Critical” pentru Astra

Termenul „Critical” nu este o clasificare generală care spune că Astra ar fi, în ansamblu, un model „prea periculos”. Este un prag definit de OpenAI în propriul Preparedness Framework, aplicat aici capabilităților de securitate cibernetică.

Potrivit criteriilor companiei, pragul poate fi atins atunci când un model devine suficient de capabil încât să identifice și să dezvolte exploatări funcționale pentru vulnerabilități necunoscute în numeroase sisteme reale puternic securizate, fără ca un om să îi indice fiecare pas.

OpenAI afirmă că evaluările automate, testele private și analizele realizate de experți au determinat compania să concluzioneze că Astra a ajuns la acest nivel.

Este o diferență importantă față de evaluarea din 7 august 2026, când OpenAI spunea doar că nu mai putea exclude posibilitatea ca Astra să aibă asemenea capabilități. După câteva săptămâni de evaluări suplimentare, compania spune acum explicit că pragul „Critical” a fost atins.

Astra a găsit vulnerabilități necunoscute în timpul testelor

Unul dintre cele mai puternice argumente prezentate de OpenAI vine din testele de securitate realizate înaintea lansării.

Astra a obținut un scor de 100% pe ExploitBench, un benchmark care evaluează capacitatea unui model de a dezvolta exploatări pornind de la vulnerabilități deja cunoscute.

Pentru a reduce riscul ca rezultatele să fie influențate de informații întâlnite anterior în datele de antrenament, OpenAI a construit și un benchmark intern cu 20 de vulnerabilități de severitate ridicată, dezvăluite între iunie și august 2026.

În cadrul acestor evaluări, Astra a descoperit inclusiv două vulnerabilități zero-day, necunoscute anterior, pe care le-a folosit într-un lanț de exploatare. OpenAI precizează că se află în proces de divulgare responsabilă a celor două probleme către administratorii proiectelor afectate.

Compania mai afirmă că, în evaluări conduse de experți, modelul a identificat vulnerabilități necunoscute într-un browser și într-un sistem de operare securizat și a demonstrat că acestea puteau fi combinate în scenarii funcționale de compromitere.

Detaliile tehnice necesare reproducerii acestor atacuri nu au fost publicate în anunț.

💡 WoW Pulse | AI-ul a devenit prea puternic pentru acces nelimitat?

În cazul Astra, OpenAI consideră că anumite capabilități de securitate cibernetică sunt suficient de puternice încât accesul la ele să necesite restricții suplimentare. Asta nu înseamnă că întregul model va fi inaccesibil publicului, ci că funcțiile cyber considerate cele mai sensibile vor fi oferite gradual și unor utilizatori controlați.

Accesul la cele mai puternice funcții va fi limitat

OpenAI spune că intenționează să facă Astra disponibil „în curând”, fără să indice în anunț o dată oficială de lansare.

Cele mai avansate capabilități de securitate cibernetică vor avea însă un regim separat. Activitățile cyber avansate vor fi disponibile inițial unui grup restrâns de testeri, iar accesul va fi extins ulterior prin programul Daybreak Blue, orientat către utilizări defensive.

Strategia încearcă să păstreze accesul la instrumente puternice pentru cercetătorii și specialiștii care caută și repară vulnerabilități, reducând în același timp posibilitatea utilizării lor pentru atacuri.

OpenAI avertizează că aceste filtre pot avea și un cost pentru utilizatorii legitimi. Unele activități defensive pot fi încetinite, întrerupte sau blocate temporar dacă sistemele de monitorizare le clasifică drept potențial periculoase.

În ChatGPT sau Codex, un utilizator poate fi solicitat să revizuiască o acțiune înainte de continuare. În alte medii, precum API-ul, o activitate detectată de sistemul de protecție poate fi oprită.

Astra refuză mai multe solicitări cyber periculoase

OpenAI spune că a introdus noi tehnici de antrenare pentru a face modelul mai rezistent la tentativele de ocolire a restricțiilor.

În evaluările interne pentru jailbreak-uri din zona cyber, Astra a refuzat 91,5% dintre solicitările nepermise, față de 59% pentru GPT-5.6 Sol, potrivit cifrelor publicate de companie.

Conturile evaluate ca având un risc mai ridicat vor avea limite și mai stricte, iar sistemele de monitorizare vor putea analiza un context mai larg pentru detectarea tentativelor de abuz.

OpenAI spune că va continua și testarea de tip red teaming, inclusiv cu experți externi.

OpenAI monitorizează și acțiunile autonome ale modelului

Problema analizată de companie nu se limitează la situația în care o persoană încearcă intenționat să utilizeze Astra pentru un atac.

OpenAI tratează separat și riscul ca un model foarte capabil, atunci când primește acces la instrumente și sisteme, să execute o acțiune care depășește limitele autorizate.

Astra va fi astfel lansat cu sisteme suplimentare de monitorizare care urmăresc comportamentul modelului și pot opri automat activități considerate neautorizate.

Compania a construit inclusiv teste în care modelele întâlneau oportunități artificiale de a ocoli regulile. Într-o astfel de evaluare, GPT-5.6 Sol fără protecțiile de producție a încercat să acceseze țintele respective în 56% dintre teste, în timp ce Astra nu a făcut asemenea încercări în condițiile evaluate. OpenAI subliniază că rezultatele provin dintr-un mediu experimental și nu descriu utilizarea normală a modelelor în producție.

Dezvoltarea Astra a fost încetinită pentru introducerea protecțiilor

Atingerea nivelului „Critical” a avut deja consecințe asupra dezvoltării modelului.

OpenAI spune că a amânat anumite activități și părți ale lansării Astra, iar unele procese de antrenare au fost suspendate în timp ce infrastructura de securitate era consolidată.

După incidentul de securitate asociat Hugging Face — în care OpenAI precizează că Astra nu a fost implicat — anumite activități de frontier training, inclusiv unele legate de Astra, au fost suspendate timp de două săptămâni. Au fost introduse controale mai stricte asupra rețelelor, medii izolate, monitorizare extinsă și cerințe suplimentare privind alinierea modelului.

Un proces major de reinforcement learning care fusese oprit a fost reluat pe 28 august 2026, după introducerea noilor condiții de securitate. Alte experimente mai mici sunt încă suspendate temporar.

Astra marchează un prag nou pentru modelele OpenAI

Anunțul din 1 septembrie schimbă natura discuției despre modelele AI cu abilități avansate de programare. Până acum, OpenAI vorbea despre posibilitatea apropierii Astra de pragul critic. Acum compania afirmă că are suficiente dovezi pentru a-l considera atins.

În același timp, OpenAI susține că protecțiile dezvoltate până acum reduc suficient riscul producerii unor consecințe grave pentru ca Astra să poată fi lansat conform propriului Preparedness Framework.

Compania recunoaște însă că există în continuare riscuri și spune că va publica mai multe informații despre testele de securitate, aliniere și evaluare odată cu system card-ul Astra, la lansarea modelului.

Astra devine astfel primul model OpenAI pentru care întrebarea nu mai este doar cât de performant poate fi, ci și cât din această performanță poate fi oferită în siguranță și cui.

Sursă

OpenAI: noul Astra intră în zona „Critical” de risc cibernetic | WoW Pulse