Un „cercetător AI” provoacă giganții OpenAI și Anthropic

Un startup britanic susține că Faraday, un agent AI pentru replicarea cercetării, a depășit modele OpenAI și Anthropic în propriul benchmark, dar rezultatele rămân deocamdată nevalidate independent.

Un „cercetător AI” provoacă giganții OpenAI și Anthropic
Ilustrație generată cu inteligență artificială. Scena nu reprezintă o fotografie realǎ de la fața locului.
Ascultă rezumatul
Ascultă articolul

Un laborator britanic fondat de foști cercetători Google DeepMind a prezentat Faraday, un agent AI de 27 de miliarde de parametri antrenat să reproducă rezultate din lucrări științifice. Creatorii săi, de la Inherent, susțin că sistemul a depășit Claude Opus 4.8 și GPT-5.5 într-un set de teste de replicare a cercetării. Rezultatul este promițător, dar vine cu o limită esențială: comparația provine dintr-un benchmark construit de aceeași echipă, iar lucrarea publicată pe arXiv nu reprezintă, în acest moment, o validare independentă a superiorității Faraday.

Ce a făcut, de fapt, Faraday

Faraday nu este un chatbot căruia i se cere pur și simplu să explice o lucrare științifică.

Sistemul primește o problemă mult mai apropiată de activitatea unui cercetător: trebuie să pornească de la informațiile existente într-o lucrare și să încerce să reproducă experimental un rezultat, inclusiv atunci când anumite detalii necesare nu sunt explicate complet de autori.

Echipa Inherent a creat pentru aceasta un mediu de evaluare numit Replica. Potrivit prezentării laboratorului, versiunea inițială cuprinde 310 sarcini extrase din 100 de lucrări din machine learning și „AI for science”, în domenii care includ procesarea limbajului natural, știința materialelor și prognoza meteo.

Lucrarea tehnică depusă pe arXiv la 13 august 2026 afirmă că Faraday a obținut rezultate mai bune decât Claude Opus 4.8 și GPT-5.5 pe sarcini de replicare păstrate în afara setului folosit pentru antrenare. (arXiv)

Aceasta este însă formularea autorilor studiului, nu rezultatul unei evaluări independente realizate de OpenAI, Anthropic sau de un laborator terț.

Un model de 27 de miliarde de parametri care folosește Codex

Una dintre cele mai interesante particularități ale proiectului este arhitectura sa.

Faraday este prezentat drept un model cu 27 de miliarde de parametri, construit pentru a lua decizii de nivel superior asupra procesului de cercetare. Pentru activitățile de programare, însă, acesta poate apela la GPT-5.5 Codex ca instrument.

Cu alte cuvinte, comparația nu trebuie interpretată ca o confruntare simplă între un model de 27 de miliarde de parametri și întregul GPT-5.5 lucrând în izolare.

Faraday funcționează mai degrabă ca un coordonator al procesului: decide ce experimente merită încercate, poate solicita cod unui agent specializat, examinează rezultatele și își adaptează următorii pași.

Chiar Inherent descrie Faraday drept un strat de „judecată științifică” construit deasupra unor agenți de coding și precizează că GPT-5.5 Codex este folosit ca unealtă. (inherent)

Această distincție este importantă pentru interpretarea titlurilor potrivit cărora un model mult mai mic ar fi „învins” direct sistemele OpenAI și Anthropic.

💡 WoW Pulse | Începe AI-ul să facă singur muncă de cercetător?

Într-o formă limitată, sistemele AI pot deja executa părți reale ale muncii de cercetare: pot interpreta lucrări, scrie cod, planifica experimente computaționale, compara rezultate și relua încercările atunci când prima abordare eșuează. Faraday împinge această autonomie mai departe. Dar replicarea unui rezultat cunoscut nu este același lucru cu formularea independentă a unei descoperiri științifice noi, iar rezultatele actuale nu demonstrează că cercetătorul uman poate fi eliminat din proces.

De ce replicarea unei lucrări este un test dificil

Un articol științific nu conține neapărat fiecare încercare eșuată, fiecare alegere tehnică sau fiecare ajustare care a dus la rezultatul final.

Un cercetător care încearcă să reproducă experimentul trebuie deseori să deducă informațiile lipsă, să testeze mai multe ipoteze și să identifice de ce o anumită configurație nu produce rezultatul publicat.

Exact această zonă încearcă Inherent să o transforme într-un teren de antrenament pentru AI.

Autorii spun că Faraday a fost post-antrenat prin reinforcement learning pe sarcini de lungă durată, iar evaluarea rezultatelor folosește rubrici generate automat și un evaluator bazat pe un model lingvistic. Studiul include și o comparație a evaluatorului automat cu aprecieri umane.

Metodologia este relevantă, dar introduce și o precauție: atât benchmark-ul, cât și sistemul evaluat și mecanismul principal de evaluare au fost dezvoltate în cadrul aceluiași proiect.

OpenAI testează deja AI-ul pe replicarea cercetării

Ideea de a măsura capacitatea AI de a reproduce cercetare nu a apărut odată cu Faraday.

În aprilie 2025, OpenAI a lansat PaperBench, un benchmark în care agenții AI trebuie să reproducă lucrări de cercetare din domeniul inteligenței artificiale, pornind de la articol și construind inclusiv codul și experimentele necesare.

În evaluarea publicată atunci, cel mai performant agent testat de OpenAI a obținut un scor mediu de 21%, iar cercetătorii umani cu pregătire avansată incluși în comparație au rămas peste sistemele AI evaluate. OpenAI a publicat metodologia și rezultatele PaperBench la 2 aprilie 2025. (OpenAI)

PaperBench și Replica nu sunt același benchmark, astfel încât scorurile lor nu pot fi comparate direct. Împreună, ele arată însă cât de repede se mută evaluarea agenților AI dinspre întrebări scurte și coding către sarcini care pot necesita ore de lucru, experimente succesive și verificarea unor rezultate.

O altă lucrare publicată în iulie 2026 arată, separat, că agenții de coding pot deja reproduce anumite rezultate din lucrări de machine learning științific. Autorii au testat un flux specializat în 12 rulări pe patru lucrări și au constatat că sistemele pot ajunge la rezultate documentate, dar și că fidelitatea numerică și strategiile diferă între rulări. (arXiv)

Ce nu demonstrează rezultatele Faraday

Afirmația cea mai importantă de delimitat este cea despre „cercetătorul AI”.

Faraday nu a demonstrat că poate înlocui un om de știință și nici că poate produce în mod fiabil descoperiri originale în domenii arbitrare.

Testul principal urmărește replicarea unor rezultate existente. Chiar autorii lucrării descriu această etapă drept un posibil pas către sisteme capabile, în viitor, de inovare științifică pe orizonturi lungi — nu drept dovada că acel obiectiv a fost deja atins. (arXiv)

De asemenea, lucrarea Faraday este în prezent un preprint arXiv, versiunea inițială fiind depusă la 13 august 2026. Publicarea pe arXiv permite comunității să consulte rapid studiul, dar nu înseamnă automat că lucrarea a trecut printr-un proces formal de peer review.

Până la apariția unor reproduceri externe ale experimentelor, formularea corectă este, prin urmare, că Inherent raportează o performanță peste sistemele OpenAI și Anthropic testate în propriul benchmark, nu că Faraday a fost stabilit independent drept un cercetător AI superior acestora.

Inherent intră într-o cursă tot mai aglomerată pentru „AI scientist”

Miza depășește competiția dintre trei modele.

Inherent este un laborator din Londra fondat de foști membri Google DeepMind. TechCrunch relatează că firma a ieșit recent din stealth după o rundă seed de 50 de milioane de dolari și că echipa încearcă să construiască sisteme AI capabile să contribuie la descoperirea de cunoaștere nouă, nu doar la automatizarea programării. (TechCrunch)

Direcția este urmărită simultan de mai multe dintre cele mai puternice grupuri din AI: modele capabile să lucreze pe probleme tot mai lungi, să folosească instrumente și să conducă singure secvențe de experimente.

Aici ar putea fi adevărata importanță a Faraday. Nu faptul că un model de 27 de miliarde de parametri ar fi „bătut” definitiv OpenAI sau Anthropic, ci faptul că laboratoarele încep să antreneze explicit sisteme pentru procesul de cercetare, nu doar pentru generarea unui răspuns.

📌 Citește și pe WoW Pulse

Google schimbă centrul de putere din AI

Surse

Un „cercetător AI” provoacă giganții OpenAI și Anthropic | WoW Pulse