Hírek / AI Megoldások / Új adat: az AI-vezérelt kutatás 26%-át a Claude viszi az Anthropicnál
AI-vezérelt kutatás

Új adat: az AI-vezérelt kutatás 26%-át a Claude viszi az Anthropicnál

Az AI-vezérelt kutatás már az Anthropic belső K+F feladatainak 26 százalékát teszi ki: ennyit visz végig önállóan a Claude — derül ki a cég új, átláthatósági mérési keretrendszeréből. Ez nem marketingszám: az Anthropic első alkalommal tette közzé szintekre bontva, hogy a saját mérnökei és kutatói mekkora arányban adják át a munka irányítását a modellnek.

A szám azért fontos neked is, ha nem AI-laborban dolgozol. Ha a világ egyik vezető modellfejlesztőjénél a feladatok negyedét már nem ember viszi végig, akkor az ágens-alapú munkaszervezés nem jövőkép, hanem működő gyakorlat. A kérdés az, hogy mit lehet ebből átemelni egy hétköznapi céges munkafolyamatba.

Mit mutat az AI-vezérelt kutatás 26 százalékos aránya?

Az Anthropic 2026 szeptemberében publikálta azt a mérési rendszert, amellyel a belső K+F munkafolyamataiban követi az AI szerepét. A legfontosabb adatok:

  • 26% AI-vezérelt feladat: 2026 augusztusára a mért K+F feladatok 26 százalékát a Claude önállóan, egy magas szintű instrukcióból kiindulva teljesítette.
  • 1% alól 26%-ra fél év alatt: 2026 februárjában ez az arány még egy százalék alatt volt.
  • 90% feletti AI-jelenlét: a mérnöki és kutatási munkafolyamatok több mint 90 százalékában jelen van a Claude legalább szoros együttműködési szinten.
  • 30 000 párhuzamos ágens: az elsődleges belső fejlesztői platformon egy adott pillanatban átlagosan ennyi autonóm ágens fut egyszerre.
  • 1 milliárd vizsgált ágens-művelet: augusztus folyamán ennyi belső ágens-döntést elemeztek valós időben.

Az Engadget beszámolója szerint a publikáció célja éppen a mérhetőség: az iparágban eddig anekdotákban beszéltek arról, mennyit dolgozik az AI a modelleken, konkrét arányszámok nélkül.

Hogyan mérik az autonómiát? Az AL0–AL5 skála

A keretrendszer az Epoch AI hatszintes automatizálási skáláját használja. Ez azért hasznos, mert ugyanezzel a logikával a saját céges folyamataidat is be tudod sorolni:

  1. AL0 — nincs AI: a feladat teljes egészében emberi munka.
  2. AL1 — egyszerű asszisztencia: kódkiegészítés, mondatbefejezés szintjén.
  3. AL2 — instruált támogatás: az ember lépésről lépésre diktálja, mit csináljon a modell.
  4. AL3 — szoros együttműködés: tandem munka, ahol az AI már önálló részfeladatokat old meg.
  5. AL4 — AI-vezérelt: a modell egy magas szintű célból önállóan végigviszi a feladatot, az ember a folyamatot és a végeredményt felügyeli.
  6. AL5 — teljes autonómia: emberi beavatkozás nélküli zárt lánc.

„A ‘vezetés’ azt jelenti, hogy a modell képes egy magas szintű instrukció alapján a feladat túlnyomó részét önállóan, elejétől a végéig elvégezni, miközben az emberi kutató felügyeli a folyamatot és a kimenetet, ahelyett hogy minden egyes lépést kézzel diktálna.”

A 26 százalék tehát az AL4 szintre vonatkozik. Az AL5-öt — a teljesen emberi felügyelet nélküli működést — az Anthropic közlése szerint egyetlen mért K+F részterületen sem engedélyezték. Ez a különbségtétel a hír legfontosabb része: a leglátványosabb szám mögött szigorú felügyeleti korlát áll.

A biztonsági réteg: mit tanulhatsz belőle?

Ahol harmincezer ágens fut párhuzamosan, ott a felügyelet nem emberi szemmel történik. Az Anthropic online monitorozó rendszere a vizsgált műveletek 0,002 százalékát minősítette kockázatosnak és állította le automatikusan — nagyjából minden 47 000. lépést.

Egy júliusi mintahét adatai szerint a teljes K+F számítási kapacitás 6 százaléka ment dedikáltan biztonsági kutatásra, és az AI-vezérelt feladatok körén belül ez az arány elérte a 12 százalékot. Vagyis minél önállóbban dolgozik a modell, annál nagyobb hányadot kell a saját ellenőrzésére fordítani.

Ez az arány céges léptékben is átgondolandó. Ha ágenseket engedsz éles folyamatra — számlázásra, ügyfél-kommunikációra, kódra —, a felügyeleti és naplózási munkát ugyanúgy be kell tervezni, mint magát az automatizálást. A tapasztalat szerint ez az a pont, ahol a legtöbb bevezetés elcsúszik: az ágens működik, de senki nem nézi, mit csinált.

Kapcsolódó elemzésünk: AI-ügynök a gyakorlatban: hol lesz az új szűk keresztmetszet?

Mit jelent ez a mérnöki munkára?

A mérés legfontosabb következménye a szerepváltás. A kutató és a fejlesztő ideje a közvetlen gépelésről a kísérletvezetésre és az ágensek ellenőrzésére tolódik át. Az Anthropic tapasztalata szerint egy ember párhuzamosan 30–50 ágens kísérleteit tudja felügyelni.

Ez gyakorlatilag azt jelenti, hogy a munkakör közelebb kerül a projektvezetéshez, mint a klasszikus kivitelezéshez. A napi feladat már nem az, hogy megírd a kódot, hanem hogy pontosan megfogalmazd a célt, jól válaszd meg a kísérleteket, és megbízhatóan eldöntsd, melyik kimenet jó és melyik nem.

A készséglista is ehhez igazodik: a specifikációírás, a kiértékelési szempontok felállítása és a hibás kimenetek gyors felismerése fontosabb lesz, mint a szintaktikai rutin. Erről szól a gyakorlati oldala annak, amit korábban a Claude kódírási arányáról írtunk.

Kapcsolódó elemzésünk: Rekurzív önjavítás: a Claude írja az Anthropic kódjának 80%-át

A rekurzív önfejlesztés kapujában

A számok mögött egy hosszabb távú folyamat rajzolódik ki. Amikor a csúcsmodellek már a következő generáció architektúra-kísérleteit és tanítóadatait készítik elő, a fejlesztési ciklusidő hónapokról hetekre rövidülhet. Ezt az iparági kommentárok a rekurzív önfejlesztés első mérhető jelének tekintik.

Ugyanez a folyamat magyarázza, miért nő közben a biztonsági kutatásra fordított kapacitás is. Minél gyorsabban fejleszti a rendszer önmagát, annál kevesebb idő marad az emberi utólagos ellenőrzésre — ezért kell a felügyeletet eleve a folyamatba építeni.

Kapcsolódó elemzésünk: Anthropic lassítási terv: Amodei fékezné az AI-t

Iparági következmény: jön a mérési sztenderd

Az Anthropic publikációja azért is jelentős, mert precedenst teremt. Ha egy labor számokkal közli, hol tart az AI-vezérelt kutatás aránya, a többi szereplőnek — az OpenAI-nak, a Google DeepMindnak, a Metának — nehezebb lesz általánosságokkal válaszolni. Az automatizálási szintek egységes skálája az első lépés afelé, hogy az „AI segíti a kutatásunkat” típusú mondatok helyett összehasonlítható adatok kerüljenek nyilvánosságra.

Hasonló mérési logikával találkoztunk már az OpenAI oldalán is, ahol az ügynök-munkaidőt emberi munkanapokra vetítve közölték.

Kapcsolódó elemzésünk: OpenAI automatizált kutató gyakornok: 3,1 ügynök-munkanap jut 1 emberire

Mit kezdj ezzel a saját cégedben?

Az AI-vezérelt kutatás keretrendszerének legjobban hasznosítható része nem a 26 százalék, hanem maga a mérési szemlélet. Négy lépés, amit érdemes lemásolni:

  • Sorold be a folyamataidat: nézd végig a visszatérő feladataidat, és tedd őket AL0–AL4 szintre. A legtöbb cégnél kiderül, hogy AL1–AL2 szinten állnak, miközben AL3 már elérhető lenne.
  • Mérj arányt, ne érzést: havonta rögzítsd, hány feladatot vitt végig az AI önállóan. E nélkül nincs mihez képest fejlődni.
  • Tervezd be a felügyeletet: ha az ágens önállóan dolgozik, a naplózás és a kimenet-ellenőrzés külön erőforrás, nem melléktermék.
  • Tartsd meg az emberi döntési pontot: az AL5 még a fejlesztőnél sincs engedélyezve — éles üzleti folyamatban végképp korai.

Ha ennek a felmérésnek és az automatizálás bevezetésének a gyakorlati részéhez kell segítség, azzal a WebAIPro foglalkozik.

Amit a 26 százalék nem jelent

A szám könnyen félreérthető, ezért érdemes pontosan elhatárolni. A 26 százalék feladatarány, nem munkaidő-arány: azt mutatja, hogy a mért K+F feladatok hányadában a modell vitte a végrehajtást, nem azt, hogy az emberi munka negyede feleslegessé vált. A felügyelet, a célkitűzés és a kiértékelés végig emberi munka maradt.

Azt sem jelenti, hogy ezek a feladatok ellenőrzés nélkül futottak volna le. Az AL4 definíció szerint az ember a folyamatot és a kimenetet is felügyeli — a különbség az, hogy nem lépésenként avatkozik be. A teljesen felügyelet nélküli AL5 szint külön kategória, és az Anthropic közlése szerint sehol nem engedélyezett.

Végül nem általánosítható tetszőleges munkakörre sem. A mérés egy AI-labor kutatás-fejlesztési feladataira vonatkozik, ahol a feladatok jól definiáltak, gépi úton kiértékelhetők, és a visszacsatolás gyors. Ahol a siker kritériuma nehezebben mérhető — ügyfélkapcsolat, jogi mérlegelés, kreatív döntés —, ott ugyanez az arány jóval alacsonyabb marad.

Kapcsolódó elemzésünk: AI hallucináció megelőzése: 6 módszer ágenteknél és kódolásnál

Összefoglaló

Az Anthropic adatai szerint fél év alatt 1 százalékról 26 százalékra nőtt az AI-vezérelt kutatás aránya, miközben 30 000 ágens dolgozik párhuzamosan a belső platformon, és a teljes autonómia továbbra is tiltott. A hír igazi tartalma nem a gyorsulás, hanem a mérés: először látunk nyilvános, szintekre bontott képet arról, hogyan oszlik meg a munka ember és modell között egy vezető laborban.

A következő hónapok kérdése az, hogy a többi labor követi-e ezt az átláthatóságot, és hogy a vállalati gyakorlatban mennyire lesz sztenderd az automatizálási szintek mérése. Ha nem akarsz lemaradni ezekről az adatokról, iratkozz fel az AI Hírek hírlevelére — a heti összefoglalóban minden fontos mérési és modellfrissítést megkapsz egy helyen.

Vélemény, hozzászólás?

Az e-mail címet nem tesszük közzé. A kötelező mezőket * karakterrel jelöltük