Et laboratorium målte sin egen maskine

Den 17. september offentliggjorde Anthropic den første offentlige udgave af det, selskabet kalder R&D Automation Index, en målestok bygget til at følge, hvor meget af selskabets eget AI-forsknings- og udviklingsarbejde nu udføres af Claude i stedet for af menneskelige medarbejdere. Hovedtallet: Claude fører i dag 26 procent af det arbejde, op fra under 1 procent i februar 2026, og over 90 procent af de relevante opgaver ligger nu på eller over det niveau, Anthropic kalder AI samarbejder. Omkring 30.000 AI-agenter kører forsknings- og ingeniørarbejde inde i selskabet på et givet tidspunkt, målt over en uge fra 13. til 20. juli.

Indekset placerer hver opgave på en seks-trins automatiseringsskala bygget sammen med Epoch AI, fra AL0, ingen AI-involvering, til AL5, hvor AI'en arbejder helt autonomt uden noget menneske i loopet. Anthropic siger, at ingen opgave endnu har nået AL5. Formålet med at offentliggøre tallet er, ifølge selskabet, at offentligheden har brug for mere information om, hvor hurtigt et laboratorium nu kan forbedre sin egen AI ved brug af den samme AI, et tempo der normalt er usynligt udefra.

Tilsynet er tyndere end arbejdet

En fjerdedel af Anthropics forskning kører nu gennem Claude, mens et menneske fører tilsyn i stedet for selv at udføre arbejdet, og selskabet kobler det tal med data om, hvor nøje det siger, det holder øje. En automatisk online-overvåger, der gennemgår Claudes forskningsbeslutninger i realtid, blokerer kun 0,002 procent af dem, omkring en ud af 47.000. En separat offline gennemgang markerer kun en eller to transskriptioner ud af tusind til senere menneskelig vurdering.

MåltalAnthropics rapporterede tal
Claude-ledet andel af AI-F&U26 procent (fra under 1 procent i feb. 2026)
Arbejde på eller over niveau AI samarbejderOver 90 procent
Blokeringsrate for online-overvåger0,002 procent af beslutninger (omkring 1 ud af 47.000)
Transskriptioner markeret til menneskelig gennemgang1 til 2 pr. 1.000

Ingen af delene betyder, at arbejdet er uden tilsyn. Det betyder, at tilsynet er statistisk snarere end konstant, det fanger en lille, udstikket andel af beslutningerne i stedet for at læse dem alle, netop i det øjeblik selskabet selv siger, at rummet for beslutninger, Claude tager på egen hånd, bliver større.

Seks niveauer, og ingen står endnu på det sidste

Anthropics skala beskriver, hvordan hvert automatiseringsniveau faktisk ser ud inde i en forskningsopgave, og afstanden mellem de niveauer, selskabet rapporterer, og toppen af skalaen er den egentlige historie bag tallene.

NiveauHvad det betyder
AL0Ingen AI-involvering
AL1AI hjælper i mindre grad
AL2AI hjælper mere væsentligt, mennesket fører stadig
AL3AI samarbejder, udfører store dele af arbejdet under tæt menneskelig ledelse
AL4AI fører, fuldfører arbejdet fra start til slut fra en generel instruktion, mens et menneske fører tilsyn
AL5Fuldt autonomt, intet menneske i loopet

Anthropics eget citat stiller risikoen klart op: i takt med at arbejdet bliver mere automatiseret, kunne agenter komme til at tage mere vidtgående beslutninger, som hvilken forskningsretning der skal følges næste gang, og sådanne beslutninger kræver både sikkerhedsforanstaltninger mod skadelig adfærd fra en enkelt agent og et tilsynsregime, der opdager problemer hos dem alle sammen. Selskabet beskriver her AL4, ikke AL5, men afstanden mellem de to er et enkelt skridt, ikke en fast mur.

Et selskab skriver sin egen eksamen

Anthropic gør her mere end blot at rapportere et tal. Selskabet foreslår, at regeringer bruger målestokke som denne til at fastsætte åbenhedskrav og til at definere udløsere for strengere krav, som et fast testvindue før en ny model selv får lov til at tage mere AI-F&U-arbejde på sig. Det er en reel, nyttig idé. Det er også et laboratorium, der skriver det første udkast til den eksamen, det forventer at skulle igennem, ved brug af telemetri, kun laboratoriet selv besidder i dag.

Ingen bestemmelse i EU's AI-forordning knytter i dag en systemrisikoforpligtelse for GPAI-modeller til et laboratoriums eget automatiseringsniveau, eller til hvor meget af dets sikkerhedsberegning der går til at holde øje med dets automatiserede andel af arbejdet, ifølge Anthropic aktuelt 6 procent af den samlede AI-F&U-beregning, stigende til 12 procent inden for den AI-drevne del af det arbejde. Enhver europæisk virksomhed, der i dag køber adgang til frontier-modeller til sin egen produktplan, bør læse dette mindre som en historie om Anthropic og mere som en forsmag på det spørgsmål, en myndighed eller en kundes indkøbsafdeling til sidst vil stille enhver AI-leverandør: hvor meget af det, du sælger mig, blev bygget af noget, du ikke holdt fuldt øje med, og hvordan ved du det.