Et laboratorium målte sin egen maskine
Den 17. september offentliggjorde Anthropic den første offentlige udgave af det, selskabet kalder R&D Automation Index, en målestok bygget til at følge, hvor meget af selskabets eget AI-forsknings- og udviklingsarbejde nu udføres af Claude i stedet for af menneskelige medarbejdere. Hovedtallet: Claude fører i dag 26 procent af det arbejde, op fra under 1 procent i februar 2026, og over 90 procent af de relevante opgaver ligger nu på eller over det niveau, Anthropic kalder AI samarbejder. Omkring 30.000 AI-agenter kører forsknings- og ingeniørarbejde inde i selskabet på et givet tidspunkt, målt over en uge fra 13. til 20. juli.
Indekset placerer hver opgave på en seks-trins automatiseringsskala bygget sammen med Epoch AI, fra AL0, ingen AI-involvering, til AL5, hvor AI'en arbejder helt autonomt uden noget menneske i loopet. Anthropic siger, at ingen opgave endnu har nået AL5. Formålet med at offentliggøre tallet er, ifølge selskabet, at offentligheden har brug for mere information om, hvor hurtigt et laboratorium nu kan forbedre sin egen AI ved brug af den samme AI, et tempo der normalt er usynligt udefra.
Tilsynet er tyndere end arbejdet
En fjerdedel af Anthropics forskning kører nu gennem Claude, mens et menneske fører tilsyn i stedet for selv at udføre arbejdet, og selskabet kobler det tal med data om, hvor nøje det siger, det holder øje. En automatisk online-overvåger, der gennemgår Claudes forskningsbeslutninger i realtid, blokerer kun 0,002 procent af dem, omkring en ud af 47.000. En separat offline gennemgang markerer kun en eller to transskriptioner ud af tusind til senere menneskelig vurdering.
| Måltal | Anthropics rapporterede tal |
|---|---|
| Claude-ledet andel af AI-F&U | 26 procent (fra under 1 procent i feb. 2026) |
| Arbejde på eller over niveau AI samarbejder | Over 90 procent |
| Blokeringsrate for online-overvåger | 0,002 procent af beslutninger (omkring 1 ud af 47.000) |
| Transskriptioner markeret til menneskelig gennemgang | 1 til 2 pr. 1.000 |
Ingen af delene betyder, at arbejdet er uden tilsyn. Det betyder, at tilsynet er statistisk snarere end konstant, det fanger en lille, udstikket andel af beslutningerne i stedet for at læse dem alle, netop i det øjeblik selskabet selv siger, at rummet for beslutninger, Claude tager på egen hånd, bliver større.
Seks niveauer, og ingen står endnu på det sidste
Anthropics skala beskriver, hvordan hvert automatiseringsniveau faktisk ser ud inde i en forskningsopgave, og afstanden mellem de niveauer, selskabet rapporterer, og toppen af skalaen er den egentlige historie bag tallene.
| Niveau | Hvad det betyder |
|---|---|
| AL0 | Ingen AI-involvering |
| AL1 | AI hjælper i mindre grad |
| AL2 | AI hjælper mere væsentligt, mennesket fører stadig |
| AL3 | AI samarbejder, udfører store dele af arbejdet under tæt menneskelig ledelse |
| AL4 | AI fører, fuldfører arbejdet fra start til slut fra en generel instruktion, mens et menneske fører tilsyn |
| AL5 | Fuldt autonomt, intet menneske i loopet |
Anthropics eget citat stiller risikoen klart op: i takt med at arbejdet bliver mere automatiseret, kunne agenter komme til at tage mere vidtgående beslutninger, som hvilken forskningsretning der skal følges næste gang, og sådanne beslutninger kræver både sikkerhedsforanstaltninger mod skadelig adfærd fra en enkelt agent og et tilsynsregime, der opdager problemer hos dem alle sammen. Selskabet beskriver her AL4, ikke AL5, men afstanden mellem de to er et enkelt skridt, ikke en fast mur.
Et selskab skriver sin egen eksamen
Anthropic gør her mere end blot at rapportere et tal. Selskabet foreslår, at regeringer bruger målestokke som denne til at fastsætte åbenhedskrav og til at definere udløsere for strengere krav, som et fast testvindue før en ny model selv får lov til at tage mere AI-F&U-arbejde på sig. Det er en reel, nyttig idé. Det er også et laboratorium, der skriver det første udkast til den eksamen, det forventer at skulle igennem, ved brug af telemetri, kun laboratoriet selv besidder i dag.
Ingen bestemmelse i EU's AI-forordning knytter i dag en systemrisikoforpligtelse for GPAI-modeller til et laboratoriums eget automatiseringsniveau, eller til hvor meget af dets sikkerhedsberegning der går til at holde øje med dets automatiserede andel af arbejdet, ifølge Anthropic aktuelt 6 procent af den samlede AI-F&U-beregning, stigende til 12 procent inden for den AI-drevne del af det arbejde. Enhver europæisk virksomhed, der i dag køber adgang til frontier-modeller til sin egen produktplan, bør læse dette mindre som en historie om Anthropic og mere som en forsmag på det spørgsmål, en myndighed eller en kundes indkøbsafdeling til sidst vil stille enhver AI-leverandør: hvor meget af det, du sælger mig, blev bygget af noget, du ikke holdt fuldt øje med, og hvordan ved du det.
Læs videre: Anthropics Sikkerhedsrapport Lister Egne Fejl | En AI Formaliserede Fermats Sidste Sætning på 11 Dage



