Ett labb mätte sin egen maskin
Den 17 september publicerade Anthropic den första offentliga versionen av vad företaget kallar R&D Automation Index, en måttstock byggd för att följa hur mycket av företagets egna AI-forskning och -utveckling som nu utförs av Claude istället för av mänskliga medarbetare. Huvudsiffran: Claude leder i dag 26 procent av det arbetet, upp från under 1 procent i februari 2026, och över 90 procent av de relevanta uppgifterna ligger nu på eller över den nivå Anthropic kallar AI samarbetar. Ungefär 30 000 AI-agenter kör forsknings- och ingenjörsarbete inom företaget vid något givet tillfälle, mätt över en vecka från 13 till 20 juli.
Indexet placerar varje uppgift på en sexstegsskala för automatisering byggd tillsammans med Epoch AI, från AL0, inget AI-deltagande, till AL5, där AI:n arbetar helt autonomt utan någon människa i loopen. Anthropic säger att ingen uppgift ännu har nått AL5. Poängen med att publicera siffran alls är, enligt företaget, att allmänheten behöver mer information om hur snabbt ett labb nu kan förbättra sin egen AI med hjälp av just den AI:n, ett tempo som normalt är osynligt utifrån.
Tillsynen är tunnare än arbetet
En fjärdedel av Anthropics forskning går nu via Claude medan en människa övervakar istället för att utföra arbetet själv, och företaget kopplar den siffran till uppgifter om hur noga det säger sig kontrollera. En automatisk onlinevakt som granskar Claudes forskningsbeslut i realtid blockerar bara 0,002 procent av dem, ungefär en av 47 000. En separat offlinegranskning flaggar bara ett eller två transkript av tusen för senare mänsklig granskning.
| Mått | Siffra enligt Anthropic |
|---|---|
| Claude-ledd andel av AI-FoU | 26 procent (från under 1 procent i feb. 2026) |
| Arbete på eller över nivå AI samarbetar | Över 90 procent |
| Blockeringsgrad för onlinevakten | 0,002 procent av besluten (ungefär 1 av 47 000) |
| Transkript flaggade för mänsklig granskning | 1 till 2 per 1 000 |
Inget av detta betyder att arbetet saknar tillsyn. Det betyder att tillsynen är statistisk snarare än konstant, den fångar en liten, stickprovad andel av besluten istället för att läsa alla, precis i det ögonblick företaget självt säger att utrymmet för beslut Claude tar på egen hand växer.
Sex nivåer, och ingen står ännu på den sista
Anthropics skala beskriver hur varje automatiseringsnivå faktiskt ser ut inom en forskningsuppgift, och avståndet mellan de nivåer företaget rapporterar och toppen av skalan är den egentliga historien bakom siffrorna.
| Nivå | Vad det betyder |
|---|---|
| AL0 | Inget AI-deltagande |
| AL1 | AI hjälper i mindre grad |
| AL2 | AI hjälper mer väsentligt, människan leder fortfarande |
| AL3 | AI samarbetar, gör stora delar av arbetet under nära mänsklig ledning |
| AL4 | AI leder, slutför arbetet från början till slut från en allmän instruktion, medan en människa övervakar |
| AL5 | Helt autonomt, ingen människa i loopen |
Anthropics eget citat lägger fram risken tydligt: i takt med att arbetet automatiseras mer skulle agenter kunna fatta beslut med större konsekvenser, som vilken forskningsriktning som ska följas härnäst, och sådana beslut behöver både skyddsåtgärder mot skadligt beteende från en enskild agent och ett tillsynsregime som upptäcker problem hos dem alla. Företaget beskriver här AL4, inte AL5, men avståndet mellan de två är ett enda steg, ingen fast mur.
Ett företag skriver sitt eget prov
Anthropic gör här mer än att bara rapportera en siffra. Företaget föreslår att regeringar använder mått som detta för att fastställa öppenhetskrav, och för att definiera utlösare för strängare krav, som ett fast testfönster innan en ny modell själv får ta på sig mer AI-FoU-arbete. Det är en verklig, användbar idé. Det är också ett labb som skriver det första utkastet till provet det förväntar sig att få, med telemetri som i dag bara labbet självt äger.
Ingen bestämmelse i EU:s AI-förordning knyter i dag en systemriskskyldighet för GPAI-modeller till ett labbs eget automatiseringsnivå, eller till hur mycket av dess säkerhetsberäkning som går till att hålla ögonen på sin automatiserade andel av arbetet, enligt Anthropic i dag 6 procent av den totala AI-FoU-beräkningen, stigande till 12 procent inom den AI-drivna delen av det arbetet. Varje europeiskt företag som i dag köper tillgång till frontlinjemodeller för sin egen produktplan bör läsa detta mindre som en historia om Anthropic och mer som en försmak av den fråga en tillsynsmyndighet, eller en kunds inköpsavdelning, förr eller senare ställer till varje AI-leverantör: hur mycket av det du säljer mig byggdes av något du inte höll full koll på, och hur vet du det.
Läs vidare: Anthropics Säkerhetsrapport Listar Egna Fel | En AI Formaliserade Fermats Stora Sats på 11 Dagar



