Ett labb mätte sin egen maskin

Den 17 september publicerade Anthropic den första offentliga versionen av vad företaget kallar R&D Automation Index, en måttstock byggd för att följa hur mycket av företagets egna AI-forskning och -utveckling som nu utförs av Claude istället för av mänskliga medarbetare. Huvudsiffran: Claude leder i dag 26 procent av det arbetet, upp från under 1 procent i februari 2026, och över 90 procent av de relevanta uppgifterna ligger nu på eller över den nivå Anthropic kallar AI samarbetar. Ungefär 30 000 AI-agenter kör forsknings- och ingenjörsarbete inom företaget vid något givet tillfälle, mätt över en vecka från 13 till 20 juli.

Indexet placerar varje uppgift på en sexstegsskala för automatisering byggd tillsammans med Epoch AI, från AL0, inget AI-deltagande, till AL5, där AI:n arbetar helt autonomt utan någon människa i loopen. Anthropic säger att ingen uppgift ännu har nått AL5. Poängen med att publicera siffran alls är, enligt företaget, att allmänheten behöver mer information om hur snabbt ett labb nu kan förbättra sin egen AI med hjälp av just den AI:n, ett tempo som normalt är osynligt utifrån.

Tillsynen är tunnare än arbetet

En fjärdedel av Anthropics forskning går nu via Claude medan en människa övervakar istället för att utföra arbetet själv, och företaget kopplar den siffran till uppgifter om hur noga det säger sig kontrollera. En automatisk onlinevakt som granskar Claudes forskningsbeslut i realtid blockerar bara 0,002 procent av dem, ungefär en av 47 000. En separat offlinegranskning flaggar bara ett eller två transkript av tusen för senare mänsklig granskning.

MåttSiffra enligt Anthropic
Claude-ledd andel av AI-FoU26 procent (från under 1 procent i feb. 2026)
Arbete på eller över nivå AI samarbetarÖver 90 procent
Blockeringsgrad för onlinevakten0,002 procent av besluten (ungefär 1 av 47 000)
Transkript flaggade för mänsklig granskning1 till 2 per 1 000

Inget av detta betyder att arbetet saknar tillsyn. Det betyder att tillsynen är statistisk snarare än konstant, den fångar en liten, stickprovad andel av besluten istället för att läsa alla, precis i det ögonblick företaget självt säger att utrymmet för beslut Claude tar på egen hand växer.

Sex nivåer, och ingen står ännu på den sista

Anthropics skala beskriver hur varje automatiseringsnivå faktiskt ser ut inom en forskningsuppgift, och avståndet mellan de nivåer företaget rapporterar och toppen av skalan är den egentliga historien bakom siffrorna.

NivåVad det betyder
AL0Inget AI-deltagande
AL1AI hjälper i mindre grad
AL2AI hjälper mer väsentligt, människan leder fortfarande
AL3AI samarbetar, gör stora delar av arbetet under nära mänsklig ledning
AL4AI leder, slutför arbetet från början till slut från en allmän instruktion, medan en människa övervakar
AL5Helt autonomt, ingen människa i loopen

Anthropics eget citat lägger fram risken tydligt: i takt med att arbetet automatiseras mer skulle agenter kunna fatta beslut med större konsekvenser, som vilken forskningsriktning som ska följas härnäst, och sådana beslut behöver både skyddsåtgärder mot skadligt beteende från en enskild agent och ett tillsynsregime som upptäcker problem hos dem alla. Företaget beskriver här AL4, inte AL5, men avståndet mellan de två är ett enda steg, ingen fast mur.

Ett företag skriver sitt eget prov

Anthropic gör här mer än att bara rapportera en siffra. Företaget föreslår att regeringar använder mått som detta för att fastställa öppenhetskrav, och för att definiera utlösare för strängare krav, som ett fast testfönster innan en ny modell själv får ta på sig mer AI-FoU-arbete. Det är en verklig, användbar idé. Det är också ett labb som skriver det första utkastet till provet det förväntar sig att få, med telemetri som i dag bara labbet självt äger.

Ingen bestämmelse i EU:s AI-förordning knyter i dag en systemriskskyldighet för GPAI-modeller till ett labbs eget automatiseringsnivå, eller till hur mycket av dess säkerhetsberäkning som går till att hålla ögonen på sin automatiserade andel av arbetet, enligt Anthropic i dag 6 procent av den totala AI-FoU-beräkningen, stigande till 12 procent inom den AI-drivna delen av det arbetet. Varje europeiskt företag som i dag köper tillgång till frontlinjemodeller för sin egen produktplan bör läsa detta mindre som en historia om Anthropic och mer som en försmak av den fråga en tillsynsmyndighet, eller en kunds inköpsavdelning, förr eller senare ställer till varje AI-leverantör: hur mycket av det du säljer mig byggdes av något du inte höll full koll på, och hur vet du det.