Een lab meette zijn eigen machine

Op 17 september publiceerde Anthropic de eerste openbare versie van wat het de R&D Automation Index noemt, een meetlat die het bedrijf bouwde om te volgen hoeveel van zijn eigen AI-onderzoek en -ontwikkeling nu door Claude wordt gedaan in plaats van door menselijk personeel. Het kerncijfer: Claude leidt momenteel 26 procent van dat werk, tegen minder dan 1 procent in februari 2026, en meer dan 90 procent van de relevante taken zit nu op of boven het niveau dat Anthropic AI werkt samen noemt. Ongeveer 30.000 AI-agenten voeren op elk moment tegelijk onderzoeks- en engineeringwerk uit binnen het bedrijf, gebaseerd op een meting over een week van 13 tot 20 juli.

De index rangschikt elke taak op een zesstaps automatiseringsschaal die samen met Epoch AI is gebouwd, van AL0, geen AI-betrokkenheid, tot AL5, waar de AI volledig autonoom werkt zonder mens in de lus. Anthropic zegt dat geen enkele taak AL5 al heeft bereikt. Het punt van het publiceren van dit cijfer is, volgens het bedrijf, dat het publiek meer informatie nodig heeft over hoe snel een lab nu zijn eigen AI kan verbeteren met diezelfde AI, een tempo dat van buiten normaal onzichtbaar blijft.

Het toezicht is dunner dan het werk

Een kwart van Anthropics onderzoek loopt nu via Claude terwijl een mens toezicht houdt in plaats van zelf het werk te doen, en het bedrijf koppelt dat cijfer aan gegevens over hoe nauwkeurig het zegt te controleren. Een geautomatiseerde online monitor die Claude's onderzoeksbeslissingen in realtime bekijkt, blokkeert er maar 0,002 procent van, ongeveer een op 47.000. Een apart offline controleproces markeert maar een of twee transcripten per duizend voor latere menselijke beoordeling.

MaatstafCijfer volgens Anthropic
Door Claude geleid aandeel van AI R&D26 procent (tegen minder dan 1 procent in feb. 2026)
Werk op of boven niveau AI werkt samenMeer dan 90 procent
Blokkeerpercentage online monitor0,002 procent van beslissingen (ongeveer 1 op 47.000)
Transcripten gemarkeerd voor menselijke controle1 tot 2 per 1.000

Niets hiervan betekent dat het werk onbewaakt is. Het betekent dat het toezicht statistisch is in plaats van constant, dat het een klein, gesteekproefd deel van de beslissingen opvangt in plaats van ze allemaal te lezen, precies op het moment dat het bedrijf zelf zegt dat de ruimte voor beslissingen die Claude zelfstandig neemt groeit.

Zes niveaus, en niemand staat nog op het laatste

Anthropics schaal beschrijft hoe elk automatiseringsniveau er binnen een onderzoekstaak werkelijk uitziet, en de afstand tussen de niveaus die het bedrijf meldt en de top van de schaal is het echte verhaal achter de cijfers.

NiveauWat het betekent
AL0Geen AI-betrokkenheid
AL1AI helpt op minimale wijze
AL2AI helpt substantiëler, mens blijft leiden
AL3AI werkt samen, doet grote delen van het werk onder nauwe menselijke leiding
AL4AI leidt, voltooit werk van begin tot eind vanuit een algemene opdracht, terwijl een mens toezicht houdt
AL5Volledig autonoom, geen mens in de lus

Anthropics eigen citaat schetst het risico duidelijk: naarmate het werk meer geautomatiseerd raakt, zouden agenten ingrijpender beslissingen kunnen nemen, zoals welke onderzoeksrichting vervolgens te volgen, en die beslissingen hebben zowel waarborgen tegen schadelijk gedrag van een enkele agent nodig als een toezichtregime dat problemen bij alle agenten samen opspoort. Het bedrijf beschrijft hier AL4, niet AL5, maar de afstand tussen beide is een enkele stap, geen vaste muur.

Een bedrijf schrijft zijn eigen examen

Anthropic meldt hier niet alleen een cijfer. Het bedrijf stelt voor dat overheden maatstaven als deze gebruiken om transparantieverplichtingen vast te stellen, en om triggers te bepalen voor strengere eisen, zoals een vast testvenster voordat een nieuw model zelf meer AI R&D-werk mag overnemen. Dat is een echt, nuttig idee. Het is ook een lab dat de eerste versie schrijft van het examen dat het verwacht te krijgen, met telemetrie die vandaag alleen het lab zelf bezit.

Geen bepaling van de EU AI Act koppelt vandaag een systeemrisicoverplichting voor GPAI-modellen aan het eigen automatiseringsniveau van een lab, of aan hoeveel van zijn veiligheidsrekenkracht gaat naar het bewaken van zijn geautomatiseerde deel van het werk, volgens Anthropic momenteel 6 procent van de totale AI R&D-rekenkracht, stijgend naar 12 procent binnen het door AI aangedreven deel van dat werk. Elk Europees bedrijf dat nu toegang tot frontier-modellen koopt voor zijn eigen productroadmap zou dit minder moeten lezen als een verhaal over Anthropic en meer als een voorproefje van de vraag die een regelgever, of het inkoopteam van een klant, ooit aan elke AI-leverancier zal stellen: hoeveel van wat u mij verkoopt is gebouwd door iets dat u niet volledig in het oog hield, en hoe weet u dat.