Een lab meette zijn eigen machine
Op 17 september publiceerde Anthropic de eerste openbare versie van wat het de R&D Automation Index noemt, een meetlat die het bedrijf bouwde om te volgen hoeveel van zijn eigen AI-onderzoek en -ontwikkeling nu door Claude wordt gedaan in plaats van door menselijk personeel. Het kerncijfer: Claude leidt momenteel 26 procent van dat werk, tegen minder dan 1 procent in februari 2026, en meer dan 90 procent van de relevante taken zit nu op of boven het niveau dat Anthropic AI werkt samen noemt. Ongeveer 30.000 AI-agenten voeren op elk moment tegelijk onderzoeks- en engineeringwerk uit binnen het bedrijf, gebaseerd op een meting over een week van 13 tot 20 juli.
De index rangschikt elke taak op een zesstaps automatiseringsschaal die samen met Epoch AI is gebouwd, van AL0, geen AI-betrokkenheid, tot AL5, waar de AI volledig autonoom werkt zonder mens in de lus. Anthropic zegt dat geen enkele taak AL5 al heeft bereikt. Het punt van het publiceren van dit cijfer is, volgens het bedrijf, dat het publiek meer informatie nodig heeft over hoe snel een lab nu zijn eigen AI kan verbeteren met diezelfde AI, een tempo dat van buiten normaal onzichtbaar blijft.
Het toezicht is dunner dan het werk
Een kwart van Anthropics onderzoek loopt nu via Claude terwijl een mens toezicht houdt in plaats van zelf het werk te doen, en het bedrijf koppelt dat cijfer aan gegevens over hoe nauwkeurig het zegt te controleren. Een geautomatiseerde online monitor die Claude's onderzoeksbeslissingen in realtime bekijkt, blokkeert er maar 0,002 procent van, ongeveer een op 47.000. Een apart offline controleproces markeert maar een of twee transcripten per duizend voor latere menselijke beoordeling.
| Maatstaf | Cijfer volgens Anthropic |
|---|---|
| Door Claude geleid aandeel van AI R&D | 26 procent (tegen minder dan 1 procent in feb. 2026) |
| Werk op of boven niveau AI werkt samen | Meer dan 90 procent |
| Blokkeerpercentage online monitor | 0,002 procent van beslissingen (ongeveer 1 op 47.000) |
| Transcripten gemarkeerd voor menselijke controle | 1 tot 2 per 1.000 |
Niets hiervan betekent dat het werk onbewaakt is. Het betekent dat het toezicht statistisch is in plaats van constant, dat het een klein, gesteekproefd deel van de beslissingen opvangt in plaats van ze allemaal te lezen, precies op het moment dat het bedrijf zelf zegt dat de ruimte voor beslissingen die Claude zelfstandig neemt groeit.
Zes niveaus, en niemand staat nog op het laatste
Anthropics schaal beschrijft hoe elk automatiseringsniveau er binnen een onderzoekstaak werkelijk uitziet, en de afstand tussen de niveaus die het bedrijf meldt en de top van de schaal is het echte verhaal achter de cijfers.
| Niveau | Wat het betekent |
|---|---|
| AL0 | Geen AI-betrokkenheid |
| AL1 | AI helpt op minimale wijze |
| AL2 | AI helpt substantiëler, mens blijft leiden |
| AL3 | AI werkt samen, doet grote delen van het werk onder nauwe menselijke leiding |
| AL4 | AI leidt, voltooit werk van begin tot eind vanuit een algemene opdracht, terwijl een mens toezicht houdt |
| AL5 | Volledig autonoom, geen mens in de lus |
Anthropics eigen citaat schetst het risico duidelijk: naarmate het werk meer geautomatiseerd raakt, zouden agenten ingrijpender beslissingen kunnen nemen, zoals welke onderzoeksrichting vervolgens te volgen, en die beslissingen hebben zowel waarborgen tegen schadelijk gedrag van een enkele agent nodig als een toezichtregime dat problemen bij alle agenten samen opspoort. Het bedrijf beschrijft hier AL4, niet AL5, maar de afstand tussen beide is een enkele stap, geen vaste muur.
Een bedrijf schrijft zijn eigen examen
Anthropic meldt hier niet alleen een cijfer. Het bedrijf stelt voor dat overheden maatstaven als deze gebruiken om transparantieverplichtingen vast te stellen, en om triggers te bepalen voor strengere eisen, zoals een vast testvenster voordat een nieuw model zelf meer AI R&D-werk mag overnemen. Dat is een echt, nuttig idee. Het is ook een lab dat de eerste versie schrijft van het examen dat het verwacht te krijgen, met telemetrie die vandaag alleen het lab zelf bezit.
Geen bepaling van de EU AI Act koppelt vandaag een systeemrisicoverplichting voor GPAI-modellen aan het eigen automatiseringsniveau van een lab, of aan hoeveel van zijn veiligheidsrekenkracht gaat naar het bewaken van zijn geautomatiseerde deel van het werk, volgens Anthropic momenteel 6 procent van de totale AI R&D-rekenkracht, stijgend naar 12 procent binnen het door AI aangedreven deel van dat werk. Elk Europees bedrijf dat nu toegang tot frontier-modellen koopt voor zijn eigen productroadmap zou dit minder moeten lezen als een verhaal over Anthropic en meer als een voorproefje van de vraag die een regelgever, of het inkoopteam van een klant, ooit aan elke AI-leverancier zal stellen: hoeveel van wat u mij verkoopt is gebouwd door iets dat u niet volledig in het oog hield, en hoe weet u dat.
Lees hierna: Anthropics Veiligheidsrapport Somt Eigen Fouten Op | Een AI Formaliseerde Fermats Laatste Stelling in 11 Dagen



