Un laboratoire a mesuré sa propre machine
Le 17 septembre, Anthropic a publié la première version publique de ce qu'elle appelle le R&D Automation Index, un indicateur construit par l'entreprise pour mesurer quelle part de sa propre recherche et développement en IA est désormais réalisée par Claude plutôt que par son personnel humain. Le chiffre principal : Claude dirige actuellement 26 pour cent de ce travail, contre moins de 1 pour cent en février 2026, et plus de 90 pour cent des tâches pertinentes se situent déjà au niveau qu'Anthropic appelle l'IA collabore, ou au-dessus. Environ 30 000 agents d'IA travaillent simultanément sur des tâches de recherche et d'ingénierie au sein de l'entreprise à tout moment, selon une mesure menée sur une semaine entre le 13 et le 20 juillet.
L'index classe chaque tâche sur une échelle à six niveaux d'automatisation construite avec Epoch AI, d'AL0, aucune implication de l'IA, jusqu'à AL5, où l'IA fonctionne en totale autonomie sans aucun humain dans la boucle. Anthropic affirme qu'aucune tâche n'a encore atteint AL5. La raison de publier ce chiffre, dit l'entreprise, est que le public a besoin de davantage d'informations sur la vitesse à laquelle un laboratoire peut désormais améliorer sa propre IA en utilisant cette même IA, un rythme normalement invisible depuis l'extérieur.
La surveillance est plus mince que le travail
Un quart de la recherche d'Anthropic passe désormais par Claude, avec un humain qui supervise plutôt que d'effectuer le travail directement, et l'entreprise associe ce chiffre à des données sur la précision de son contrôle. Un moniteur automatique en ligne qui examine les décisions de recherche de Claude en temps réel n'en bloque que 0,002 pour cent, environ une sur 47 000. Un processus de révision hors ligne distinct ne signale qu'une ou deux transcriptions sur mille pour un examen humain ultérieur.
| Mesure | Chiffre rapporté par Anthropic |
|---|---|
| Part de la R&D en IA dirigée par Claude | 26 pour cent (contre moins de 1 pour cent en fév. 2026) |
| Travail au niveau l'IA collabore ou supérieur | Plus de 90 pour cent |
| Taux de blocage du moniteur en ligne | 0,002 pour cent des décisions (environ 1 sur 47 000) |
| Transcriptions signalées pour révision humaine | 1 à 2 sur 1 000 |
Rien de tout cela ne signifie que le travail est sans surveillance. Cela signifie que la surveillance est statistique plutôt que constante, captant une part restreinte et échantillonnée des décisions plutôt que de les lire toutes, exactement au moment où l'entreprise elle-même affirme que la marge de décisions prises seule par Claude s'élargit.
Six niveaux, et personne n'est encore au dernier
L'échelle d'Anthropic décrit à quoi ressemble réellement chaque niveau d'automatisation au sein d'une tâche de recherche, et l'écart entre les niveaux rapportés par l'entreprise et le sommet de l'échelle constitue la véritable histoire derrière les chiffres.
| Niveau | Signification |
|---|---|
| AL0 | Aucune implication de l'IA |
| AL1 | L'IA assiste de façon minime |
| AL2 | L'IA assiste de façon plus substantielle, l'humain dirige encore |
| AL3 | L'IA collabore, réalisant de grandes parts du travail sous direction humaine étroite |
| AL4 | L'IA dirige, achevant le travail de bout en bout à partir d'une instruction générale, tandis qu'un humain supervise |
| AL5 | Totalement autonome, aucun humain dans la boucle |
La citation d'Anthropic pose le risque clairement : à mesure que le travail s'automatise davantage, les agents pourraient prendre des décisions aux conséquences plus lourdes, comme quelle direction de recherche poursuivre ensuite, et ces décisions nécessitent des garde-fous contre le comportement nuisible d'un seul agent, ainsi qu'un régime de surveillance capable de détecter des problèmes chez tous les agents. L'entreprise décrit ici l'AL4, non l'AL5, mais la distance entre les deux tient à une seule étape, pas à un mur fixe.
Une entreprise rédige son propre examen
Anthropic ne se contente pas de rapporter un chiffre ici. L'entreprise propose que les gouvernements utilisent des mesures comme celle-ci pour fixer des obligations de transparence, et pour définir les seuils déclenchant des exigences plus strictes, comme une fenêtre de test fixe avant qu'un nouveau modèle ne soit autorisé à prendre en charge lui-même davantage de travail de R&D en IA. C'est une idée réelle et utile. C'est aussi un laboratoire qui rédige le premier brouillon de l'examen qu'il s'attend à subir, en utilisant des données de télémétrie que lui seul possède aujourd'hui.
Aucune disposition de l'AI Act européen ne lie aujourd'hui une obligation de risque systémique pour les modèles GPAI au niveau d'automatisation propre d'un laboratoire, ni à la part de son calcul de sécurité consacrée à surveiller sa portion automatisée du travail, actuellement 6 pour cent du calcul total de R&D en IA selon Anthropic, une part qui monte à 12 pour cent au sein de la portion de ce travail pilotée par l'IA. Toute entreprise européenne qui achète aujourd'hui un accès à des modèles de pointe pour sa propre feuille de route produit devrait lire ceci moins comme une histoire Anthropic et davantage comme un aperçu de la question qu'un régulateur, ou le service achats d'un client, finira par poser à tout fournisseur d'IA : quelle part de ce que vous me vendez a été construite par quelque chose que vous ne surveilliez pas complètement, et comment le savez-vous.
À lire ensuite: Le Rapport de Sécurité d'Anthropic Liste Ses Propres Échecs | Une IA a Formalisé le Dernier Théorème de Fermat en 11 Jours



