Ce qui a été publié le 13 août
DeepSeek a publié Harness v0.1 en aperçu ouvert pour les développeurs le 13 août 2026, diffusant le code source complet sous la licence permissive MIT, selon le propre dépôt GitHub de l'entreprise et confirmé par plusieurs médias technologiques ayant examiné la publication. Le projet est dirigé par Cui Tianyi, arrivé chez DeepSeek en mars 2026 après avoir quitté la société de trading quantitatif Jane Street, et a atteint l'aperçu public environ cinq mois après que son équipe a commencé à recruter des développeurs en mai 2026. Harness est un framework d'exécution d'agents : l'échafaudage de boucles, d'outils et de gestion de session qui transforme un modèle de langage brut en quelque chose capable de lire une base de code, d'exécuter des commandes de terminal et de mener à bien des tâches d'ingénierie en plusieurs étapes de façon autonome.
Ce qui rend cette publication notable, ce ne sont pas les fonctionnalités du framework, mais ce que DeepSeek affirme qu'il est réellement : le même outil interne que DeepSeek a utilisé pour évaluer ses propres modèles DeepSeek V4-Flash et V4-Pro avant de publier leurs scores, selon les propres notes de version de l'entreprise. Framework et modèle restent normalement séparés dans les déclarations publiques d'un laboratoire ; ici, DeepSeek livre les deux à la fois, permettant aux développeurs extérieurs de rejouer exactement l'échafaudage derrière ses propres chiffres publiés plutôt que de les croire sur parole.
Même outil, aucun secret : comment Harness fonctionne vraiment
Harness tourne sur ce que DeepSeek appelle un méta-framework 'Cordis', organisé autour d'une seule idée que l'entreprise répète dans sa propre documentation : 'tout est un plugin'. Modèles, outils, bacs à sable, boucles d'exécution et même l'interface utilisateur peuvent être remplacés sans toucher au code source sous-jacent, et le système conserve des journaux de session en ajout seul afin que toute exécution d'agent puisse être reprise, scindée en une nouvelle branche ou rejouée étape par étape plus tard, selon la propre description technique de l'entreprise. Quatre modes sont livrés dans cet aperçu : un mode Standard d'agent complet, un mode Code construit autour de l'orchestration en TypeScript pour les développeurs qui veulent scripter leur propre logique d'agent, un mode Minimal épuré conçu spécifiquement pour le benchmarking, et un mode Creator pour enregistrer des préréglages de configuration personnalisés.
Il est essentiel de noter que Harness n'est pas verrouillé sur les seuls modèles de DeepSeek. La liste des fournisseurs de modèles publiée par le framework inclut DeepSeek, Anthropic, OpenAI, Amazon Bedrock, Google Vertex, Microsoft Azure et n'importe quel point de terminaison compatible OpenAI, selon les options de configuration publiées du projet - ce qui signifie qu'un développeur peut diriger l'outil exact avec lequel DeepSeek s'évalue elle-même vers un modèle Claude ou GPT et obtenir une exécution directement comparable.
Le pari silencieux derrière le cadeau
Chaque laboratoire de pointe traite sa méthodologie de benchmark comme un secret concurrentiel tacite. Les scores sont publiés ; l'échafaudage, les invites et la logique de nouvelles tentatives qui les ont produits ne le sont presque jamais, ce qui explique pourquoi des laboratoires rivaux s'accusent régulièrement de mesurer dans des conditions favorables que le monde extérieur ne peut pas reproduire. Le geste de DeepSeek rompt ce schéma d'une manière précise et calculée : plutôt que de demander au secteur de faire confiance à ses scores V4 publiés, l'entreprise a publié l'instrument de mesure lui-même, gratuitement, sous une licence assez permissive pour que n'importe quelle entreprise puisse construire un produit commercial dessus - les mêmes conditions de licence qui ont permis à React et Node.js de devenir une infrastructure par défaut pour tout un secteur.
C'est là la vraie histoire, et elle ne figure dans aucun titre présentant la publication comme 'un rival open source de Claude Code'. Si suffisamment de développeurs adoptent Harness comme environnement d'exécution d'agents par défaut, DeepSeek ne gagne pas seulement en crédibilité pour sa transparence : elle devient discrètement l'outil à travers lequel les modèles des autres laboratoires sont mesurés par défaut. Posséder la règle est une forme de levier de plateforme moins coûteuse et plus subtile que de gagner la course au calcul que mène le reste du secteur, et cela ne nécessite pas que les propres modèles de DeepSeek soient les plus rapides ou les plus intelligents pour porter ses fruits.
Ce que cela change pour quiconque mise sur les benchmarks de l'IA
Pour une entreprise qui évalue des plateformes d'agents, la valeur pratique immédiate est réelle : Harness permet à une équipe de faire passer ses propres charges de travail par l'échafaudage identique que DeepSeek a utilisé pour générer ses scores publiés, face aux modèles de DeepSeek ou à ceux d'un rival, plutôt que d'accepter aveuglément les affirmations de benchmark d'un laboratoire. C'est une amélioration réelle dans un secteur où 'notre modèle a obtenu X' est devenu quasiment impossible à réfuter pour quiconque en dehors du laboratoire ayant réalisé le test.
Cela soulève aussi une question de gouvernance qui n'a rien à voir avec la qualité du modèle. Une licence MIT n'exige pas qu'une entité soit digne de confiance, seulement qu'elle soit légalement utilisable, et une équipe domiciliée en Chine propose de devenir l'instrument de mesure par défaut pour les affirmations sur l'IA agentique dans tout le secteur - la même question de dépendance de second ordre qui a déjà façonné les décisions d'adoption autour des modèles de DeepSeek et de Moonshot. Adopter l'outil n'est pas la même décision qu'adopter le modèle, et les entreprises ne devraient pas laisser la bonne volonté suscitée par l'un brouiller le profil de risque de l'autre.
À lire ensuite: Le modèle a changé, pas le nom de l'API | Claude Code arrête de demander la permission dès le 14 août



