Wat er op 13 augustus verscheen
DeepSeek bracht Harness v0.1 op 13 augustus 2026 uit in een open preview voor ontwikkelaars, waarbij de volledige broncode werd vrijgegeven onder de permissieve MIT-licentie, volgens de eigen GitHub-repository van het bedrijf en bevestigd door meerdere techmedia die de release bekeken. Het project staat onder leiding van Cui Tianyi, die in maart 2026 bij DeepSeek kwam nadat hij de kwantitatieve handelsfirma Jane Street had verlaten, en bereikte de publieke preview ongeveer vijf maanden nadat zijn team in mei 2026 begon met het werven van ontwikkelaars. Harness is een agent-runtimeframework: de stellage van loops, tools en sessiebeheer die een kaal taalmodel verandert in iets dat een codebase kan lezen, terminalcommando's kan uitvoeren en meerstaps-engineeringtaken zelfstandig kan afronden.
Wat de release opmerkelijk maakt, zijn niet de functies van het framework, maar wat DeepSeek zegt dat het werkelijk is: dezelfde interne tool die DeepSeek gebruikte om zijn eigen modellen DeepSeek V4-Flash en V4-Pro te benchmarken voordat hun scores werden gepubliceerd, volgens de eigen releasenotities van het bedrijf. Framework en model blijven normaal gescheiden in de publieke claims van een lab; hier levert DeepSeek beide tegelijk, zodat externe ontwikkelaars de exacte stellage achter de eigen gepubliceerde cijfers kunnen naspelen in plaats van ze op goed vertrouwen aan te nemen.
Dezelfde tool, geen geheimen: hoe Harness echt werkt
Harness draait op wat DeepSeek een 'Cordis'-metaframework noemt, opgebouwd rond een enkel idee dat het bedrijf in zijn eigen documentatie herhaalt: 'alles is een plugin'. Modellen, tools, sandboxes, uitvoeringslussen en zelfs de gebruikersinterface kunnen worden verwisseld zonder de onderliggende broncode aan te raken, en het systeem houdt sessielogs bij die alleen worden aangevuld, zodat elke agentrun later kan worden hervat, vertakt in een nieuwe branch of stap voor stap opnieuw afgespeeld, aldus de eigen technische beschrijving van het bedrijf. Vier modi worden geleverd in deze preview: een volledige Standard-agentmodus, een Code-modus rond TypeScript-orkestratie voor ontwikkelaars die hun eigen agentlogica willen scripten, een uitgeklede Minimal-modus specifiek gebouwd voor benchmarking, en een Creator-modus voor het opslaan van aangepaste configuratiepresets.
Cruciaal is dat Harness niet vastzit aan alleen DeepSeeks eigen modellen. De gepubliceerde lijst van modelproviders van het framework omvat DeepSeek, Anthropic, OpenAI, Amazon Bedrock, Google Vertex, Microsoft Azure en elk OpenAI-compatibel eindpunt, volgens de gepubliceerde configuratieopties van het project - wat betekent dat een ontwikkelaar precies de tool waarmee DeepSeek zichzelf benchmarkt kan richten op een Claude- of GPT-model en een direct vergelijkbare run kan krijgen.
De stille gok achter het weggeven
Elk toonaangevend lab behandelt zijn benchmarkmethodologie als een stilzwijgend concurrentiegeheim. Scores worden gepubliceerd; de stellage, prompts en retry-logica die ze voortbrachten vrijwel nooit, wat verklaart waarom rivaliserende labs elkaar routinematig beschuldigen van meten onder gunstige omstandigheden die de buitenwereld niet kan naspelen. DeepSeeks zet doorbreekt dat patroon op een specifieke, berekende manier: in plaats van de sector te vragen zijn gepubliceerde V4-scores op vertrouwen aan te nemen, publiceerde het bedrijf de meetlat zelf, gratis, onder een licentie die permissief genoeg is voor elk bedrijf om er een commercieel product bovenop te bouwen - dezelfde licentievoorwaarden waarmee React en Node.js standaardinfrastructuur voor een hele sector werden.
Dat is hier het echte verhaal, en het staat in geen enkele kop die de release beschrijft als 'een opensourcerivaal van Claude Code'. Als genoeg ontwikkelaars Harness als standaard agent-runtime omarmen, wint DeepSeek niet alleen goodwill voor transparantie - het wordt stilletjes de tool waarmee de modellen van andere labs standaard worden gemeten. Het bezit van de meetlat is een goedkopere, subtielere vorm van platformhefboom dan het winnen van de rekenkrachtwedloop die de rest van de sector voert, en het vereist niet dat DeepSeeks eigen modellen de snelste of slimste zijn om zich uit te betalen.
Wat dit verandert voor wie op AI-benchmarks wedt
Voor een bedrijf dat agentplatforms evalueert, is de directe praktische waarde reëel: Harness laat een team zijn eigen workloads door dezelfde stellage laten lopen die DeepSeek gebruikte om zijn gepubliceerde scores te genereren, tegen DeepSeeks modellen of die van een rivaal, in plaats van de benchmarkclaims van een lab zomaar aan te nemen. Dat is een echte verbetering in een sector waarin 'ons model scoorde X' bijna onweerlegbaar is geworden voor iedereen buiten het lab dat de test uitvoerde.
Het brengt ook een governancekwestie met zich mee die niets met de modelkwaliteit te maken heeft. Een MIT-licentie vereist niet dat een entiteit vertrouwd wordt, alleen dat ze legaal bruikbaar is, en een in China gevestigd team biedt zich aan om het standaard meetinstrument te worden voor claims over agentische AI in de hele sector - dezelfde afhankelijkheidskwestie van de tweede orde die al inkoopbeslissingen rond de modellen van DeepSeek en Moonshot heeft beïnvloed. De tool overnemen is niet dezelfde beslissing als het model overnemen, en bedrijven moeten niet toestaan dat de goodwill van het ene het risicoprofiel van het andere vertroebelt.
Lees hierna: Het model veranderde, de API-naam niet | Claude Code vraagt vanaf 14 augustus geen toestemming meer



