Det, der kom den 13. august
DeepSeek udgav Harness v0.1 i en åben preview for udviklere den 13. august 2026 og offentliggjorde den fulde kildekode under den lempelige MIT-licens, ifølge virksomhedens eget GitHub-repository og bekræftet af flere teknologimedier, der har gennemgået udgivelsen. Projektet ledes af Cui Tianyi, der kom til DeepSeek i marts 2026 efter at have forladt den kvantitative handelsvirksomhed Jane Street, og nåede den offentlige preview omkring fem måneder efter, at hans team begyndte at rekruttere udviklere i maj 2026. Harness er et agent-runtime-framework: stilladset af løkker, værktøjer og sessionsstyring, der forvandler en rå sprogmodel til noget, der kan læse en kodebase, køre terminalkommandoer og selv fuldføre ingeniørarbejde i flere trin.
Det, der gør udgivelsen bemærkelsesværdig, er ikke frameworkets funktioner, men det, DeepSeek siger, det egentlig er: det samme interne værktøj, DeepSeek brugte til at benchmarke sine egne modeller DeepSeek V4-Flash og V4-Pro, før deres scorer blev offentliggjort, ifølge virksomhedens egne udgivelsesnoter. Framework og model forbliver normalt adskilt i et laboratoriums offentlige påstande; her leverer DeepSeek begge dele på en gang og lader eksterne udviklere køre netop det stillads, der ligger bag dets egne offentliggjorte tal, i stedet for blot at tro på dem.
Samme værktøj, ingen hemmeligheder: sådan virker Harness i praksis
Harness kører på det, DeepSeek kalder et 'Cordis'-metaframework, opbygget omkring en enkelt idé, som virksomheden gentager i sin egen dokumentation: 'alt er et plugin'. Modeller, værktøjer, sandkasser, kørselsløkker og selv brugergrænsefladen kan udskiftes uden at røre ved den underliggende kildekode, og systemet fører sessionlogs, der kun kan tilføjes, så enhver agentkørsel senere kan genoptages, forgrenes til en ny gren eller afspilles trin for trin igen, ifølge virksomhedens egen tekniske beskrivelse. Fire tilstande føjes til i denne preview: en fuld Standard-agenttilstand, en Code-tilstand bygget omkring TypeScript-orkestrering til udviklere, der vil scripte deres egen agentlogik, en strippet Minimal-tilstand bygget specifikt til benchmarking, og en Creator-tilstand til at gemme tilpassede konfigurationsforudindstillinger.
Afgørende er det, at Harness ikke er låst til kun DeepSeeks egne modeller. Frameworkets offentliggjorte liste over modeludbydere omfatter DeepSeek, Anthropic, OpenAI, Amazon Bedrock, Google Vertex, Microsoft Azure og ethvert OpenAI-kompatibelt endpoint, ifølge projektets offentliggjorte konfigurationsmuligheder - hvilket betyder, at en udvikler kan rette netop det værktøj, DeepSeek benchmarker sig selv med, mod en Claude- eller GPT-model og få en direkte sammenlignelig kørsel.
Det stille væddemål bag foræringen
Ethvert laboratorium i front behandler sin benchmark-metodologi som en tavs konkurrencehemmelighed. Scorerne offentliggøres; stilladset, prompterne og gentagelseslogikken, der frembragte dem, gør det næsten aldrig, hvilket er grunden til, at rivaliserende laboratorier rutinemæssigt beskylder hinanden for at måle under gunstige betingelser, som omverdenen ikke kan genskabe. DeepSeeks træk bryder det mønster på en specifik, beregnet måde: i stedet for at bede branchen om at stole på sine offentliggjorte V4-scorer, offentliggjorde virksomheden selve målestokken, gratis, under en licens, der er lempelig nok til, at ethvert firma kan bygge et kommercielt produkt oven på den - de samme licensvilkår, der gjorde React og Node.js til standardinfrastruktur for en hel branche.
Det er den egentlige historie her, og den står i ingen overskrift, der beskriver udgivelsen som 'en open source-rival til Claude Code'. Hvis nok udviklere gør Harness til deres standard agent-runtime, vinder DeepSeek ikke kun goodwill for gennemsigtighed - virksomheden bliver stille og roligt det værktøj, som andre laboratoriers modeller måles med som standard. At eje målestokken er en billigere, mere subtil form for platformsindflydelse end at vinde det regnekraftkapløb, resten af branchen fører, og det kræver ikke, at DeepSeeks egne modeller er de hurtigste eller klogeste, for det skal betale sig.
Hvad det ændrer for alle, der satser på AI-benchmarks
For en virksomhed, der evaluerer agentplatforme, er den umiddelbare praktiske værdi reel: Harness lader et team køre sine egne workloads gennem netop det stillads, DeepSeek brugte til at generere sine offentliggjorte scorer, mod DeepSeeks modeller eller en rivals, i stedet for blot at tage et laboratoriums benchmark-påstande for pålydende. Det er en reel forbedring i en branche, hvor 'vores model scorede X' er blevet næsten umuligt at modbevise for alle uden for det laboratorium, der kørte testen.
Det rejser også et governance-spørgsmål, der intet har at gøre med modelkvalitet. En MIT-licens kræver ikke, at en enhed er troværdig, kun at den er lovligt anvendelig, og et team med hjemsted i Kina tilbyder at blive standardmåleinstrumentet for påstande om agentisk AI i hele branchen - det samme afhængighedsspørgsmål af anden orden, der allerede har præget indkøbsbeslutninger omkring DeepSeeks og Moonshots modeller. At tage værktøjet i brug er ikke den samme beslutning som at tage modellen i brug, og virksomheder bør ikke lade goodwill fra det ene sløre risikoprofilen for det andet.
Læs videre: Modellen skiftede, API-navnet gjorde det ikke | Claude Code holder op med at spørge om lov fra 14. august



