Det som släpptes den 13 augusti

DeepSeek släppte Harness v0.1 i öppen förhandsversion för utvecklare den 13 augusti 2026 och publicerade hela källkoden under den tillåtande MIT-licensen, enligt företagets eget GitHub-repo och bekräftat av flera teknikmedier som granskat släppet. Projektet leds av Cui Tianyi, som kom till DeepSeek i mars 2026 efter att ha lämnat det kvantitativa handelsföretaget Jane Street, och nådde den offentliga förhandsversionen omkring fem månader efter att hans team började rekrytera utvecklare i maj 2026. Harness är ett agent-runtime-ramverk: ställningen av loopar, verktyg och sessionshantering som förvandlar en rå språkmodell till något som kan läsa en kodbas, köra terminalkommandon och självständigt slutföra ingenjörsarbete i flera steg.

Det som gör släppet anmärkningsvärt är inte ramverkets funktioner, utan det DeepSeek säger att det faktiskt är: samma interna verktyg som DeepSeek använde för att benchmarka sina egna modeller DeepSeek V4-Flash och V4-Pro innan deras poäng publicerades, enligt företagets egna släppanteckningar. Ramverk och modell förblir normalt åtskilda i ett laboratoriums offentliga påståenden; här levererar DeepSeek båda på en gång och låter externa utvecklare köra exakt den ställning som ligger bakom dess egna publicerade siffror i stället för att lita på dem i blindo.

Samma verktyg, inga hemligheter: så fungerar Harness i praktiken

Harness kör på vad DeepSeek kallar ett 'Cordis'-metaramverk, uppbyggt kring en enda idé som företaget upprepar i sin egen dokumentation: 'allt är ett plugin'. Modeller, verktyg, sandlådor, körningsloopar och till och med användargränssnittet kan bytas ut utan att röra den underliggande källkoden, och systemet för sessionsloggar som bara kan fyllas på, så att varje agentkörning senare kan återupptas, grenas till en ny gren eller spelas upp steg för steg igen, enligt företagets egen tekniska beskrivning. Fyra lägen ingår i denna förhandsversion: ett fullt Standard-agentläge, ett Code-läge byggt kring TypeScript-orkestrering för utvecklare som vill skripta sin egen agentlogik, ett strippat Minimal-läge byggt specifikt för benchmarking, och ett Creator-läge för att spara anpassade konfigurationsförinställningar.

Avgörande är att Harness inte är låst till enbart DeepSeeks egna modeller. Ramverkets publicerade lista över modelleverantörer omfattar DeepSeek, Anthropic, OpenAI, Amazon Bedrock, Google Vertex, Microsoft Azure och alla OpenAI-kompatibla slutpunkter, enligt projektets publicerade konfigurationsalternativ - vilket betyder att en utvecklare kan rikta exakt det verktyg DeepSeek benchmarkar sig självt med mot en Claude- eller GPT-modell och få en direkt jämförbar körning.

Det tysta vadet bakom gåvan

Varje frontlaboratorium behandlar sin benchmarkmetodik som en tyst konkurrenshemlighet. Poängen publiceras; ställningen, prompterna och försökslogiken som producerade dem gör det nästan aldrig, vilket är anledningen till att rivaliserande laboratorier rutinmässigt anklagar varandra för att mäta under gynnsamma förhållanden som omvärlden inte kan återskapa. DeepSeeks drag bryter det mönstret på ett specifikt, uttänkt sätt: i stället för att be branschen lita på dess publicerade V4-poäng publicerade företaget själva måttstocken, gratis, under en licens tillräckligt tillåtande för att vilket företag som helst ska kunna bygga en kommersiell produkt ovanpå den - samma licensvillkor som lät React och Node.js bli standardinfrastruktur för en hel bransch.

Det är den egentliga historien här, och den står i ingen rubrik som beskriver släppet som 'en öppen konkurrent till Claude Code'. Om tillräckligt många utvecklare gör Harness till sin standard agent-runtime, vinner DeepSeek inte bara goodwill för transparens - företaget blir tyst det verktyg som andra laboratoriers modeller mäts mot som standard. Att äga måttstocken är en billigare, mer subtil form av plattformsinflytande än att vinna det beräkningskraftlopp resten av branschen för, och det kräver inte att DeepSeeks egna modeller är snabbast eller smartast för att det ska löna sig.

Vad detta ändrar för den som satsar på AI-benchmarks

För ett företag som utvärderar agentplattformar är det omedelbara praktiska värdet verkligt: Harness låter ett team köra sina egna arbetsbelastningar genom exakt samma ställning som DeepSeek använde för att generera sina publicerade poäng, mot DeepSeeks modeller eller en konkurrents, i stället för att bara acceptera ett laboratoriums benchmarkpåståenden. Det är en verklig förbättring i en bransch där 'vår modell fick X poäng' har blivit nästan omöjligt att motbevisa för alla utanför det laboratorium som körde testet.

Det medför också en styrningsfråga som inte har något att göra med modellkvalitet. En MIT-licens kräver inte att en enhet är tillförlitlig, bara att den är lagligt användbar, och ett team med säte i Kina erbjuder sig att bli standardmätinstrumentet för påståenden om agentisk AI i hela branschen - samma andra ordningens beroendefråga som redan har påverkat upphandlingsbeslut kring DeepSeeks och Moonshots modeller. Att anta verktyget är inte samma beslut som att anta modellen, och företag bör inte låta god vilja från det ena grumla riskprofilen för det andra.