Co pojawiło się 13 sierpnia
DeepSeek udostępnił Harness v0.1 w otwartej wersji przedpremierowej dla programistów 13 sierpnia 2026 roku, publikując pełny kod źródłowy na licencji MIT, zgodnie z własnym repozytorium GitHub firmy i potwierdzone przez kilka mediów technologicznych, które przeanalizowały premierę. Projektem kieruje Cui Tianyi, który dołączył do DeepSeek w marcu 2026 roku po odejściu z firmy handlu ilościowego Jane Street, i osiągnął publiczną wersję przedpremierową około pięć miesięcy po tym, jak jego zespół zaczął rekrutować programistów w maju 2026 roku. Harness to framework do uruchamiania agentów: rusztowanie pętli, narzędzi i zarządzania sesjami, które zamienia surowy model językowy w coś zdolnego do czytania bazy kodu, uruchamiania poleceń terminala i samodzielnego wykonywania wieloetapowych zadań inżynieryjnych.
To, co czyni tę premierę godną uwagi, to nie funkcje frameworku, lecz to, czym DeepSeek twierdzi, że naprawdę jest: to samo wewnętrzne narzędzie, którego DeepSeek użył do benchmarkowania własnych modeli DeepSeek V4-Flash i V4-Pro przed opublikowaniem ich wyników, zgodnie z własnymi notatkami do wydania firmy. Framework i model zwykle pozostają rozdzielone w publicznych twierdzeniach laboratorium; tutaj DeepSeek dostarcza oba naraz, pozwalając zewnętrznym programistom odtworzyć dokładnie to samo rusztowanie stojące za jego własnymi opublikowanymi liczbami, zamiast wierzyć im na słowo.
To samo narzędzie, żadnych tajemnic: jak naprawdę działa Harness
Harness działa na tym, co DeepSeek nazywa metaframeworkiem 'Cordis', zorganizowanym wokół jednej idei, którą firma powtarza we własnej dokumentacji: 'wszystko jest wtyczką'. Modele, narzędzia, piaskownice, pętle wykonania, a nawet interfejs użytkownika można wymieniać bez dotykania leżącego u podstaw kodu źródłowego, a system prowadzi dzienniki sesji tylko do dopisywania, dzięki czemu każde uruchomienie agenta można później wznowić, rozgałęzić na nową gałąź lub odtworzyć krok po kroku, zgodnie z własnym technicznym opisem firmy. W tej wersji przedpremierowej dostępne są cztery tryby: pełny tryb agenta Standard, tryb Code zbudowany wokół orkiestracji w TypeScript dla programistów chcących skryptować własną logikę agenta, uproszczony tryb Minimal zbudowany specjalnie do benchmarkowania oraz tryb Creator do zapisywania niestandardowych ustawień konfiguracji.
Kluczowe jest to, że Harness nie jest ograniczony wyłącznie do własnych modeli DeepSeek. Opublikowana lista dostawców modeli frameworku obejmuje DeepSeek, Anthropic, OpenAI, Amazon Bedrock, Google Vertex, Microsoft Azure oraz dowolny punkt końcowy zgodny z OpenAI, zgodnie z opublikowanymi opcjami konfiguracji projektu - co oznacza, że programista może skierować dokładnie to samo narzędzie, którym DeepSeek benchmarkuje samego siebie, na model Claude lub GPT i uzyskać bezpośrednio porównywalny przebieg.
Cicha stawka stojąca za prezentem
Każde wiodące laboratorium traktuje swoją metodologię benchmarkową jako milczącą tajemnicę konkurencyjną. Wyniki są publikowane; rusztowanie, polecenia i logika ponawiania prób, które je wytworzyły, prawie nigdy nie są, co tłumaczy, dlaczego rywalizujące laboratoria rutynowo oskarżają się nawzajem o mierzenie w korzystnych warunkach, których świat zewnętrzny nie może odtworzyć. Ruch DeepSeek łamie ten schemat w konkretny, wykalkulowany sposób: zamiast prosić branżę o zaufanie do opublikowanych wyników V4, firma opublikowała samą miarę, za darmo, na licencji na tyle liberalnej, że każda firma może zbudować na niej produkt komercyjny - te same warunki licencji, które pozwoliły React i Node.js stać się domyślną infrastrukturą dla całej branży.
To jest tu prawdziwa historia i nie pojawia się w żadnym nagłówku opisującym premierę jako 'otwartego rywala Claude Code'. Jeśli wystarczająco wielu programistów przyjmie Harness jako swoje domyślne środowisko uruchomieniowe agentów, DeepSeek nie tylko zyska uznanie za przejrzystość - po cichu stanie się narzędziem, wobec którego domyślnie mierzone są modele innych laboratoriów. Posiadanie miary to tańsza i subtelniejsza forma dźwigni platformowej niż wygranie wyścigu obliczeniowego, który toczy reszta branży, i nie wymaga, aby własne modele DeepSeek były najszybsze lub najinteligentniejsze, aby się to opłaciło.
Co to zmienia dla każdego, kto stawia na benchmarki AI
Dla firmy oceniającej platformy agentowe bezpośrednia praktyczna wartość jest realna: Harness pozwala zespołowi uruchomić własne obciążenia poprzez dokładnie to samo rusztowanie, którego DeepSeek użył do wygenerowania swoich opublikowanych wyników, wobec modeli DeepSeek lub konkurenta, zamiast przyjmować twierdzenia benchmarkowe dowolnego laboratorium na wiarę. To realna poprawa w branży, w której 'nasz model uzyskał X' stało się niemal niemożliwe do obalenia dla kogokolwiek spoza laboratorium, które przeprowadziło test.
Niesie to również kwestię zarządzania, która nie ma nic wspólnego z jakością modelu. Licencja MIT nie wymaga, aby podmiot był godny zaufania, tylko aby był legalnie użyteczny, a zespół z siedzibą w Chinach oferuje się, by stać się domyślnym instrumentem pomiarowym dla twierdzeń o sztucznej inteligencji agentowej w całej branży - to samo pytanie o zależność drugiego rzędu, które już wcześniej kształtowało decyzje zakupowe wokół modeli DeepSeek i Moonshot. Przyjęcie narzędzia to nie ta sama decyzja co przyjęcie modelu, a firmy nie powinny pozwolić, by dobra wola wobec jednego zamazywała profil ryzyka drugiego.
Czytaj dalej: Model się zmienił, nazwa API nie | Claude Code przestaje pytać o zgodę od 14 sierpnia



