En enkelt linje i ændringsloggen gør hele arbejdet

Et hold, der kaldte deepseek-v4-flash torsdag og kaldte den igen fredag, fik svar fra to forskellige modeller. Intet ændrede sig i deres kode, intet ændrede sig i deres konfiguration, og der blev ikke rejst nogen fejl. DeepSeek offentliggjorde den 31. juli den officielle udgave af sit V4-Flash-API under buildnavnet DeepSeek-V4-Flash-0731, og dokumentationen er beundringsværdigt direkte om, hvad det betyder for den, der kalder: modellen er opdateret, kaldemetoden er uændret, og det bare navn når den nyeste version.

Det blev ikke skjult. Ændringsloggen er offentlig, måletabellen er offentliggjort, og buildet bærer en dato i navnet. Problemet er ikke offentliggørelsen. Problemet er, at offentliggørelsen ligger et sted, hvor dit driftsmiljø ikke læser. Ethvert signal, som et produktionssystem ville bruge til at bemærke, at dets model er skiftet, forblev konstant hen over udskiftningen: modelstrengen i forespørgslen, arkitekturen, parametertallet på 284 milliarder i alt og 13 milliarder aktiverede, kontekstvinduet og prisen.

DeepSeek siger udtrykkeligt, at der er tale om en ændring i eftertræningen og ikke om en ny model. Samme arkitektur, samme størrelse, eftertrænet på ny. Den indramning er korrekt og er samtidig grunden til, at ændringen er let at undervurdere. En fornyet eftertræning lyder som finpudsning. Hvad den frembragte her, var et andet sæt evner bag en uændret betegnelse.

Tallene, der flyttede sig, handler om at handle

Læser man måletabellen efter kategori i stedet for efter række, træder et mønster frem. På Terminal Bench 2.1 opnår det nye build 82,7 mod 61,8 for forhåndsudgaven. På NL2Repo opnår det 54,2 mod 39,4. På Toolathlon-Verified når det 70,3 fra 49,7. På DeepSWE går det fra 7,3 til 54,4, altså mere end syv gange. På Cybergym flytter det sig fra 38,7 til 76,7, ganske tæt på det dobbelte.

Hver af disse målinger indfanger modellens evne til at gøre noget frem for at sige noget: køre terminalkommandoer, arbejde på tværs af et kodelager, kæde værktøjer sammen, finde og udnytte en svaghed. API'et understøtter desuden nu Responses-formatet indbygget og er tilpasset Codex, hvilket er en udmelding om, hvor DeepSeek forventer, at modellen bliver rettet hen. Dette er et build, der er stemt til at få hænder.

Hvorfor det betyder noget: evne og skadesradius ligger på samme akse, så snart en model har værktøjsadgang. De fleste organisationer afgjorde, hvad en model må røre, ved at se, hvad den kunne, og en stor del af den iagttagelse foregik mod et build, der scorede 7,3 i en agentmåling for softwareudvikling. Tilladelsen, der blev givet på det grundlag, udløb ikke, da grundlaget gjorde. Tillader din politik denne model shelladgang, skriveadgang til kodelagre eller noget som helst netværksvendt, blev ræsonnementet bag den politik kalibreret på en model, der ikke længere svarer.

Det billige niveau slår nu det dyre

I samme tabel gemmer sig en anden konsekvens. V4-Pro-Preview, den større og dyrere model i familien, opnår 72,1 på Terminal Bench 2.1. Det nye Flash-build opnår 82,7. Det billige niveau slår nu sin egen families topniveau i mindst én agentmåling, og det skete fra den ene dag til den anden, under et navn, der ikke ændrede sig.

Rutelogikken er statisk i de fleste opsætninger og blev skrevet én gang: tungt agentarbejde til den kapable model, billigt arbejde eller stort volumen til den hurtige. Den regel indkodede en rangorden af evner, som holdt, da den blev skrevet. Den holder ikke længere på alle akser, hvilket betyder, at nogle hold nu betaler topniveauet for arbejde, som det billige niveau gør bedre, og gør det uden noget signal om, at rangordenen er vendt.

Som placering i feltet frem for i familien ligger det nye build på 82,7 i den måling mod 81,0 for Z.AI's GLM-5.2 og 85,0 for Claude Opus 4.8. Den brugbare pointe er ikke rangeringen, som vil flytte sig igen. Den er, at et spring af denne størrelse blev lukket alene ved eftertræning, ved uændrede hardwarekrav, i én udgivelse.

Hvordan versionsstyring ser ud, når man ikke kan fastlåse

Begynd med at acceptere begrænsningen. Udbydere, der udstiller daterede øjebliksbetegnelser, lader dig fastlåse et build og migrere bevidst. DeepSeeks dokumenterede API-flade tilbyder de bare navne, hvor det daterede build er noteret som modelversion og ikke som noget, du kan kalde. Disciplinen må derfor sidde på din side af grænsen, for der findes hverken en kontraktlig eller en teknisk løftestang, der holder modellen stille.

I praksis betyder det tre ting. Hold en lille samling af dine egne opgaver, tyve eller tredive tilfælde, der repræsenterer, hvad du faktisk beder modellen om, med registrerede resultater og en gemt dato. Kør den efter en plan og ikke efter rygter, for en plan fanger en tavs udskiftning, og et rygte gør ikke. Og log det buildnavn, din udbyder oplyser, ved siden af hvert produktionskald, du bekymrer dig om, så du ved en adfærdsændring kan skelne et modelskifte fra en promptændring.

Stil derefter tilladelsesspørgsmålet igen, ikke kun kvalitetsspørgsmålet. Kvalitetstilbagegang er synlig og irriterende. En stigning i evner er usynlig og behagelig, og det er den, der stille udvider, hvad en kompromitteret eller forvirret agent kan nå. Den officielle udgave af V4-Pro er på vej, og DeepSeek har sagt det. Den evaluering, du planlægger i denne uge, er den, der står klar, når den lander.