Samme grundmodel, en meget anderledes model
GLM-5.3 kører på den samme 743 milliarder-parameter grundmodel, som Z.ai allerede leverede som GLM-5.2. Der er intet ændret ved det underliggende netværk. Det, der ændrede sig, var opskriften på efteruddannelse: flere opgavemiljøer, flere miljøtyper og længere træningsforløb, ifølge detaljer virksomheden delte med MarkTechPost og Unite.AI.
Gevinsten viser sig tydeligst på opgaver, der belønner vedvarende ræsonnement frem for et enkelt svar. Terminal-Bench 3.0 sprang fra 4,6 til 28,3, mere end en femdobling, og DeepSWE v1.1 steg fra 46,2 til 66,9. På sin egen Code Bench nåede GLM-5.3 31,4 procent med omkring 50.000 output-tokens, lige foran Claude Opus 4.8's 29,5 procent ved 120.000 tokens, selvom Claude Fable 5 stadig klart fører med 39,5 procent ved maksimal indsats.
En fejlfinder, der lærte at kæde exploits sammen
Det mere alvorlige spring ligger i cybersikkerhed. CyberGym steg fra 77,2 til 84,5 procent, hvilket placerer GLM-5.3 et point fra Nous' Mythos 5 (83,8 procent) og OpenAIs GPT-5.6 Sol (83,6 procent). ExploitBench mere end fordobledes, fra 24,4 til 54,4 procent, og fuldførte ExploitGym-opgaver inden for seks timer steg fra 39 til 130, selvom Mythos 5 stadig fører den kategori med 247.
Det bemærkelsesværdige er ikke scoren, men virksomhedens egen forklaring på den. Z.ai siger, at man tilføjede data og miljøer om sårbarhedsopdagelse til efteruddannelsen i forventning om den sædvanlige gradvise gevinst ved at finde enkeltstående fejl. I stedet ophobede evnen sig under skaleringen: modellen begyndte at ræsonnere på tværs af flere udnyttelsesfaser samtidig og satte reelt fuldstændige angrebskæder sammen i stedet for at flage isolerede fejl. Z.ai beskriver dette som en fremvoksende egenskab ved skaleret efteruddannelse, ikke en funktion man satte sig for at bygge.
To ugers hærdning, før nogen kan downloade den
GLM-5.3 er allerede tilgængelig via Z.ais API, GLM Coding Plan og det agentiske udviklingsmiljø ZCode, hvor eksisterende abonnenter på kodeplanen allerede er flyttet over. De åbne vægte er en anden sag: ifølge Z.ai følger de om cirka to uger, når sikkerhedsevaluering og -hærdning er afsluttet, hvilket peger på en offentlig udgivelse omkring slutningen af august 2026.
Virksomhedens eget ordvalg, der beskriver udgivelsen som 'delvist anvendelig', indtil den hærdning er færdig, er sigende. Et laboratorium, der stolede fuldt ud på sit cyberkapacitetsspring, ville ikke have brug for to uger mellem lancering af API og lancering af vægte. Kløften er Z.ais egen erkendelse af, at adfærden med at kæde udnyttelser sammen skal gennemgås, før den overlades til alle, der vil køre den lokalt og uden opsyn.
Hvorfor regelsættet ikke ser dette komme
Stort set enhver beregningsbaseret AI-regel, med EU's AI-forordnings systemiske risikogrænse på omkring 10 opløftet i 25 FLOP for AI-modeller til generelle formål i spidsen, og tilsvarende amerikanske indberetningsgrænser for frontier-modeller, måler risiko ud fra, hvor meget beregningskraft der gik i træningen af grundmodellen. GLM-5.3 brugte samme grundmodel som sin forgænger. Efter den målestok er intet ændret, og ingen ekstra indberetnings- eller evalueringspligt er udløst.
Alligevel voksede den evne, der reelt rykkede, fra at finde enkeltstående fejl til at samle fuldstændige udnyttelseskæder, på grund af efteruddannelse, som koster størrelsesordener mindre end et fortræningsforløb og kan gentages på uger frem for måneder. Servolas egen læsning: det reelle frontier-risikosignal er stille flyttet fra 'hvor stor var grundmodellen' til 'hvor meget efteruddannelsesberegning og hvilke miljøer indgik', og ingen af de nuværende tærskelregimer stiller overhovedet det andet spørgsmål.
Læs videre: Shieldstral holder moderation på dine egne servere | Bitcoin-Firmaer Vil Have AI-Adgang Efter 634M I Hacks



