Dasselbe Basismodell, ein grundlegend anderes Modell
GLM-5.3 läuft auf demselben 743-Milliarden-Parameter-Basismodell, das Z.ai bereits als GLM-5.2 ausgeliefert hat. Am zugrunde liegenden Netzwerk hat sich nichts geändert. Verändert hat sich das Rezept für das Nachtraining: mehr Aufgabenumgebungen, mehr Umgebungstypen und längere Trainingsläufe - so die Details, die das Unternehmen gegenüber MarkTechPost und Unite.AI genannt hat.
Der Zugewinn zeigt sich am deutlichsten bei Aufgaben, die anhaltendes Schlussfolgern statt einmaliger Antworten belohnen. Terminal-Bench 3.0 sprang von 4,6 auf 28,3, mehr als das Fünffache, und DeepSWE v1.1 stieg von 46,2 auf 66,9. Auf der eigenen Code Bench kam GLM-5.3 auf 31,4 Prozent bei rund 50.000 Ausgabe-Token und lag damit vor Claude Opus 4.8 mit 29,5 Prozent bei 120.000 Token - Claude Fable 5 führt mit 39,5 Prozent bei maximalem Aufwand aber weiterhin klar.
Ein Fehlersucher, der das Verketten von Exploits lernte
Der folgenreichere Sprung betrifft die Cybersicherheit. CyberGym stieg von 77,2 auf 84,5 Prozent und bringt GLM-5.3 damit auf einen Punkt an Nous' Mythos 5 (83,8 Prozent) und OpenAIs GPT-5.6 Sol (83,6 Prozent) heran. ExploitBench hat sich mehr als verdoppelt, von 24,4 auf 54,4 Prozent, und die in sechs Stunden abgeschlossenen ExploitGym-Aufgaben stiegen von 39 auf 130 - wobei Mythos 5 diese Kategorie mit 247 weiterhin anführt.
Bemerkenswert ist nicht der Wert selbst, sondern die Erklärung, die das Unternehmen dafür liefert. Z.ai zufolge wurden Daten und Umgebungen zur Schwachstellenerkennung ins Nachtraining aufgenommen, in der Erwartung des üblichen schrittweisen Fortschritts beim Aufspüren einzelner Fehler. Stattdessen summierte sich die Fähigkeit während der Skalierung: Das Modell begann, gleichzeitig über mehrere Ausnutzungsstufen zu schlussfolgern und faktisch vollständige Angriffsketten zusammenzusetzen, statt isolierte Schwachstellen zu melden. Z.ai beschreibt dies als emergente Eigenschaft des skalierten Nachtrainings - nicht als Funktion, die bewusst entwickelt wurde.
Zwei Wochen Härtung, bevor irgendjemand herunterladen kann
GLM-5.3 ist ab sofort über Z.ais API, den GLM Coding Plan und die agentische Entwicklungsumgebung ZCode verfügbar; bestehende Abonnenten des Coding Plans wurden bereits umgestellt. Bei den offenen Gewichten sieht es anders aus: Sie sollen laut Z.ai in etwa zwei Wochen folgen, sobald die Sicherheitsbewertung und -härtung abgeschlossen ist, was eine öffentliche Veröffentlichung gegen Ende August 2026 nahelegt.
Die eigene Wortwahl des Unternehmens, das die Veröffentlichung bis zum Abschluss dieser Härtung als 'teilweise einsatzbereit' bezeichnet, spricht für sich. Ein Labor, das seinem Sprung bei den Cyberfähigkeiten voll vertraute, bräuchte keine zwei Wochen zwischen dem Start der API und der Freigabe der Gewichte. Diese Lücke ist Z.ais eigenes Eingeständnis, dass das Verketten von Exploits erst geprüft werden muss, bevor es an jeden geht, der es lokal und unbeaufsichtigt betreiben will.
Warum das Regelwerk das nicht kommen sieht
Nahezu jede rechenleistungsbasierte KI-Regel, allen voran die Systemrisiko-Schwelle des EU-KI-Gesetzes von rund 10 hoch 25 FLOP für KI-Modelle mit allgemeinem Verwendungszweck sowie vergleichbare US-Meldeschwellen für Frontier-Modelle, bemisst Risiko danach, wie viel Rechenleistung ins Training des Basismodells geflossen ist. GLM-5.3 nutzt dasselbe Basismodell wie sein Vorgänger. Nach diesem Maßstab hat sich nichts geändert, und keine zusätzliche Melde- oder Prüfpflicht wurde ausgelöst.
Doch die Fähigkeit, die sich tatsächlich verändert hat - vom Aufspüren einzelner Fehler zum Zusammensetzen vollständiger Ausnutzungsketten - ist durch Nachtraining entstanden, das um Größenordnungen günstiger ist als ein Vortrainingslauf und sich in Wochen statt Monaten iterieren lässt. Servolas eigene Einschätzung: Das eigentliche Frontier-Risikosignal hat sich still verschoben - von der Frage 'wie groß war das Basismodell' hin zu 'wie viel Nachtraining-Rechenleistung und welche Umgebungen sind eingeflossen' - und keines der derzeitigen Schwellenregime stellt diese zweite Frage überhaupt.
Weiterlesen: Zhipus Gratis-Coding-Tool unterbietet Claude Code | Qwens Downloadrekord verdeckt eine Compliance-Lücke



