Das chinesische KI-Unternehmen Zhipu AI hat am 26. August 2026 sein neues Open-Weights-Modell GLM-5.3-Flash offiziell vorgestellt und unter einer freizügigen MIT-Lizenz bereitgestellt. Die Veröffentlichung folgt auf wochenlange Spekulationen in der weltweiten Entwickler-Community über ein hochperformantes, unbenanntes Modell, das zuvor unter dem Pseudonym Ox Alpha auf Testplattformen aufgetaucht war. Mit der Freigabe macht Zhipu AI ein System für Entwickler und Unternehmen frei zugänglich, das speziell auf hohe Geschwindigkeit und effiziente Bereitstellung ausgelegt ist.
Architektonisch setzt GLM-5.3-Flash auf ein Mixture-of-Experts-Design (MoE) mit insgesamt 320 Milliarden Parametern. Für einzelne Inferenzschritte werden jedoch nur 18 Milliarden Parameter aktiviert, was den rechnerischen Aufwand pro generiertem Token deutlich begrenzt. Gleichzeitig unterstützt das Modell ein langes Kontextfenster von bis zu einer Million Tokens. Um den immensen Speicherbedarf für den Key-Value-Cache bei derart großen Kontexten zu bewältigen, kombiniert Zhipu AI Sparse- und Linear-Attention-Mechanismen.
Vor der offiziellen Enthüllung hatte das Modell in der Entwicklerszene bereits für erhebliches Aufsehen gesorgt. Über Inferenzplattformen wie OpenRouter und OpenCode lief das Modell unter dem Codenamen Ox Alpha und bewältigte dort im anonymen Produktivbetrieb mehr als 62 Billionen Tokens. Viele Nutzer zeigten sich von der Reaktionsschnelligkeit und den Fähigkeiten des anonymen Modells überrascht, ohne zu wissen, welcher Anbieter oder welche Architektur dahinterstand.
Ein zentrales Detail des Projekts betrifft die zugrundeliegende Recheninfrastruktur. Nach Angaben von Zhipu AI wurde der gesamte Inferenz-Traffic während der Testphase auf einem Verbund aus 100.000 in China produzierten KI-Beschleunigern abgewickelt. Der erfolgreiche Einsatz dieses Clusters unterstreicht die Bemühungen des chinesischen Ökosystems, moderne Frontier-Modelle auch unabhängig von westlichen Hardware-Lieferketten in industriellem Maßstab zu betreiben.
Mit der Wahl der MIT-Lizenz eröffnet Zhipu AI Entwicklern weitreichende Freiheiten bei der kommerziellen Nutzung, Anpassung und lokalen Einbindung des Modells. Die Kombination aus reduzierten Betriebskosten, hoher Parametereffizienz und voller Open-Weights-Verfügbarkeit dürfte den Wettbewerb unter quelloffenen Inferenzlösungen im Bereich langer Kontexte weiter verschärfen.

