Der chinesische Technologiekonzern Tencent hat am 28. August 2026 sein neues Flaggschiffmodell Hy4 Preview offiziell vorgestellt und unter der freien Open-Source-Lizenz Apache 2.0 veröffentlicht. Das System basiert auf einer Mixture-of-Experts-Architektur (MoE) mit einer Gesamtkapazität von 770 Milliarden Parametern, von denen pro verarbeitetem Token jeweils 49 Milliarden Parameter aktiv geschaltet werden. Ein zentrales technisches Merkmal des Modells ist das Kontextfenster von einer Million Token, das für die synchrone Analyse umfangreicher Codebasen und komplexer Dokumentensammlungen ausgelegt ist.
Technisch kombiniert Hy4 Preview eine Gated-DSA-Attention-Mechanik mit einem 10 Milliarden Parameter umfassenden Multi-Token-Prediction-Layer (MTP). Dieser MTP-Layer ist speziell für das spekulative Decodieren konzipiert, um Latenzen bei der Erzeugung von Tokens drastisch zu verringern und den Durchsatz bei der Inferenz zu maximieren. Um den produktiven Einsatz für Entwickler ab Tag eins zu erleichtern, wurden neben den Modellgewichten auf Hugging Face unmittelbar optimierte Quantisierungs-Toolkits sowie produktionsreife Docker-Images für die Inferenz-Engines vLLM und SGLang freigegeben.
Die Entwicklung und das Vortraining des Modells wurden laut Tencent in enger Kooperation mit internen Teams aus den Bereichen Softwareentwicklung, Gaming und Finanzanalyse durchgeführt. Während dieses Prozesses kam das Modell bereits zur autonomen Systemoptimierung zum Einsatz: Hy4 Preview optimierte eigenständig Komponenten seiner eigenen Inferenzinfrastruktur sowie die Operator-Fusion. Tencent beziffert die daraus resultierende Steigerung des Gesamtdurchsatzes auf 31,8 Prozent.
In internen Blindauswertungen bei anspruchsvollen Programmieraufgaben erzielte Hy4 Preview Ergebnisse, die knapp vor etablierten Konkurrenten wie GLM-5.3 und Kimi K3 lagen. Tencent positioniert das Modell primär für komplexe Langzeit-Arbeitsabläufe, sogenannte Long-Horizon Workflows, und agentenbasierte Softwareentwicklung. Darüber hinaus soll das Modell in der datenintensiven wissenschaftlichen Forschung eingesetzt werden, insbesondere bei Simulationen in der Molekulardynamik und Fragestellungen der Festkörperphysik.
Die Bereitstellung eines derart leistungsfähigen MoE-Modells unter einer freizügigen Apache-2.0-Lizenz intensiviert den Wettbewerb im Bereich der Frontier-Modelle erheblich. Der zunehmende Leistungsdruck durch quelloffene Gewichte zeigt sich branchenweit, etwa an jüngsten Preissenkungen proprietärer Anbieter wie OpenAI, die für Spitzenmodelle wie GPT-5.6 Sol die API-Kosten um über 20 Prozent reduzierten. Mit fertigen Deployment-Pipelines für vLLM und SGLang setzt Tencent ein deutliches Signal für den direkten Übergang von offener Spitzenforschung in industrielle Produktionsumgebungen.

