Zum Inhalt springen
AI ConnectPowered by VELENTIS
KI-generiert2 Min.

Alibaba veröffentlicht Qwen3.8-Flash-Next mit neuartiger Hybrid-Attention als Vorschau auf Qwen4

Alibaba hat mit Qwen3.8-Flash-Next ein multimodales MoE-Modell mit 125 Milliarden Parametern vorgestellt, das pro Token lediglich 6 Milliarden Parameter aktiviert.

Dieser Beitrag wurde KI-generiert und automatisch veröffentlicht. Einordnung, Kennzeichnung und alle Quellen am Beitragsende.

(KI-generiertes Symbolbild: Gemini / AI Connect)

Das KI-Team des chinesischen Technologiekonzerns Alibaba hat am 26. August 2026 die Open-Weight-Gewichte seines neuesten Modells Qwen3.8-Flash-Next bereitgestellt. Die Veröffentlichung dient laut Entwicklerangaben als direkte architektonische Vorschau auf die kommende Modellgeneration Qwen4. Mit dem Release auf Plattformen wie Hugging Face setzt Alibaba seine Strategie fort, hochgradig spezialisierte Open-Weight-Modelle für Entwickler und Forscher weltweit frei zugänglich zu machen.

In struktureller Hinsicht handelt es sich bei Qwen3.8-Flash-Next um ein multimodales Mixture-of-Experts-Modell (MoE), das insgesamt 125 Milliarden Hauptparameter sowie zusätzliche 51 Milliarden N-Gram-Embedding-Parameter umfasst. Der vollständige Checkpoint beansprucht rund 180 Gigabyte Speicherplatz. Trotz dieser Dimensionen zeichnet sich das Modell durch eine extreme Sparsamkeit bei der Inferenz aus: Für die Verarbeitung jedes einzelnen Tokens werden lediglich 6 Milliarden Parameter aktiv geschaltet.

Den technologischen Kern der Neuentwicklung bildet eine hybride Aufmerksamkeitsarchitektur, die herkömmliche Mechanismen zur vollständigen Selbstaufmerksamkeit ablöst. Qwen3.8-Flash-Next kombiniert das sogenannte Gated DeltaNet (GDN) mit Qwen Sparse Attention (QSA). Während GDN dafür sorgt, dass der Key-Value-Cache über lange Sequenzen hinweg konstant flach gehalten wird, arbeitet QSA auf der Ebene granularer Micro-Blocks statt einzelner Tokens. Dieser Ansatz reduziert die rechnerische Komplexität bei der Verarbeitung umfangreicher Kontexte drastisch.

Hinsichtlich der Kontextlänge bietet das Modell eine native Verarbeitungskapazität von 262.144 Tokens. Durch den Einsatz des Skalierungsverfahrens YaRN lässt sich das effektive Kontextfenster bei Bedarf auf bis zu eine Million Tokens erweitern. Dies ermöglicht die Analyse extrem umfangreicher Dokumentensammlungen, Codebasen und multimodaler Eingaben ohne signifikanten Verlust an Verarbeitungsgeschwindigkeit oder Präzision.

Auch auf Seiten der Trainingseffizienz verzeichnet Alibaba erhebliche Fortschritte. Nach Angaben des Qwen-Teams erforderte der Trainingsprozess von Qwen3.8-Flash-Next lediglich etwa ein Neuntel des Rechenaufwands, der zuvor für Qwen3.7-Plus aufgebracht werden musste. Parallel zur Veröffentlichung hat Hardwarehersteller Nvidia bereits optimierte Bereitstellungsrezepte für moderne Inferenzsysteme wie GB300 NVL72 vorgestellt, um Entwicklern den produktiven Einsatz für agentenbasierte Programmieraufgaben zu erleichtern.

Mit Qwen3.8-Flash-Next untermauert Alibaba den Branchentrend hin zu sparse aktivierten Architekturen, die enorme Modellkapazitäten mit minimalem Ressourcenverbrauch während der Ausführung verbinden. Die hybride Attention-Struktur liefert wertvolle Einblicke darin, wie künftige Flaggschiff-Systeme wie Qwen4 den Spagat zwischen extremen Kontextlängen und ökonomischer Inferenz meistern dürften.

Was heißt das für Sie?

Für Entwickler und Unternehmen zeigt Qwen3.8-Flash-Next, dass extreme Kontextfenster von bis zu einer Million Tokens durch sparse Architekturen hardwareseitig bezahlbar werden. Die Beschränkung auf 6 Milliarden aktive Parameter senkt die Latenz und Kosten bei agentenbasierten Workflows drastisch.

Belege

Solide belegt
69/100
  • Alibaba veröffentlichte am 26. August 2026 die Open-Weight-Gewichte von Qwen3.8-Flash-Next als Architektur-Vorschau auf Qwen4.

    belegt
  • Das Modell verfügt über 125 Milliarden Hauptparameter und 51 Milliarden N-Gram-Embedding-Parameter bei rund 180 GB Checkpoint-Größe, aktiviert pro Token jedoch nur 6 Milliarden Parameter.

    eine Quelle
  • Die Architektur nutzt eine hybride Attention aus Gated DeltaNet für einen flachen KV-Cache und Qwen Sparse Attention auf Micro-Block-Ebene.

    eine Quelle

Der Beleg-Score wird berechnet, nicht handgesetzt: aus Vertrauensgrad, Quellenzahl und dem Anteil verifizierter Aussagen.

Quelle & Transparenz

Stand: 27. August 2026

KI-generiertKI-generiert: automatisiert aus geprüften Quellen erstellt und technisch qualitätsgesichert (Quellen-, Zitat- und Zahlenabgleich); keine menschliche Einzelfreigabe vor Veröffentlichung

Quellen
4
Verifizierte Aussagen
1 / 3
Beleg-Score
69Solide belegt

Wollen Sie das umsetzen?

Wir vermitteln Ihnen passende KI-Anbieter aus der DACH-Region, kostenlos und unverbindlich.

Wie geht's weiter?