Zum Inhalt springen
AI ConnectPowered by VELENTIS
KI-generiert2 Min.

Laut Analyse von Simon Willison: Qwen3.8-27B scheitert bei ausgeschriebenen Wort-Additionen

Eine Benchmark-Analyse von Simon Willison zeigt, dass Qwen3.8-27B bei der Addition in englischen Worten ohne Denk-Tokens nur eine Genauigkeit von 23,57 Prozent erreicht.

Dieser Beitrag wurde KI-generiert und automatisch veröffentlicht. Einordnung, Kennzeichnung und alle Quellen am Beitragsende.

(KI-generiertes Symbolbild: Gemini / AI Connect)

In einer detaillierten Testreihe hat der Programmierer und KI-Analyst Simon Willison die mathematischen Fähigkeiten des Open-Weight-Modells Qwen3.8-27B offengelegt. Der Fokus dieses Experiments lag auf der grundlegenden Frage, wie verlässlich moderne Sprachmodelle einfache Rechenoperationen bewältigen, wenn das geforderte Ausgabeformat von der üblichen numerischen Zifferndarstellung abweicht. Anstelle von Standardziffern verlangte der Versuchsaufbau die Lösung von Integer-Additionen, deren Ergebnisse ausnahmslos in ausgeschriebenen englischen Worten formuliert werden mussten. Getestet wurde eine GGUF-quantisierte Variante des Modells, um die Inferenzleistung unter kontrollierten und reproduzierbaren Rahmenbedingungen zu untersuchen. Die Resultate verdeutlichen eine bemerkenswerte Kluft zwischen der sprachlichen Formulierungskunst und der tatsächlichen arithmetischen Korrektheit des Modells.

Die Untersuchung stützte sich auf eine breite empirische Basis von insgesamt 5.070 individuellen Testfällen, die nach der Größenordnung der jeweiligen Operanden strukturiert waren. Für den gesamten Testverlauf wurden die sogenannten Reasoning-Tokens, also explizite Denkphasen vor der endgültigen Textgenerierung, gezielt deaktiviert. Damit sollte isoliert überprüft werden, ob die reine autoregressive Token-Vorhersage ohne Zwischenüberlegungen in der Lage ist, mathematische Summierungen intern korrekt nachzuvollziehen. Das System stand vor der doppelten Herausforderung, einerseits die exakte mathematische Addition zu bewältigen und andererseits das Ergebnis direkt in natürliche Sprachbegriffe zu übersetzen. Bereits bei mittleren Stellengrößen zeigten sich dabei systematische Fehlermuster im Inferenzprozess.

Über den gesamten Testdatensatz von 5.070 Durchläufen hinweg erreichte Qwen3.8-27B ohne Denkphasen eine ernüchternde Rechengenauigkeit von lediglich 23,57 Prozent. Die Analyse offenbarte einen drastischen Leistungsabfall in Abhängigkeit von der Länge der addierten Zahlen. Während das Modell bei dreistelligen Operanden noch eine solide Genauigkeit von 97,04 Prozent verbuchen konnte, sank dieser Wert bei steigender Komplexität rapide ab. Bei Aufgaben mit zehn- bis dreizehnstelligen Operanden stürzte die Trefferquote schließlich auf minimale 6,44 Prozent ab. Dieser drastische Verfall verdeutlicht, dass das Modell bei längeren Zahlenfolgen nicht mehr imstande ist, die mathematische Übertragslogik in der Token-Sequenz stabil abzubilden.

Ein zentraler Befund der Untersuchung betrifft das eklatante Missverhältnis zwischen grammatikalischer Richtigkeit und mathematischer Wahrheit. In über 96 Prozent der fehlerhaften Testfälle erwies sich die grammatikalische Struktur der ausgegebenen Antworten als vollkommen korrekt. Das Modell formulierte flüssige, syntaktisch einwandfreie englische Zahlwörter, lieferte dabei jedoch sachlich und rechnerisch falsche Werte. Dieser Umstand offenbart die typische Funktionsweise rein autoregressiver Transformer, die primär auf die Vorhersage statistisch wahrscheinlicher Wortfolgen trainiert sind. Das System erzeugt damit eine rhetorisch überzeugende Illusion von Kompetenz, während der eigentliche Rechenvorgang im Hintergrund vollständig kollabiert.

Die von Simon Willison dokumentierte Versuchsreihe unterstreicht fundamentale Grenzen aktueller Transformer-Architekturen bei der Verarbeitung exakter Logik ohne Hilfsmittel. Autoregressive Modelle scheitern daran, komplexe mathematische Gesetzmäßigkeiten direkt und verlässlich in Wort-Tokens zu übersetzen, wenn ihnen keine explizite Denkzeit in Form von Reasoning-Tokens eingeräumt wird. Das Experiment belegt anschaulich, dass flüssige Textgenerierung nicht mit logischem Denkvermögen gleichgesetzt werden darf. Für den praktischen Einsatz bedeutet dies, dass anspruchsvolle numerische Aufgabenstellungen weiterhin zwingend auf spezielle Denkphasen oder dedizierte externe Programmierwerkzeuge angewiesen bleiben. Ohne solche architektonischen Stützen bleibt selbst ein Modell mit 27 Milliarden Parametern bei scheinbar einfachen Wort-Additionen fehleranfällig.

Was heißt das für Sie?

Für Entwickler und Anwender zeigt der Benchmark, dass selbst sprachlich versierte Modelle ohne aktivierte Denkphasen bei numerischen Berechnungen unzuverlässig bleiben. Wer generative Modelle für finanzielle, statistische oder datenkritische Aufgaben einsetzt, sollte arithmetische Ausgaben niemals rein textuell generieren lassen. Stattdessen sind explizite Reasoning-Schritte oder externe Code-Interpreter unerlässlich, um fatale Rechenfehler hinter scheinbar perfekter Grammatik zu vermeiden.

Belege

Solide belegt
46/100
  • Ohne aktivierte Reasoning-Tokens erzielte Qwen3.8-27B bei der Wort-Addition eine Gesamtgenauigkeit von lediglich 23,57 Prozent.

    eine Quelle
  • Die Trefferquote sank von 97,04 Prozent bei dreistelligen Zahlen auf 6,44 Prozent bei zehn- bis dreizehnstelligen Operanden.

    eine Quelle
  • Trotz der hohen Fehlerrate war die grammatikalische Struktur der Antworten in über 96 Prozent der Fälle korrekt.

    eine Quelle

Der Beleg-Score wird berechnet, nicht handgesetzt: aus Vertrauensgrad, Quellenzahl und dem Anteil verifizierter Aussagen.

Quelle & Transparenz

Stand: 06. Oktober 2026

KI-generiertKI-generiert: automatisiert aus geprüften Quellen erstellt und technisch qualitätsgesichert (Quellen-, Zitat- und Zahlenabgleich); keine menschliche Einzelfreigabe vor Veröffentlichung

Quellen
1
Verifizierte Aussagen
0 / 3
Beleg-Score
46Solide belegt

Wollen Sie das umsetzen?

Wir vermitteln Ihnen passende KI-Anbieter aus der DACH-Region, kostenlos und unverbindlich.

Wie geht's weiter?