Zum Inhalt springen
AI ConnectPowered by VELENTIS
KI-generiert2 Min.

Google DeepMind stellt Gemini 3.8 Live für Speech-to-Speech vor

Google DeepMind hat Gemini 3.8 Live veröffentlicht: Die neuen Audiomodelle ermöglichen natives Speech-to-Speech mit Hintergrund-Reasoning und unterbrechungsfreiem Tool-Calling.

Dieser Beitrag wurde KI-generiert und automatisch veröffentlicht. Einordnung, Kennzeichnung und alle Quellen am Beitragsende.

(KI-generiertes Symbolbild: Gemini / AI Connect)

Google DeepMind hat am 15. September 2026 zwei neue Sprachmodelle unter den Produktbezeichnungen Gemini 3.8 Live und Gemini 3.8 Live Extended Thinking offiziell veröffentlicht. Die neuen Modelle stehen Entwicklern ab sofort sowohl über die Gemini Live API als auch innerhalb der Entwicklungsumgebung Google AI Studio zur Verfügung. Mit dieser Veröffentlichung zielt Google darauf ab, Programmierern und Unternehmen hochgradig reaktionsfähige Sprachsysteme für anspruchsvolle Echtzeitanwendungen bereitzustellen. Der Schritt verdeutlicht den wachsenden Trend in der Branche, Sprachmodelle nicht mehr nur als Textausgabe, sondern als vollwertige Audio-Agenten zu konzipieren.

Technologisch setzt die neue Modellreihe auf ein natives Speech-to-Speech-Verfahren, das gesprochene Eingaben direkt im Audiobereich verarbeitet. Bisherige Sprachassistenzsysteme waren in der Regel gezwungen, Audiosignale zuerst in Text umzuwandeln, diesen semantisch zu verarbeiten und das Ergebnis anschließend über eine separate Sprachsynthese wieder auszugeben. Dieser mehrstufige Ablauf führte in der Praxis unweigerlich zu spürbaren Latenzen und zum Verlust stimmlicher Nuancen. Gemini 3.8 Live umgeht diesen Medienbruch, indem es akustische Signale direkt aufnimmt, analysiert und unmittelbar als gesprochene Antwort generiert.

Ein besonderes Merkmal der Ankündigung ist die Variante Gemini 3.8 Live Extended Thinking, die über erweiterte logische Denkfähigkeiten verfügt. Das Modell ist in der Lage, paralleles Hintergrund-Reasoning durchzuführen, während die eigentliche Konversation mit dem Anwender ohne Pause fortgeführt wird. Während frühere Reasoning-Modelle vor einer Antwort oft lange Rechenpausen einlegen mussten, verlagert Google diesen Prozess nun in simultane Hintergrundprozesse. Anwender können dadurch ohne künstliche Verzögerungen weiterreden, während das System im Hintergrund komplexe Zusammenhänge strukturiert und bewertet.

Als weiteren zentralen Fortschritt hebt Google das asynchrone Tool-Calling hervor, welches das nahtlose Aufrufen externer Schnittstellen ermöglicht. In früheren Architekturen führten Funktionsaufrufe häufig zu Gesprächsabbrüchen, weil das System den Dialog anhalten musste, um Daten von Drittdiensten abzuwarten. Bei Gemini 3.8 Live werden Werkzeugaufrufe nun asynchron im laufenden Betrieb getätigt, ohne den Sprachfluss zu stören oder Verbindungsabbrüche zu provozieren. Diese Fähigkeit ist entscheidend, um KI-Agenten mit externen Datenbanken oder Steuerbefehlen auszustatten, ohne dass die Natürlichkeit des Gesprächs leidet.

Die Veröffentlichung fand unmittelbaren Widerhall in der Entwickler- und Streaming-Infrastruktur. Zeitgleich mit Googles Ankündigung gaben führende Plattformen wie LiveKit, Agora und Fishjam eigene Integrationen für Gemini 3.8 Live bekannt. Diese Anbieter stellen die essenziellen Netzwerkprotokolle bereit, die für bidirektionale Sprachkommunikation mit extrem niedrigen Latenzzeiten erforderlich sind. Durch diese sofortige Bereitstellung wird es Entwicklungsteams weltweit ermöglicht, die neuen Audio-Modelle ohne eigene komplexe Serverarchitektur direkt in bestehende Softwareprodukte einzubinden.

Besonders stark dürfte die Unterhaltungsbranche von der neuen Infrastruktur profitieren, da Echtzeit-Audio-Agenten hier neue kreative Möglichkeiten eröffnen. Entwickler und Medienhäuser planen den Einsatz der Modelle unter anderem für interaktive Hörspiele, bei denen Zuhörer den Handlungsverlauf im laufenden Dialog beeinflussen können. Ebenso rücken dynamische Synchronisationen in den Fokus, bei denen Stimmen lippensynchron und flexibel angepasst werden. Nicht zuletzt erproben Sender KI-gestützte Radio-Co-Moderatoren, die live und ohne Verzögerung mit menschlichen Moderatoren und Anrufern interagieren können.

Was heißt das für Sie?

Für Entwickler und Medienhäuser bedeutet die Einführung von Gemini 3.8 Live den Abschied von schwerfälligen, mehrstufigen Sprach-Pipelines. Durch natives Speech-to-Speech und asynchrones Tool-Calling lassen sich flüssige interaktive Spracherlebnisse ohne störende Denkpausen realisieren. Gleichzeitig senken fertige Schnittstellen bei Infrastrukturanbietern wie LiveKit und Agora die Hürde für produktionsreife Audio-Agenten erheblich.

Perspektiven

Berichterstattung: 1× USA · 1× Weitere

Dieselbe Geschichte, mehrere Blickwinkel: So rahmen die Quellen das Thema, jeweils mit wörtlichem Zitat.

Einordnung: 1× Anbieter-PR

  • blog.googleAnbieter-PRUSA

    Google präsentiert Gemini 3.8 Live als bedeutenden Entwicklungsschritt für native Speech-to-Speech-Modelle, der Entwicklern das Erstellen intelligenter Sprachassistenten mit gleichzeitiger Aufgabenverarbeitung ermöglicht.

    Originalzitat

    Gemini 3.8 Live brings a step change to our native speech-to-speech models

    blog.google
  • buttondown.comWeitere

    Der Newsletter hebt hervor, dass das Modell störende Pausen in Sprachassistenten beseitigt, indem es logische Schlussfolgerungen und Funktionsaufrufe während des Sprechens parallel im Hintergrund ausführt.

    Originalzitat

    Google's new Live API models hold a real-time voice conversation and keep reasoning in the background while they speak.

    buttondown.com

Einordnung der Quellen redaktionell gepflegt (politisches Spektrum nur bei breitem Konsens; Anbieter-Kommunikation ist PR, kein Journalismus). Quellen ohne Etikett sind nicht eingeordnet — wir raten nicht.

Belege

Solide belegt
65/100
  • Google DeepMind hat am 15. September 2026 die Modelle Gemini 3.8 Live und Gemini 3.8 Live Extended Thinking in der Gemini Live API und im Google AI Studio freigegeben.

    belegt
  • Die neuen Modelle beherrschen natives Speech-to-Speech mit parallelem Hintergrund-Reasoning und asynchronem Tool-Calling ohne Gesprächsabbrüche.

    eine Quelle
  • Infrastruktur-Plattformen wie LiveKit, Agora und Fishjam kündigten zeitgleich Integrationen für Gemini 3.8 Live an.

    belegt
  • Die Technologie zielt auf Anwendungen in der Unterhaltungsindustrie wie interaktive Hörspiele, dynamische Synchronisationen und latenzfreie KI-Radio-Co-Moderatoren.

    eine Quelle

Der Beleg-Score wird berechnet, nicht handgesetzt: aus Vertrauensgrad, Quellenzahl und dem Anteil verifizierter Aussagen.

Quelle & Transparenz

Stand: 17. September 2026

KI-generiertKI-generiert: automatisiert aus geprüften Quellen erstellt und technisch qualitätsgesichert (Quellen-, Zitat- und Zahlenabgleich); keine menschliche Einzelfreigabe vor Veröffentlichung

Quellen
2
Verifizierte Aussagen
2 / 4
Beleg-Score
65Solide belegt

Wollen Sie das umsetzen?

Wir vermitteln Ihnen passende KI-Anbieter aus der DACH-Region, kostenlos und unverbindlich.

Wie geht's weiter?