Zum Inhalt springen
AI ConnectPowered by VELENTIS
KI-generiert3 Min.

Tavus stellt Video-to-Video-Modell Griffin für latenzfreie digitale Konversationen vor

Tavus hat mit Griffin ein Human Interaction Model vorgestellt, das Videogespräche in Echtzeit führt. In Tests hielten 48 Prozent der Nutzer das System für einen echten Menschen.

Dieser Beitrag wurde KI-generiert und automatisch veröffentlicht. Einordnung, Kennzeichnung und alle Quellen am Beitragsende.

(KI-generiertes Symbolbild: Gemini / AI Connect)

Am 1. Oktober 2026 hat Tavus-Geschäftsführer Hassaan Raza ein neuartiges System namens Griffin präsentiert. Das Modell wird als voll integriertes Human Interaction Model eingestuft und soll die visuelle Mensch-Maschine-Interaktion grundlegend erneuern. Im Zentrum der Vorstellung steht ein direkter Video-zu-Video-Ansatz, welcher frühere Verzögerungen bei der Erzeugung virtueller Gegenüber minimiert. Nutzer können sich dadurch mit einer künstlichen Figur unterhalten, ohne dass störende Latenzen den Gesprächsfluss unterbrechen. Dieser Schritt markiert eine deutliche Abkehr von bisherigen, schrittweise arbeitenden Methoden in der digitalen Videoproduktion.

Die bisherige Praxis bei computergenerierten Avataren und synchronen Lippenbewegungen basierte auf einer komplexen Kette getrennter Module. In einem typischen Ablauf musste gesprochene Sprache zunächst über Speech-to-Text in geschriebenen Text umgewandelt werden. Anschließend formulierte ein großes Sprachmodell den inhaltlichen Text der Antwort. Im dritten Schritt generierte eine Text-to-Speech-Komponente die passende Stimme, bevor ein spezialisiertes Rendering-System die Gesichtsanimationen berechnete. Aufgrund dieser Aneinanderreihung verschiedener Schnittstellen betrug die Latenzzeit bisher oft mehrere Sekunden, was unnatürliche Pausen im Dialog erzeugte.

Griffin bricht diese fragmentierte Kette auf, indem es Bildinformationen, Tonaufnahmen, Mimik und Emotionen in einem einzigen durchgehenden Video-zu-Video-Stream vereint. Durch diesen ganzheitlichen Aufbau meistert das System anspruchsvolle Gesprächssituationen im Vollduplex-Betrieb. Fällt der menschliche Gesprächspartner der virtuellen Figur ins Wort, kann das Modell diese Unterbrechung unmittelbar aufnehmen und die eigene Sprachausgabe anpassen. Ebenso ist das System in der Lage, eigenständig Zwischenrufe einzustreuen oder durch stummes Kopfnicken nonverbale Aufmerksamkeit zu signalisieren. Das System reagiert damit flexibel auf Nuancen, die für natürliche Unterhaltungen unerlässlich sind.

Die Wirksamkeit dieses neuen Ansatzes spiegelte sich in umfangreichen Testläufen und standardisierten Messungen wider. Bei praktischen Versuchen nahmen Probanden an einminütigen Videogesprächen mit dem künstlichen Modell teil. Nach Ablauf des Gesprächs hielten 48 Prozent der beteiligten Testpersonen ihr digitales Gegenüber tatsächlich für einen echten Menschen. Auch bei technischen Messungen erzielte das Modell hohe Werte. Auf dem anerkannten VideoFDB-Benchmark von Nvidia erreichte Griffin eine Punktzahl von 3,83 auf einer Skala bis fünf Punkte. Damit nähert sich die Technologie dicht an die menschliche Referenz an, die in demselben Test bei 3,92 Punkten liegt.

Für die Filmindustrie und die Gaming-Branche bedeutet der Fortschritt bei latenzfreien Video-to-Video-Systemen eine signifikante Weichenstellung. Bislang stützten sich digitale Schauspieler und Spielcharaktere weitgehend auf vorberechnete Animationen oder starre Verhaltensbäume. Mit reaktiven Echtzeit-Modellen können Entwickler nun interaktive Filmerlebnisse schaffen, in denen computergenerierte Figuren situativ agieren. Auch im Gaming-Sektor lassen sich Gefährten integrieren, die dynamisch auf Handlungen und Bemerkungen von Spielern eingehen. Digitale Doppelgänger und computergenerierte Darsteller vollziehen damit den Schritt von statischen Kulissen hin zu vollwertigen, live agierenden Partnern vor der Kamera.

Der Wandel von vorberechneten Inhalten zu echtzeitfähigen Systemen verändert die Produktionsabläufe in Studios und Entwicklungsabteilungen nachhaltig. Statt aufwändige Renderings für jede Dialogoption vorab zu erstellen, können Produktionshäuser flexible virtuelle Darsteller direkt in Workflows einbinden. Dies betrifft nicht nur interaktive Spiele, sondern auch neue Formen des filmischen Erzählens, bei denen die Grenze zwischen Zuschauer und Handlung verschwimmt. Griffin verdeutlicht, wie generative Modelle zunehmend in anspruchsvolle Latenzbereiche vordringen, die bisher menschlichen Darstellern vorbehalten waren.

Was heißt das für Sie?

Für Anwender und Entwickler bedeutet die Verringerung von Reaktionslatenzen bei virtuellen Figuren den Schritt von statischen Skripten hin zu interaktiven Echtzeit-Partnern. Neben neuen Gestaltungsräumen in Film und Gaming erfordert dies präzisere Prüfmechanismen für synthetische Medien, da die Unterscheidung zwischen Mensch und KI in Videogesprächen zunehmend schwindet.

Perspektiven

Berichterstattung: 3× Weitere

Dieselbe Geschichte, mehrere Blickwinkel: So rahmen die Quellen das Thema, jeweils mit wörtlichem Zitat.

  • tavus.ioWeitere

    Tavus präsentiert Griffin als weltweites Novum im Bereich der Interaktionsmodelle, das durch ein vereintes Video-zu-Video-System natürliche Echtzeitgespräche ohne störende Verzögerungen ermöglicht.

    Originalzitat

    „Griffin is the first model to pass the real-time, video Turing test.“

    tavus.io
  • digit.inWeitere

    Digit.in beleuchtet die technische Funktionsweise von Griffin zur Beseitigung von Gesprächspausen, äußert jedoch deutliche Skepsis gegenüber den unternehmenseigenen Erfolgsmeldungen zum Bestehen eines Video-Turing-Tests.

    Originalzitat

    „Study conducted and performed by the company selling the technology, and no external replication of the findings.“

    digit.in

Einordnung der Quellen redaktionell gepflegt (politisches Spektrum nur bei breitem Konsens; Anbieter-Kommunikation ist PR, kein Journalismus). Quellen ohne Etikett sind nicht eingeordnet — wir raten nicht.

Belege

Gut belegt
73/100
  • Tavus-CEO Hassaan Raza stellte das Human Interaction Model Griffin am 1. Oktober 2026 offiziell vor.

    eine Quelle
  • In einminütigen Videogesprächen hielten 48 Prozent der befragten Nutzer das Modell für einen echten Menschen.

    belegt
  • Auf dem VideoFDB-Benchmark von Nvidia erzielte Griffin eine Punktzahl von 3,83 von 5 möglichen Punkten gegenüber einer menschlichen Referenz von 3,92 Punkten.

    belegt
  • Das System ersetzt modulare Pipelines aus Sprache-zu-Text, Sprachmodell, Text-zu-Sprache und Rendering durch einen durchgehenden Video-to-Video-Stream.

    eine Quelle

Der Beleg-Score wird berechnet, nicht handgesetzt: aus Vertrauensgrad, Quellenzahl und dem Anteil verifizierter Aussagen.

Quelle & Transparenz

Stand: 03. Oktober 2026

KI-generiertKI-generiert: automatisiert aus geprüften Quellen erstellt und technisch qualitätsgesichert (Quellen-, Zitat- und Zahlenabgleich); keine menschliche Einzelfreigabe vor Veröffentlichung

Quellen
3
Verifizierte Aussagen
2 / 4
Beleg-Score
73Gut belegt

Wollen Sie das umsetzen?

Wir vermitteln Ihnen passende KI-Anbieter aus der DACH-Region, kostenlos und unverbindlich.

Wie geht's weiter?