Am 1. Oktober 2026 hat Tavus-Geschäftsführer Hassaan Raza ein neuartiges System namens Griffin präsentiert. Das Modell wird als voll integriertes Human Interaction Model eingestuft und soll die visuelle Mensch-Maschine-Interaktion grundlegend erneuern. Im Zentrum der Vorstellung steht ein direkter Video-zu-Video-Ansatz, welcher frühere Verzögerungen bei der Erzeugung virtueller Gegenüber minimiert. Nutzer können sich dadurch mit einer künstlichen Figur unterhalten, ohne dass störende Latenzen den Gesprächsfluss unterbrechen. Dieser Schritt markiert eine deutliche Abkehr von bisherigen, schrittweise arbeitenden Methoden in der digitalen Videoproduktion.
Die bisherige Praxis bei computergenerierten Avataren und synchronen Lippenbewegungen basierte auf einer komplexen Kette getrennter Module. In einem typischen Ablauf musste gesprochene Sprache zunächst über Speech-to-Text in geschriebenen Text umgewandelt werden. Anschließend formulierte ein großes Sprachmodell den inhaltlichen Text der Antwort. Im dritten Schritt generierte eine Text-to-Speech-Komponente die passende Stimme, bevor ein spezialisiertes Rendering-System die Gesichtsanimationen berechnete. Aufgrund dieser Aneinanderreihung verschiedener Schnittstellen betrug die Latenzzeit bisher oft mehrere Sekunden, was unnatürliche Pausen im Dialog erzeugte.
Griffin bricht diese fragmentierte Kette auf, indem es Bildinformationen, Tonaufnahmen, Mimik und Emotionen in einem einzigen durchgehenden Video-zu-Video-Stream vereint. Durch diesen ganzheitlichen Aufbau meistert das System anspruchsvolle Gesprächssituationen im Vollduplex-Betrieb. Fällt der menschliche Gesprächspartner der virtuellen Figur ins Wort, kann das Modell diese Unterbrechung unmittelbar aufnehmen und die eigene Sprachausgabe anpassen. Ebenso ist das System in der Lage, eigenständig Zwischenrufe einzustreuen oder durch stummes Kopfnicken nonverbale Aufmerksamkeit zu signalisieren. Das System reagiert damit flexibel auf Nuancen, die für natürliche Unterhaltungen unerlässlich sind.
Die Wirksamkeit dieses neuen Ansatzes spiegelte sich in umfangreichen Testläufen und standardisierten Messungen wider. Bei praktischen Versuchen nahmen Probanden an einminütigen Videogesprächen mit dem künstlichen Modell teil. Nach Ablauf des Gesprächs hielten 48 Prozent der beteiligten Testpersonen ihr digitales Gegenüber tatsächlich für einen echten Menschen. Auch bei technischen Messungen erzielte das Modell hohe Werte. Auf dem anerkannten VideoFDB-Benchmark von Nvidia erreichte Griffin eine Punktzahl von 3,83 auf einer Skala bis fünf Punkte. Damit nähert sich die Technologie dicht an die menschliche Referenz an, die in demselben Test bei 3,92 Punkten liegt.
Für die Filmindustrie und die Gaming-Branche bedeutet der Fortschritt bei latenzfreien Video-to-Video-Systemen eine signifikante Weichenstellung. Bislang stützten sich digitale Schauspieler und Spielcharaktere weitgehend auf vorberechnete Animationen oder starre Verhaltensbäume. Mit reaktiven Echtzeit-Modellen können Entwickler nun interaktive Filmerlebnisse schaffen, in denen computergenerierte Figuren situativ agieren. Auch im Gaming-Sektor lassen sich Gefährten integrieren, die dynamisch auf Handlungen und Bemerkungen von Spielern eingehen. Digitale Doppelgänger und computergenerierte Darsteller vollziehen damit den Schritt von statischen Kulissen hin zu vollwertigen, live agierenden Partnern vor der Kamera.
Der Wandel von vorberechneten Inhalten zu echtzeitfähigen Systemen verändert die Produktionsabläufe in Studios und Entwicklungsabteilungen nachhaltig. Statt aufwändige Renderings für jede Dialogoption vorab zu erstellen, können Produktionshäuser flexible virtuelle Darsteller direkt in Workflows einbinden. Dies betrifft nicht nur interaktive Spiele, sondern auch neue Formen des filmischen Erzählens, bei denen die Grenze zwischen Zuschauer und Handlung verschwimmt. Griffin verdeutlicht, wie generative Modelle zunehmend in anspruchsvolle Latenzbereiche vordringen, die bisher menschlichen Darstellern vorbehalten waren.

