Runway hat neue Details zu seiner Forschung im Bereich interaktiver generativer Welten veröffentlicht. Im Gespräch im Latent-Space-Podcast erläuterten Co-Mitgründer und Co-CEO Anastasis Germanidis sowie Chief Technology Officer Kamil Sindi die Architektur hinter WorldPrompt. Das Steuerungskonzept soll Entwicklern und Kreativen erlauben, dynamische Umgebungen nicht mehr nur über statische Prompts zu erzeugen, sondern diese in Echtzeit gezielt zu manipulieren. Damit reagiert das Unternehmen auf den wachsenden Bedarf an interaktiven Medienformaten, die über klassische Videogeneration hinausgehen.
Technisches Fundament der Demonstration ist das Forschungsmodell GWM Worlds 2, ein autoregressives Diffusionsmodell. Dieses System ist darauf ausgelegt, Bild- und Tonspuren synchron und mit extrem niedriger Latenz zu berechnen. Konkret liefert das Modell interaktives Videomaterial in einer Auflösung von 720p bei 24 Bildern pro Sekunde, begleitet von hochauflösendem 48-kHz-Audio. Die Kombination aus visueller Konsistenz und unmittelbarer Reaktion auf Benutzereingaben gilt in der Forschung als zentrale Hürde für vollwertige Weltmodelle.
An dieser Stelle setzt WorldPrompt als neue Schnittstelle an. Laut den Entwicklern handelt es sich dabei nicht um eine starre Skriptsprache, sondern um ein flexibles Eingabeformat für generative Weltmodelle. Das System erlaubt es Nutzern, bestimmte Ausgangsbedingungen wie das Initialbild oder fundamentale Umgebungsregeln einzufrieren. Darauf aufbauend können Akteure, Kameraperspektiven und physikalische Vorgänge über sogenannte timed actions gesteuert werden, die punktgenau auf der Zeitachse ausgelöst werden.
Dieser Ansatz unterscheidet sich grundlegend von bisherigen Videogeneratoren, bei denen nachträgliche Korrekturen oft das gesamte Bild verändern. Durch die Trennung von festem Zustand und dynamischen Aktionsbefehlen behält die Simulation ihre räumliche und physikalische Plausibilität bei. Wenn ein Nutzer beispielsweise eine Richtungsänderung der virtuellen Kamera eingibt, passt das Modell Beleuchtung und Perspektive nahtlos an, ohne dass das restliche Szenario verworfen wird. Dadurch eröffnen sich praktische Möglichkeiten für die Erstellung interaktiver Trainingsumgebungen und virtueller Prototypen.
Mit der Vorstellung von WorldPrompt verschärft sich zugleich der Wettbewerb um die Vorherrschaft bei generativen Weltmodellen. Runway positioniert seine Technologie explizit gegen Entwicklungen großer Forschungslabore wie Google DeepMind, das mit Genie 3 ähnliche interaktive Umgebungen erforscht. Ebenso zielt das System auf das von Fei-Fei Li mitbegründete Startup World Labs und dessen Modell RTFM ab. Während frühere Generationen von KI-Modellen vor allem Text oder einzelne Bilder ausgaben, verlagert sich das Wettrüsten nun auf die physikalisch konsistente Simulation ganzer digitaler Realitäten.
Trotz der technischen Fortschritte betonen die Runway-Verantwortlichen, dass sich GWM Worlds 2 vorerst im Forschungsstadium befindet. Hohe Anforderungen an Rechenkapazitäten und die Vermeidung von Halluzinationen bei längeren Simulationssequenzen bleiben zentrale Herausforderungen. Dennoch markiert die Einführung von WorldPrompt einen strategischen Schritt weg von reiner Postproduktion hin zu programmierbaren, interaktiven KI-Erlebnissen. Die breite Verfügbarkeit entsprechender Werkzeuge könnte die Arbeitsweise in Game-Design, Simulationstechnik und visueller Mediengestaltung in den kommenden Jahren grundlegend verändern.

