PixVerse stellt R2 vor und entwickelt spielbare Echtzeitwelten weiter

R2 ist das Upgrade für das Echtzeit-Weltmodell von PixVerse und verarbeitet mehr Daten, Aufgaben und Eingabetypen, während es in Echtzeit läuft.

News
Visualisierung des PixVerse R2 Echtzeit-Weltmodells mit einer spielbaren Fantasylandschaft

Die KI-Videogenerierung mit Basismodellen erfolgt in der Regel einmalig. Ein Modell erhält einen Prompt, erzeugt einen festen Clip und stoppt. Um Änderungen vorzunehmen, muss der Nutzer mit einem neuen Prompt und einem neuen Clip von vorn beginnen. Jedes Ergebnis ist abgeschlossen und eigenständig.

Ein Echtzeit-Weltmodell funktioniert anders. Anstatt einen Clip zurückzugeben, erzeugt es eine Welt, die weiterläuft, während sich ein Nutzer darin befindet. Die Welt ist in Echtzeit navigierbar. Neue Eingaben treffen ein, während das Modell noch generiert, und verändern das, was als Nächstes geschieht. Die Welt wird zwischen Aktionen nicht zurückgesetzt und behält ihren Zustand während der gesamten Nutzung bei; je länger eine Sitzung läuft, desto konsistenter bleibt sie.

Im Januar 2026 stellte PixVerse mit R1 das weltweit erste Echtzeit-Weltmodell vor. R1 bewies, dass dieses Paradigma umsetzbar ist: Video kann zu einem kontinuierlichen, interaktiven audiovisuellen Stream werden, statt eine feste Ausgabe zu bleiben.

Heute veröffentlichen wir R2, ein Upgrade des Echtzeit-Weltmodells. Es bleibt über wesentlich längere Sitzungen hinweg kohärent, erinnert sich an Ereignisse innerhalb einer Sitzung und führt sie fort. Außerdem integriert es Text, Referenzen, Audio und Aktionssteuerungen in dieselbe laufende Welt.

Eine Welt, die sich erinnert und reagiert

Die zentrale Veränderung bei R2 liegt darin, was Eingaben bewirken können. Bei herkömmlichem KI-Video und früheren Versionen der Echtzeitgenerierung beeinflusst eine Eingabe den aktuellen Moment, der dann vorübergeht. Die nächste Aktion beginnt neu. Die Welt nimmt nichts mit.

Bei R2 bleiben Eingaben erhalten. Ein Prompt, eine Aktion oder ein Audiosignal verändert nicht nur den aktuellen Frame. Es aktualisiert den laufenden Zustand der Welt und prägt, was folgt: wie sich eine Figur später verhält, wie sich eine Situation auflöst und wie sich die Umgebung entwickelt, während die Sitzung weitergeht. Eine frühere Aktion bleibt später in derselben Sitzung wahr.

Erkunden Sie eine lebendige Welt. Ein Spieler betritt eine generierte Welt und bewegt sich in Echtzeit durch sie, steuert eine Figur mit den WASD-Tasten und verschiebt die Kamera mit den Pfeiltasten. Prompts verändern die Welt während des Spiels, fügen Elemente hinzu und wandeln die Umgebung. Die Figur interagiert mit ihrer Umgebung nach einer physischen Logik, und jede Eingabe baut auf der vorherigen auf, statt wieder bei null anzufangen.

Gestalten Sie die Geschichte. Die Welt kann eine Handlung entwickeln, die sich nach den Aktionen des Spielers richtet. In Zero Mark, einem von Creator Xiaolongbao mit R2 entwickelten interaktiven Filmspiel, versperrt eine Kreatur den Weg und bittet um ein Geschenk. Ob man ihr einen Drachen oder ein Blatt anbietet, führt zu tatsächlich unterschiedlichen Reaktionen. Die Geschichte verzweigt sich aus der Eingabe heraus, statt einem vorab geschriebenen Pfad zu folgen, und das Modell generiert jedes Ergebnis live.

In Zero Mark nimmt dieselbe Begegnung zwei Wege: Ein Drache oder ein Blatt als Geschenk für die Kreatur führt zu unterschiedlichen, live generierten Reaktionen.

In Zero Mark nimmt dieselbe Begegnung zwei Wege: Ein Drache oder ein Blatt als Geschenk für die Kreatur führt zu unterschiedlichen, live generierten Reaktionen.

Figuren, die im Kontext reagieren. Figuren in der Welt können einen Spieler verstehen und passend zur Handlung reagieren. In einer von Creator Jade Wu mit R2 entwickelten interaktiven Geschichte sprechen Spieler mit einer Figur namens Eve, die während des Gesprächs Identität und Erinnerung bewahrt, Hinweise hervorbringt und die Handlung vorantreibt. Ihre Antworten, ihr Ausdruck und ihre Bewegungen folgen sowohl dem bisherigen Gespräch als auch dem erreichten Stand der Geschichte. Sie behält über viele Dialoge hinweg eine konsistente Identität, statt zurückgesetzt zu werden, und wirkt weniger wie eine geskriptete Nicht-Spieler-Figur als wie jemand, der Sie kennt und dem Geschehen folgt.

Die Herausforderung der Skalierung und die Antwort von R2

Anders als bei der Erzeugung eines festen Videoclips, bei der das Modell einen einzelnen Prompt und eine festgelegte Zeitspanne zum Ausfüllen erhält, hat eine Welt, die weiterläuft, keine solche Grenze. Sie muss fortlaufend mehrere Dinge zugleich erledigen, ohne zu zerbrechen:

  • Über die Zeit kohärent bleiben. Die Figur, der Ort und die Regeln der Welt müssen gleich bleiben. Jede weitere Laufzeitsekunde ist eine weitere Gelegenheit für Abweichungen.
  • Eingaben während der Generierung annehmen. Das Modell kann nicht zum Nachdenken pausieren. Neue Steuerungen treffen ein, während die Welt in Bewegung ist, und müssen ohne Unterbrechung integriert werden.
  • Sich erinnern und korrigieren. Das Modell muss bereits Geschehenes fortführen und kleine Fehler, die sich in einer langen Sitzung ansammeln, korrigieren, statt sie zu verstärken.
  • All dies live leisten. Das Latenzbudget muss niedrig genug bleiben, damit sich die Erfahrung interaktiv anfühlt.

Hinter diesen Anforderungen liegt ein tieferer Zielkonflikt. Der übliche Weg, ein Modell schnell genug für Echtzeit zu machen, besteht darin, es einfacher zu machen; der übliche Weg, es leistungsfähiger zu machen, besteht darin, es schwerer und langsamer zu machen. Geschwindigkeit und Leistungsfähigkeit ziehen in entgegengesetzte Richtungen. Die Standardmethode, mit der das Feld diese Systeme entwickelt hat, verschärft das Problem: eine lange Kette getrennter Trainingsstufen, die jeweils an die nächste übergeben, während Qualität und Stabilität bei jeder Übergabe nachlassen.

R2 löst dies, indem es keine Entscheidung mehr zwischen Geschwindigkeit und Leistungsfähigkeit erzwingt und die Arbeit in zwei Stufen aufteilt, die auf derselben Grundlage aufbauen. Omni Causal AR ist die Leistungsfähigkeits-Engine und fungiert wie ein kontinuierlich trainiertes Rückgrat. Es entwickelt ein einziges kausales Modell, das mit mehr Daten, mehr Eingabetypen, mehr Aufgaben und längeren Zeiträumen weiterlernt und Leistungsfähigkeit an einer Stelle aufbaut, statt sie bei Übergaben abzubauen.

Die Echtzeit-Beschleunigungsschicht nimmt anschließend dasselbe Modell und komprimiert es für den Live-Betrieb, statt ein separates schnelles Modell von Grund auf zu trainieren. So gehen Zugewinne an Leistungsfähigkeit nicht mehr zulasten der Geschwindigkeit.

Wie R2 die herkömmliche mehrstufige Trainingspipeline, bei der die Qualität an jeder Übergabe nachlässt, durch ein einziges kontinuierlich trainiertes und für Echtzeit komprimiertes Modell ersetzt.

Wie R2 die herkömmliche mehrstufige Trainingspipeline, bei der die Qualität an jeder Übergabe nachlässt, durch ein einziges kontinuierlich trainiertes und für Echtzeit komprimiertes Modell ersetzt.

Diese beiden Stufen werden von gezielten Engineering-Entscheidungen umgeben, die sicherstellen, dass jeder Zugewinn an Leistungsfähigkeit im Echtzeitprodukt ankommt. Der vollständige technische Bericht zu PixVerse R2 enthält die Architektur- und Evaluierungsdetails.

“Große Sprachmodelle haben gezeigt, dass Skalierung ein verlässlicher Weg zu Leistungsfähigkeit ist”, sagte Changhu Wang, Mitgründer und CEO von PixVerse. “R2 zeigt, dass Echtzeit-Weltmodelle einen ähnlichen Weg gehen können: Mit der richtigen Architektur kann ein Modell immer leistungsfähiger werden, ohne die Echtzeitinteraktion aufzugeben. So wird aus einem Kreativwerkzeug mit der Zeit eine Umgebung, die Menschen betreten und gestalten können.”

Vom Weltmodell zu spielbaren Spielen

R2 hat den Schritt von einer Forschungsdemonstration zu einer Grundlage für reale Produkte geschafft. Die PixVerse Game Engine, die erstmals im Juli 2026 vorgestellt wurde, läuft jetzt auf R2.

Chow Li, Head of PixVerse Games, präsentiert die Echtzeit-Game-Engine von PixVerse auf der Tech in Asia Conference im September 2026.

Chow Li, Head of PixVerse Games, präsentiert die Echtzeit-Game-Engine von PixVerse auf der Tech in Asia Conference im September 2026.

Bei seiner Präsentation auf der Tech in Asia Conference im September beschrieb Chow Li, Head of Games bei PixVerse, dies als einen Wandel dessen, was ein Spiel sein kann. Die Elemente, die ein Spiel traditionell ausmachen — Figuren, Welten und die Entscheidungen eines Spielers — sind nicht länger feste, im Voraus erstellte Assets. Ein Spieler kann nun sagen, was er möchte, und es geschehen sehen; die Erfahrung entsteht im Spiel, statt vorab verfasst zu sein. Die Welt zu erschaffen und sie zu spielen werden zu derselben Handlung.

Jaden Xie, Mitgründer und Präsident von PixVerse, spricht im September 2026 bei einer Podiumsdiskussion auf dem Google AI App Day in Singapur.

Jaden Xie, Mitgründer und Präsident von PixVerse, spricht im September 2026 bei einer Podiumsdiskussion auf dem Google AI App Day in Singapur.

Bei einer Podiumsdiskussion auf dem Google AI App Day in Singapur verwies Mitgründer und Präsident Jaden Xie auf Fortschritte bei Videomodellen als starken Treiber für die nächste Welle KI-nativer Spiele. “Spannend ist, was Creator auf unserem Weltmodell entwickelt haben, seit wir im Juli die Beta geöffnet haben”, sagte Jaden. “Wir glauben, dass unsere Videomodelle mehr Creator dabei unterstützen werden, ihre Ideen zum Leben zu erwecken.”

Verfügbarkeit

Eine Sammlung dieser Welten kann jetzt unter world.pixverse.video erkundet werden.

Über PixVerse

PixVerse ist eine globale Plattform für KI-Videogenerierung, der mehr als 150 Millionen Nutzer in über 177 Ländern vertrauen. Mit einer Suite proprietärer, vollständig intern entwickelter Modelle ermöglicht PixVerse jedem, Video in Kinoqualität aus einem Prompt, Foto oder Clip zu erstellen. Im Januar 2026 veröffentlichte PixVerse R1, das weltweit erste Echtzeit-Weltmodell, und verwandelte Video in einen unendlichen, kontinuierlichen und interaktiven Stream. R2 baut auf dieser Grundlage auf und skaliert das Echtzeit-Weltmodell für längere, kohärentere Sitzungen. Mit Teams in Asien und den USA wurde PixVerse 2023 gegründet, mit dem Ziel, Video zur universellen Sprache menschlichen Ausdrucks zu machen. Im März 2026 schloss PixVerse seine Series-C-Finanzierungsrunde ab und erreichte den Unicorn-Status. Weitere Informationen finden Sie unter pixverse.ai.