PixVerse 发布 R2,推动实时世界模型迈向持久、可玩的世界
R2 是 PixVerse 实时世界模型的升级版本,聚焦于规模化:模型可处理更多数据、任务和输入类型,同时保持实时运行。
基于基础模型的 AI 视频生成通常是一次性的。模型接收提示词,生成一段固定的视频,然后停止。若要修改,用户必须使用新的提示词和新的视频重新开始。每个结果都是封闭且独立的。
实时世界模型的运作方式不同。它不会返回一段视频,而是生成一个在用户身处其中时持续运行的世界。这个世界可以实时探索。模型仍在生成时就会接收新的输入,并改变后续发生的内容。世界不会在操作之间重置;它会在整个过程中保留状态,并随着会话持续而保持一致。
PixVerse 于 2026 年 1 月推出全球首个实时世界模型 R1。R1 证明了这一范式可行:视频可以成为连续、可交互、视听一体的流,而不只是固定输出。
今天,我们推出实时世界模型的升级版本 R2。它能在更长的会话中保持连贯,记住会话内发生的内容并持续传递,还能将文本、参考素材、音频和操作控制整合到同一个持续运行的世界中。
能记忆并作出回应的世界
R2 的核心变化在于输入能够产生什么作用。在普通 AI 视频以及早期的实时生成中,输入只影响当前时刻,随后该时刻便会过去。下一次操作从头开始,世界不会保留任何内容。
在 R2 中,输入会持续生效。提示词、操作或音频提示不只是改变当前画面;它会更新世界的运行状态,并塑造后续发展:角色之后如何行动、情境如何化解,以及环境会如何随会话继续演变。较早的操作在同一次会话的后续阶段仍然成立。
探索鲜活的世界。 玩家进入一个生成的世界并实时穿行其中,使用 WASD 键控制角色,使用方向键调整镜头。玩家行进时,提示词会改变世界、加入元素并改变环境。角色以符合物理逻辑的方式与周围互动,每次输入都会建立在上一次之上,而不是从头开始。
塑造故事。 世界能够发展出会随玩家行为变化的故事线。在创作者 Xiaolongbao 基于 R2 打造的互动电影游戏 Zero Mark 中,一个生物拦住去路并索要礼物。送给它一条龙或一片叶子,会带来真正不同的回应。故事从输入中分支,而不是遵循预先写好的路径;模型会实时生成每一种结果。

在 Zero Mark 中,同一场遭遇会走向两条路径:向生物赠送一条龙或一片叶子,会实时生成不同的回应。
能结合上下文回应的角色。 世界中的角色能够理解玩家,并随着故事进展作出回应。在创作者 Jade Wu 使用 R2 构建的一个互动故事中,玩家会与名为 Eve 的角色交谈;她在整段对话中保持身份和记忆,引导出线索并推动剧情。她的回复、表情和动作都与此前的对话和故事进度保持一致。她在多次交流中维持稳定身份,不会重置,因此比起脚本化的非玩家角色,更像一个认识你、了解正在发生什么的人。
规模化难题与 R2 的答案
与生成固定视频片段不同,后者模型只接收一个提示词和固定的时长来完成内容;一个持续运行的世界没有这样的边界。它必须持续同时完成多项工作而不出错:
- 长期保持连贯。 角色、地点和世界规则必须保持不变。运行时间每多一秒,就多一次发生漂移的机会。
- 在生成过程中接收输入。 模型不能停下来思考。世界运行时会有新的控制指令到来,模型必须在不中断运行的情况下将其整合进去。
- 记忆并恢复。 模型必须保留已经发生的内容;当长会话中积累了小错误时,应当修正它们,而不是让错误不断叠加。
- 实时完成这一切。 延迟预算必须足够低,才能让体验具有交互感。
在这些要求之下存在更深层的张力。让模型快到能够实时运行的常见方法是把它做得更简单;而让模型更有能力的常见方法是把它做得更大、更重、更慢。速度和能力彼此拉扯。该领域构建这些系统的标准方式进一步加剧了问题:通过很长的一连串独立训练阶段,每个阶段交接给下一个阶段,质量和稳定性会在每次交接中被削弱。
R2 的答案是不再强迫速度与能力二选一,而是将工作拆分为两个建立在同一基础上的阶段。Omni Causal AR 是能力引擎,如同持续训练的主干网络。它让单一因果模型不断学习更多数据、更多输入类型、更多任务和更长时间跨度,在同一处累积能力,而不是在交接中衰减。
随后,实时加速层将同一个模型压缩至可实时运行,而不是从零开始训练另一个快速模型,因此能力的提升不再以速度为代价。

R2 如何以一个持续训练、为实时使用而压缩的单一模型,取代传统多步骤训练流程中每次交接都会损失质量的方式。
围绕这两个阶段,R2 还采用了一系列针对性的工程方案,使每一项能力提升都能延续到实时产品中。完整的 PixVerse R2 技术报告 包含架构与评估细节。
PixVerse 联合创始人兼 CEO 王长虎表示:“大语言模型证明了,规模化是通往能力提升的可靠路径。R2 证明实时世界模型也可以遵循类似路径:借助合适的架构,模型可以在不放弃实时交互的前提下持续提升能力。随着时间推移,创作工具将由此成为人们能够进入并塑造的环境。”
从世界模型到可玩的游戏
R2 已从研究演示跨越到可用于构建真实产品的阶段。PixVerse Game Engine 于 2026 年 7 月首次推出,如今已运行在 R2 之上。

PixVerse Games 负责人 Chow Li 在 2026 年 9 月 Tech in Asia Conference 上展示 PixVerse 实时游戏引擎。
在 9 月的 Tech in Asia Conference 上,PixVerse 游戏负责人 Chow Li 将其描述为游戏定义的转变。传统上构成游戏的元素——角色、世界以及玩家的选择——不再是预先制作好的固定资产。现在,玩家可以说出自己想要什么并看到它发生;体验通过游玩形成,而不是提前被写好。创造世界和游玩世界成为同一个动作。

PixVerse 联合创始人兼总裁 Jaden Xie 于 2026 年 9 月在新加坡 Google AI App Day 的圆桌讨论中发言。
在新加坡 Google AI App Day 的圆桌讨论中,PixVerse 联合创始人兼总裁 Jaden Xie 指出,视频模型的进步正成为下一波原生 AI 游戏的重要驱动力。Jaden 表示:“自从我们在 7 月开放测试版以来,创作者基于我们的世界模型打造的内容令人振奋。我们相信,视频模型将帮助更多创作者将创意变为现实。”
使用方式
现在可前往 world.pixverse.video 探索这些世界的精选集合。
关于 PixVerse
PixVerse 是全球 AI 视频生成平台,受到 177 个以上国家和地区逾 1.5 亿用户的信赖。凭借完全自主研发的一系列模型,PixVerse 让任何人都能通过提示词、照片或视频片段创作电影质感的视频。2026 年 1 月,PixVerse 推出全球首个实时世界模型 R1,将视频转变为无限、连续且可交互的流。R2 在此基础上进一步扩展实时世界模型,使其能够运行更久、保持更连贯的会话。PixVerse 于 2023 年成立,团队分布于亚洲和美国,致力于让视频成为人类表达的通用语言。2026 年 3 月,PixVerse 完成 C 轮融资并晋升独角兽企业。更多信息请访问 pixverse.ai。