PixVerse R2:扩展实时全模态世界模型

PixVerse R2 以统一的 Omni 因果自回归与实时加速路径,持续扩展实时全模态世界模型的生成质量、长程一致性与多模态交互能力。

PixVerse Research
PixVerse R2 英文研究封面:扩展实时全模态世界模型

简介

PixVerse R1 提出并实现了首个实时视频世界模型,将视频生成从一次性交付的固定内容转化为持续运行的世界演化过程。模型可以在运行中持续接收用户输入、实时更新世界状态,并连续输出与交互一致的同步音视频。R1 证明了实时视频世界模型这一技术范式可以成立。

PixVerse R2 进一步回答实时视频世界模型如何持续 Scaling。R2 聚焦两个目标:第一,构建能够长期保持统一状态的动态世界,将完整时空建模获得的生成先验转化为沿时间单向推进的世界演化;第二,将 Text、Reference、Audio 与 Action 中的物理因果和交互信号持续内化进同一个模型,使世界能够边生成、边接收控制、边更新状态,并连续输出同步音视频。围绕这两个目标,R2 让模型、数据、任务、控制信号与时间尺度的增长,持续转化为生成质量、长程一致性和多模态控制能力的提升。

围绕这一目标,R2 将整体框架收敛为两个核心层次:Omni Causal AR 与 Real-Time Acceleration。Omni Causal AR 持续扩展高质量、多模态和长程世界生成能力;Real-Time Acceleration 则在严格的交互延迟约束下,尽可能无损地继承这些能力。二者形成一条清晰的演进路径:持续扩大世界模型的能力上限,再将这一能力稳定加速到实时、可交互的运行区间。

总体框架

过去的长视频与实时生成框架通常依赖多个相互串联的训练阶段:先将双向模型转换为 AR 模型,再通过面向子任务的双向模型构造蒸馏 Teacher,随后执行 DMD 蒸馏,并进一步引入带 self-rollout 的 DMD 训练以缩小训练与推理之间的差异。每个阶段都需要重新完成能力迁移、目标对齐和数据分布适配;上游模型已经获得的画面质量、运动表现、条件遵循与长程稳定性,也可能在一次次迁移中产生折损。随着模型、数据和任务规模继续扩大,这种多阶段 Pipeline 会使优化目标逐渐割裂,训练成本与系统复杂度同步上升。

旧式多阶段 Pipeline 与 PixVerse R2 Scaling World Modeling 对比

图 1|旧式多阶段 Pipeline 与 PixVerse R2 Scaling World Modeling 对比:R2 将能力扩展与实时蒸馏收敛为 Omni Causal AR 和实时加速层两个核心训练过程,并在同一框架中统一多任务、多信号与长视频建模。

PixVerse R2 提出了一种面向实时 World Model 的统一训练范式:不再通过多个模型与任务阶段反复迁移能力,而是将复杂的多阶段 Pipeline 收敛为两个可持续 Scaling 的训练过程——持续预训练能够保持统一世界状态的 Omni Causal AR,再将其直接蒸馏为具备实时生成能力、同时继承空间一致性与长程建模能力的加速模型。更少的阶段边界减少了独立 Teacher、任务对齐和多轮模型迁移带来的能力折损,使新增数据、任务、控制信号与模型规模能够更直接地转化为实时世界建模能力。

第一阶段:持续预训练 Omni Causal AR。我们不再把双向生成先验与长视频 AR 视为两个彼此割裂的训练阶段,而是在双向模型能力基础上持续训练统一的 Omni Causal AR。动态 Chunk 为不同数据形态提供统一的时间表征:既能够吸收原有双向预训练中的高质量短视频与多模态数据,也能够扩展到连续长视频和多轮交互轨迹。由此,画面质量、音视频表达、长程生成和多信号控制可以在同一模型中共同 Scaling,而不是在多次模型转换中反复迁移。

第二阶段:从完成长程 Scaling 的 Omni Causal AR 直接蒸馏实时加速层。持续预训练使 Omni Causal AR 同时具备高质量生成、稳定的长程状态转移与真实因果 Rollout 能力。基于这一能力,R2 将同一个 Omni Causal AR 同时用于 Student ODE 初始化和蒸馏 Teacher,使 Teacher、Student 与真实 AR 推理共享一致的因果建模基础,将实时蒸馏从“重新学习长程世界”收敛为“对既有世界建模能力进行少步加速”。

由此,R2 的训练主线由多阶段能力迁移收敛为两个可持续扩展的过程:持续 Scaling Omni Causal AR,再将其直接加速为实时模型。更少的阶段边界减少了能力迁移和效果折损,使上游模型能够持续吸收更多数据、任务与交互信号,下游实时模型则更稳定地继承其生成质量、控制能力与长程一致性。

全模态因果自回归

R2 延续了 R1 已经验证的多模态输入、自回归生成与实时交互路线,并进一步将这些能力收敛到统一、可持续扩展的 Omni Causal AR 训练路径中。Omni Causal AR 将完整时空建模获得的生成先验,转化为沿时间单向推进的世界状态转移。通过因果化改造与持续预训练,模型在保留画面、运动、音频和多模态语义能力的同时,学习仅依赖历史状态预测下一段同步音视频。随着训练对象从独立短视频扩展到连续长视频与多轮交互轨迹,模型逐步建立“历史世界状态—当前交互输入—未来世界演化”之间的长期因果关系。

多模态交互输入与音视频输出。模型统一接收文本 prompt、多模态参考内容、Action(e.g., WASD or continuous control signals)操控信号和 audio,并输出 synchronized video and audio。不同控制信号可以在运行过程中持续进入模型并改变后续世界状态,使 R2 不只是响应一次性条件,而是能够边生成、边接收控制、边更新世界。

要让因果生成在长期运行中始终维持同一个世界,R2 系统处理四个关键问题:训练与推理的分布差异、历史噪声鲁棒性、长期与近期记忆协同,以及错误状态纠正。Hybrid Teacher / Diffusion Forcing 让模型同时适应干净历史与带噪历史;Multi-Timescale Memory 协同保存世界锚点、近期动态与对象状态;Error Bank 则将失败状态重新纳入训练。三者共同构成长期世界状态的训练闭环,降低画面、角色、运动、音画关系和控制响应随时间发生的漂移。

PixVerse R2 Omni Causal AR 的多模态控制与同步音视频输出

图 2|PixVerse R2 Omni Causal AR:模型可以在运行过程中持续接收不同类型的控制信号;在每一个交互时刻,当前生效的信号与对应粒度的动态音视频 Chunk 对齐,并驱动下一段视频与音频生成。

动态分块生成:以控制语义自适应世界更新粒度

连续世界中的不同控制信号具有截然不同的时间尺度:Prompt 与参考内容通常描述完整语义或较长事件,Action(WASD)需要细粒度、即时的状态反馈,Audio 则同时承载语义、节奏与时间同步信息。如果所有输入都被压入固定长度的时间单元,模型往往需要在响应速度与表达完整度之间被迫取舍。

Dynamic Chunk 是 R2 统一不同交互时间尺度的关键。R2 根据当前控制信号的语义边界与持续时间自适应地切分音视频序列,并通过最大 Chunk Size 约束计算规模与训练稳定性。短 Chunk 提升动作与局部指令的响应精度,长 Chunk 保留事件、运动和音视频语义的完整结构。由此,不同任务与控制信号可以共享同一套因果生成接口,在无需切换模型结构的情况下同时获得更敏捷的交互、更完整的表达和更高的数据利用效率,也为持续吸收更多任务与训练数据提供了可扩展的时间建模基础。

混合教师强制与扩散强制:同时学习干净历史与带噪历史

长程 AR 的关键矛盾在于:训练时的历史通常更加干净,而真实运行中的历史必然包含模型自身产生的噪声和局部误差。只依赖干净历史,模型虽然能够学习较高的单步质量上限,却容易在持续生成时对轻微偏差过度敏感;只依赖受扰动历史,又可能损害画质、运动与控制响应。

R2 采用 Hybrid Teacher Forcing / Diffusion Forcing,在统一训练过程中混合干净 History 与带噪 History。干净历史稳定世界演化的质量上限,带噪历史则让模型提前适应部署时会遇到的不完美状态。两类历史的互补训练显著缩小了训练与推理之间的分布差距,使模型既能生成高质量的下一段世界,也能在历史已经出现轻微偏差时继续稳定推演,从根源上减缓误差沿长程轨迹的累积与放大。

Causal Attention Mask 与 Relative Temporal RoPE。在 Hybrid Teacher / Diffusion Forcing 中,R2 同时约束“当前状态能够读取哪些历史”与“这些历史在当前窗口中处于什么时间位置”。Attention Mask 建立严格的因果可见性:Diffusion Forcing 仅访问由 Sink Memory 与 Rolling History 组成的历史窗口;Teacher Forcing 中,clean query 只读取 clean causal history,noisy query 则读取此前的 clean history 与自身 noisy state,任何未来状态及其他 noisy states 均不可见。

Temporal RoPE 不随全局 Block ID 无限增长,而是按当前注意力窗口内的相对 Slot 重新编号。设一个 Video Block 含 V 帧、该 Block 位于窗口 Slot s,则其第 r 帧采用时间位置 p=sV+r。当 Rolling Window 向前移动时,真实时间持续推进,但 Sink、近期历史与当前 Chunk 始终映射到稳定且有界的相对位置范围。这种 Mask 与 RoPE 的联合设计既保持因果边界,又降低绝对时间跨度带来的位置外推压力,从而提升跨 Chunk 连续性、长视频长度泛化与长期推理稳定性。

混合教师强制与扩散强制的因果注意力掩码和相对时间 RoPE

图 3|Hybrid Teacher / Diffusion Forcing 的统一 Causal Attention Mask 与 Relative Temporal RoPE。上方展示两种历史构造的因果可见性,下方通过编号行展开代表性 Query 的 Q/K Block、Relative Slot 与 RoPE ID 映射,说明真实 Block ID 持续推进,而窗口内时间坐标始终保持有界。

多时间尺度记忆:在固定预算内同时保持世界身份与近期动态

长期世界建模不能简单地“记住全部历史”。历史持续增长会迅速推高计算与显存成本,而过度裁剪又会丢失角色身份、场景设定和关键事件。R2 因此构建由 Sink Memory、Rolling History 与 Object KV Cache 组成的多尺度记忆体系,让不同时间尺度的信息进入最合适的记忆通道。

Sink Memory 保存角色、场景、风格与世界规则等长期锚点,确保生成过程始终处于同一个世界;Rolling History 聚焦最近的动作、姿态、镜头与环境变化,保证局部状态自然衔接;Object KV Cache 则复用和压缩已计算的对象级历史表征,在有限预算内保留真正影响后续演化的状态。三者协同,使 R2 同时获得长期身份稳定、短程运动连续与可控运行成本,显著降低角色漂移、场景突变、跨段闪烁和动作断裂。

误差库:把长期漂移转化为可学习、可纠正的训练信号

AR 世界模型中的严重漂移,往往源于早期一个很小的错误被写入 History,并在后续生成中持续继承。R2 建立 Error Bank,将具有代表性的错误历史状态沉淀为可复用样本,并在训练中按一定比例 Replay 到正常 History 中。模型因此不再只学习如何从理想状态继续生成,还会反复学习如何识别、吸收并修复已经出现偏差的历史。

这种 Error-aware Replay 将长期误差从部署阶段被动承受的问题,转化为预训练阶段可以主动优化的目标,对亮度与色彩漂移、静止场景中的错误运动以及角色状态偏离尤其有效。在阶段性评测中,长期亮度漂移指标由 0.201 降至 0.129,下降约 35.8%;29 个长序列样例中有 20 个获得改善,5 个明确无动作的样例全部降低了错误运动。Error Bank 由此形成了面向失败模式的持续改进闭环,为长时间稳定运行提供了直接而可验证的增益。

实时加速

R2 的实时加速,不是在少步模型中重新学习长程世界,而是对一个已经能够长期稳定运行的世界模型进行加速。实时加速层以完成持续预训练的 Omni Causal AR 为起点,并将其同时用于 Student ODE 初始化和蒸馏 Teacher,使 Teacher、Student 与真实 AR 推理共享一致的因果轨迹分布。实时蒸馏因此可以直接继承已经形成的生成质量、控制能力与长程状态转移,而不必在少步模型中重新建立这些能力。

这一统一的因果起点减弱对 Self-Forcing、Rolling Forcing 等调参依赖,使实时加速能够聚焦于少步加速真正引入的问题:DDMD with Adversarial Regularization 负责蒸馏阶段条件对齐、生成分布与真实感保持,Block-sparse Attention 压缩长上下文计算,Pyramid 则降低高分辨率生成成本。三者共同将 Omni Causal AR 的世界建模能力尽可能无损地加速到低延迟、可持续交互的实时运行区间。

加入对抗正则的去噪分布匹配蒸馏

在极少步生成中,条件对齐、分布匹配与真实感增强并不是同一个优化问题。前者要求模型准确响应 Prompt、Reference、Audio 与 Action;后两者分别通过扩散先验和真实数据监督,维持纹理、运动与世界分布的自然度。若依赖同一噪声空间或单一训练信号,这些目标容易相互牵制,导致控制变弱或画质下降。

R2 基于 DDMD,分别在 tCA 与 tDM 上构造条件对齐和分布匹配方向:

条件对齐与分布匹配方向公式

在此基础上,我们进一步引入 DMD2 中的对抗正则,通过真实样本与生成样本之间的判别监督增强世界真实感:

DDMD 加入对抗正则后的总损失函数

三类训练信号最终汇合到同一个学生模型中:条件对齐负责提升控制强度,分布匹配负责维持教师分布,对抗正则负责锚定真实数据,从而在极少采样步数下同时保证准确的交互响应与可信的世界真实感。

块稀疏注意力:高稀疏度下保持效果基本无损

R2 在时空 Token 序列上采用 Block-sparse Attention。模型先将 Q、K、V 划分为若干计算块,通过块级相关性快速估计每个 Query Block 最需要访问的 Key / Value Blocks;仅保留得分最高的一小部分关键连接,并在这些选中块上执行精确的 Softmax Attention,其余低贡献连接不参与计算。块级路由并非随机删减,而是将计算集中到当前多模态控制、近期运动与关键世界状态之间的强依赖上。

这种结构将稠密注意力转化为对少量关键块的规整计算,能够同时减少矩阵运算与显存访问开销。通过在训练中让模型适应稀疏连接结构,R2 将注意力稀疏度提升至 90%+,同时在当前评测中保持效果基本无损:画面质量、动作连续性、条件遵循和长时稳定性均未出现明显退化,从而为更低延迟、更高分辨率和更长时间的持续生成释放关键计算预算。

金字塔式超少步蒸馏:用分层生成重构高分辨率成本

在高分辨率空间中从头完成全部世界建模,会让大量计算反复消耗在已经可以由低分辨率确定的全局结构上。R2 提出 Pyramid Ultra-few-step Distillation,将生成过程组织为一至两个低分辨率阶段与一个高分辨率阶段:低分辨率阶段优先确定场景布局、主体运动和镜头结构,高分辨率阶段集中恢复纹理、边缘与局部细节。

这种由粗到细的生成路径,将“理解世界如何演化”与“恢复高频视觉细节”分配到更合适的计算尺度。模型先以较低成本建立稳定、连贯的全局世界,再用极少的高分辨率步骤完成精修,从而显著减少高分辨率空间中的重复计算。Pyramid 为 R2 进一步逼近高质量离线视频生成效果提供了清晰的效率路径:更少步骤、更低延迟,同时保留更强的结构稳定性与细节表现。

结论与局限

结论

PixVerse R1 提出并实现了首个实时视频世界模型,证明视频可以从离线生成的固定内容,转变为能够实时交互、持续运行的动态世界。PixVerse R2 进一步解决这一范式如何持续 Scaling:以统一的 Omni Causal AR 承载不断增长的数据、任务、模态与时间尺度,再通过 Real-Time Acceleration 将完整世界建模能力通过少步推理做到实时运行。R2 不是一次单点能力升级,而是一条面向下一代实时世界模型的统一训练路径。R1 让实时视频世界模型成为现实;R2 让它进入统一、可扩展、可持续提升的新阶段。

局限

在严格的实时计算与交互延迟预算下,PixVerse R2 当前的单次生成质量与前沿离线视频生成模型相比仍有提升空间,尤其体现在复杂场景细节、运动自然度、物理一致性以及长时间运行中的稳定性。实时生成仍需要进一步提升少步数推理的效果,使更高的生成上限能够稳定保留到实时模型中。

这些差距更多反映了 R2 当前所处的 Scaling 阶段,而不是框架本身的能力上限。R2 已经建立了一条可以持续扩展的训练路径:未来将继续扩大模型容量,增加高质量视频、音频、参考内容与交互轨迹数据,延长训练时间尺度,并覆盖更丰富的任务与控制信号;同时持续提升 Omni Causal AR 的能力上限和实时加速层的无损继承效率。我们的目标是在保持实时、可交互这一核心特性的同时,使视觉质量、运动表现、世界一致性和长程稳定性逐步接近前沿离线视频生成模型。

体验申请

PixVerse R2 目前在内测阶段,用户可以填写 PixVerse 世界模型 R2 体验申请表,申请提前体验和 API 接入资格。

引用

PixVerse R1