PixVerse R2 – 爱诗科技推出的实时全模态世界模型

AI模型14小时前更新 智小研
17 0

PixVerse R2是一款由爱诗科技于2026年8月推出的实时全模态世界模型,主要用于在持续运行的世界中实现边生成、边交互、边演化的同步音视频输出,支持文本、参考图、音频和动作等多模态输入,适用于游戏世界生成、交互叙事和虚拟环境等实时交互场景。

基础信息内容
开发公司/团队爱诗科技(AIsphere)
发布时间2026年8月25日
产品定位实时全模态世界模型
技术架构Omni Causal AR + Real-Time Acceleration
输入模态文本、参考图、音频、动作
输出模态同步音视频
注意力稀疏度90%以上(Block-sparse Attention)
亮度漂移改善约35.8%(Error Bank,从0.201降至0.129)
当前阶段内测阶段(可申请体验与API接入)
PixVerse R2 – 爱诗科技推出的实时全模态世界模型

PixVerse R2的核心能力

PixVerse R2在PixVerse R1的基础上进一步探索实时世界模型的持续Scaling路径。R2聚焦两个目标:构建能够长期保持统一状态的动态世界,以及将文本、参考图、音频与动作中的物理因果和交互信号持续内化进同一模型,使世界能够边生成、边接收控制、边更新状态并连续输出同步音视频。围绕这两个目标,R2将整体框架收敛为Omni Causal AR与Real-Time Acceleration两个核心层次。

开发时间线

2026年8月25日:爱诗科技发布PixVerse R2技术报告,提出Omni Causal AR统一训练架构与Real-Time Acceleration实时加速层,标志着实时世界模型从可行性验证进入可扩展的新阶段。

Omni Causal AR统一架构

传统实时生成框架依赖多阶段串联训练(双向转AR、构造蒸馏Teacher、DMD蒸馏、self-rollout训练),每个阶段都需重新完成能力迁移与目标对齐,上游模型的画面质量和长程稳定性可能在迁移中折损。R2将多阶段Pipeline收敛为两个可持续Scaling的训练过程:第一阶段持续预训练Omni Causal AR,通过Dynamic Chunk为不同数据形态提供统一时间表征,使画面质量、音视频表达、长程生成和多信号控制在同一模型中共同Scaling;第二阶段从完成长程Scaling的Omni Causal AR直接蒸馏实时加速层,使Teacher、Student与真实AR推理共享一致的因果建模基础,将实时蒸馏收敛为对既有世界建模能力的少步加速。

长期状态维持技术

R2通过四项关键技术维持长期运行稳定性。Hybrid Teacher Forcing与Diffusion Forcing让模型同时学习干净历史与带噪历史,缩小训练与推理分布差异。Multi-Timescale Memory由Sink Memory、Rolling History和Object KV Cache组成,分别保存长期世界锚点、近期动态和对象级历史表征。Error Bank将代表性错误状态沉淀为可复用样本并按比例Replay到训练中,使长期亮度漂移指标从0.201降至0.129,下降约35.8%,29个长序列样例中20个获得改善。Block-sparse Attention通过块级路由将计算集中到当前多模态控制与关键世界状态的强依赖上,将稀疏度提升至90%以上,同时保持画面质量和动作连续性基本无损。

PixVerse R2与PixVerse R1的对比

对比维度PixVerse R1PixVerse R2
技术架构多阶段PipelineOmni Causal AR + Real-Time Acceleration
训练范式多阶段串联迁移两阶段统一收敛
输入模态多模态输入文本+参考图+音频+动作
长期记忆未明确Sink Memory + Rolling History + Object KV Cache
误差纠正未明确Error Bank(亮度漂移降35.8%)
注意力稀疏化未明确Block-sparse Attention(90%+)
实时交互支持支持(边生成边交互边演化)

注:以上数据来源于爱诗科技发布的PixVerse R2官方技术报告,R1部分信息为报告中对R1的回顾性描述。

从官方数据可以看出,R2相比R1实现了从多阶段Pipeline到统一训练范式的根本升级。Error Bank和Multi-Timescale Memory直接解决长程漂移问题,Block-sparse Attention的90%以上稀疏度为更低延迟释放了关键计算预算。在同类产品中,Matrix-Game 3.5也定位为实时交互世界模型,但R2的特色在于通过Omni Causal AR将多模态输入与长程世界状态建模整合在同一训练路径中。

PixVerse R2的应用场景与适用人群

PixVerse R2的实时全模态世界模型能力适用于以下场景:

  • 游戏世界生成:实时生成可交互的游戏场景与角色动作
  • 交互叙事:用户通过文本、参考图和音频持续影响故事走向
  • 虚拟环境模拟:构建可长期运行的虚拟世界用于训练与测试
  • 多模态内容创作:结合音频、参考图和文本生成同步音视频内容

适用人群:游戏开发者、AI交互内容创作者、虚拟世界构建团队以及世界模型研究人员。在需要PixVerse Game这类实时互动世界生成能力的场景中,R2提供了新的技术路径。

如何使用PixVerse R2

PixVerse R2目前处于内测阶段,用户需扫码填写体验申请表获取体验和 API 接入资格

PixVerse R2的价格与开源情况

PixVerse R2目前处于内测阶段,尚未公布公开定价或开源计划,用户可通过申请内测获取免费体验与API接入资格。爱诗科技表示,R2已建立可持续扩展的训练路径,未来将继续扩大模型容量、增加训练数据并延长训练时间尺度。对于需要离线高质量视频生成的用户,站内已有PixVerse V6等多款PixVerse系列产品可供选择。

PixVerse R2常见问题

PixVerse R2和PixVerse R1有什么区别?

R2在R1基础上进一步探索持续Scaling路径。R1提出并实现首个实时视频世界模型,证明视频可从固定内容转变为持续运行的动态世界;R2通过Omni Causal AR统一架构和Real-Time Acceleration实时加速层,解决长程状态维持、多模态信号内化和计算效率问题,使实时世界模型进入可扩展的新阶段。

PixVerse R2是否开源?

截至技术报告发布时,PixVerse R2尚未开源,也未公布开源计划。模型目前处于内测阶段,可通过申请体验获取使用资格。

如何申请PixVerse R2的内测体验?

需在微信中关注「爱诗科技」公众号,在R2相关推文中扫描体验申请二维码并填写申请表,审核通过后获得体验资格和API接入权限。

PixVerse R2支持哪些输入模态?

R2支持四种输入模态:文本(Text)、参考图(Reference)、音频(Audio)和动作(Action),输出为同步音视频。不同控制信号可在运行中持续进入模型并改变后续世界状态。

PixVerse R2的实时交互如何实现?

R2通过Omni Causal AR将时空建模的生成先验转化为沿时间单向推进的世界状态转移,再通过Real-Time Acceleration层加速到低延迟实时运行区间,Block-sparse Attention的90%以上稀疏度进一步压缩了计算开销。

© 版权声明
AI工具站赚钱操作手册横幅,分享AI工具站SEO、GEO流量增长、CPS、CPA及数字产品变现经验

相关文章