Vidu S2是一款由生数科技于2026年9月推出的实时交互与视频流编辑模型,主要用于实时数字人驱动的视频对话与视频流的实时风格化编辑,支持对话中动态更新参考图并连贯生成动作,适用于直播带货、虚拟主播、影视预演与短视频创作等场景。它在上一代入门级实时视频能力的基础上,把输出质量、可介入性与可编辑性一次性拉到可生产水位。
| 基础信息 | 内容 |
|---|---|
| 产品定位 | 实时交互与视频流编辑双模型 |
| 出品方 | 生数科技(蚂蚁集团支持) |
| 发布时间 | 2026年9月16日 |
| 核心技术 | SRF 自纠错训练、实时参考图动态介入 |
| 实时规格 | 720P 输出、25–42 FPS 流式不中断 |
| 基准表现 | StreamAV-Bench 九项居首 |
| 获取方式 | 官网实时体验与 API 平台,按量计费 |

Vidu S2 的核心能力
S2-Avatar 实时数字人驱动
S2-Avatar 将实时输出分辨率提升到 720P、帧率稳定在 25–42 FPS,可在视频通话或直播中驱动数字人完成自然的口型、表情与肢体动作,并对口型同步与情感一致性做了专门强化。它的关键突破是「对话中动态更新参考图」:用户可以在生成过程中随时上传新的形象或服装参考图,模型会即时接住新参考并记住当前状态,连贯完成摘帽、戴帽、换装等动作,而不会出现身份跳变或生成中断,这让直播中的即兴换装、换造型成为可能。在多人同框与复杂光照下它也能保持主体稳定,降低了真实直播环境的部署门槛。在 StreamAV-Bench 基准的九项指标上,S2-Avatar 均居首位。
S2-Editing 视频流实时编辑
S2-Editing 面向已经存在的视频流做实时修改,支持风格迁移、虚拟试穿、人物替换与背景替换四类编辑。风格迁移可把实拍画面套上指定美术风格;虚拟试穿用于电商直播中即时更换模特着装;人物替换与背景替换则分别处理主体与场景的改写。区别于传统的离线后期,它在输入视频流持续送入时就能逐帧完成编辑并输出,适合电商直播换装、影视预演改场景等需要即时反馈的环节。该能力在 OpenVE 与 RefVIE 联合评测中取得 4.26 综合分,处于同台模型前列。
长时稳定与自纠错机制
长时流式生成最常见的 failure 是身份漂移与画面崩溃。Vidu S2 通过 SRF 自纠错训练强化对长序列的自我校验,在分钟级连续生成中保持人物身份、服装与场景的一致性,这也是实时视频产品能否用于真实直播的硬门槛。这类实时一致性能力是 AI 智能体(AI Agent) 在视频场景落地的核心难点之一,也是 Vidu S2 区别于单纯文生视频模型的主要能力边界——它要的是「边看边改边生成」,而不是一次性出片。
Vidu S2 与同类视频模型的对比
在实时数字人与视频流编辑这一细分方向,HeyGen 与 Vidu S2 定位最接近,二者均主打实时驱动数字人;必火AI 则是国产数字人工具的代表。下表按产品形态、实时规格、动态介入、动作能力、长时稳定、编辑能力与适用场景七个维度对比。是否选用主要取决于业务是否依赖实时可编辑,还是更看重短视频成片效率与国产化。
| 对比维度 | Vidu S2 | HeyGen | 必火AI |
|---|---|---|---|
| 产品形态 | 实时视频双模型:互动 Avatar + 视频流编辑 | 实时数字人 / Avatar 视频平台 | 国产 AI 数字人工具:形象生成 + 语音合成 + 数字人直播 |
| 实时规格 | 720P、25–42 FPS 流式输出,不中断 | 实时对话数字人为主,偏「说话头」 | 支持交互式数字人与数字人直播,以生成流程产出 |
| 动态介入 | 生成中随时插入参考图、换装,模型接住并记住状态 | 角色形象设定后全程固定,无法中途介入 | 形象与声音等参数在处理前设定 |
| 动作能力 | 支持独舞、2D/3D 动画等全身高难度动作跟随 | 以口播、讲解类上半身动作为主 | 以形象生成与声音克隆为主 |
| 长时稳定 | SRF 自纠错训练,抗崩溃抗漂移 | 长时流式生成的身份漂移是行业通病 | 未公开长时流式稳定性数据 |
| 编辑能力 | 实时改风格 / 换装 / 换人 / 换背景 | 不具备视频流实时编辑 | 提供视频剪辑与合成、AI 绘画,非视频流实时编辑 |
| 适用场景 | 直播带货、虚拟主播、影视预演、短视频 | 口播视频、企业讲解、多语言本地化 | 短视频创作、数字人直播、在线教学、品牌推广 |
若想先了解上一代的实时交互视频能力基线,可以参考 Vidu S1(生数科技此前推出的实时交互视频生成与数字人模型,Vidu S2 在前代基础上补齐了实时编辑与更高分辨率、帧率,适合需要完整能力而非入门版的用户对照)。
Vidu S2 的应用场景与适用人群
Vidu S2 的实时性与可介入性,让它更偏向「边生成边调整」的生产场景,而非一次性批量出片。对需要真人出镜但受限于成本或排期的团队,它提供了一个可即时改动的数字人替代方案。
- 直播带货与虚拟主播:实时驱动数字人讲解商品,对话中换装、换背景,适配电商与品牌自播
- 影视与广告预演:在分镜阶段实时改风格、替换人物与场景,快速确认视觉效果再进入实拍
- 短视频与社媒创作:对个人创作者提供低门槛的实时数字人出镜与视频流风格化编辑
- 在线教育与企业培训:用数字人讲师稳定出镜,按课程需要实时切换形象与背景
适用人群:电商运营与品牌直播团队、影视与广告预演制作人员、短视频与社媒内容创作者,以及需要低成本实时数字人出镜的在线教育与企业培训团队。
Vidu S2 的使用方法
Vidu S2 已全量开放体验与 API,普通用户与开发者都能在几分钟内跑通第一条实时视频。
- 访问实时体验页:通过 Vidu S2 官网的实时体验页(Vidu S2 官网),用浏览器即可驱动数字人并实时换装、换背景,先验证效果再决定接入
- 申请 API 密钥:在 platform.vidu.com 注册并创建应用,获取调用 S2-Avatar 与 S2-Editing 的密钥与并发配额
- 接入实时流程:把摄像头或视频流送入 S2-Avatar 驱动数字人,或把待编辑视频流送入 S2-Editing 配置四类编辑
- 配置编辑参数:在 S2-Editing 中按需设定风格迁移目标、试穿服饰、替换人物与背景,实时预览后输出
Vidu S2 的价格与开源情况
Vidu S2 的官网实时体验入口对普通用户免费可用,API 平台采用按量计费,具体单价以官方计费页为准,适合先验证效果再按生成规模付费。企业批量接入可联系官方商务获取阶梯报价。
Vidu S2 当前以云端服务与 API 形式提供,模型权重未开源;生数科技同步公开了技术报告(arXiv: 2609.11638)披露训练与评测方法,研发与学术侧可据此复现基准,但生产环境仍需通过官方平台调用,无法本地私有化部署权重。
Vidu S2 的常见问题
Vidu S2 是什么?
Vidu S2 是生数科技于 2026 年 9 月 16 日推出的实时交互与视频流编辑模型,包含 S2-Avatar 与 S2-Editing 两款模型,分别负责实时数字人驱动与视频流实时编辑。
Vidu S2 与 Vidu S1 有什么区别?
Vidu S1 是上一代实时交互视频生成与数字人模型;Vidu S2 在分辨率(720P)、帧率(25–42 FPS)、动态介入(对话中换装换参考图)与实时视频流编辑四类能力上做了补齐,更适合边生成边调整的生产场景。
Vidu S2 如何体验?
可通过 Vidu S2 官网的实时体验页直接驱动数字人,或通过 platform.vidu.com 申请 API 密钥接入自有流水线,两者均已全量开放。
Vidu S2 支持哪些应用场景?
主要面向直播带货与虚拟主播、影视与广告预演、短视频与社媒创作、在线教育与培训等需要实时数字人出镜与视频流风格化编辑的场景。
浙公网安备33010202004812号