实时编辑、实时互动视频双旗舰,Vidu S2发布即体验
编辑|牛来 AI 视频,正在变成一个可以边播、边演、边改的实时系统。 比如,打开摄像头,点一下参考角色图,就能一键更换画面里的人物,动作、节奏丝毫不受影响。 和虚拟人的互动也能随时加戏,实时聊着天,一句「跳个舞」便能开启才艺模式,动作还挺丝滑。 视频地址:https://mp.weixin.qq.com/s/pPbsRYvQDIKmds7wqDUSew 就像 P 图一样,摄像头捕捉到的真人视频流,也能边拍边「P 视频」,在保留原有动作和节奏的情况下,实时改变画风、人物或背景。 视频地址:https://mp.weixin.qq.com/s/pPbsRYvQDIKmds7wqDUSew 这就是生数科技最新推出的 Vidu S2 ,一套专 为实时交互与实时编辑设计的视频生成模型 ,覆盖实时数字人、离线数字人和实时视频编辑三类核心能力。 其中,S2-Avatar 负责实时数字人的「实时表演」互动,支持 720p 、25~42 FPS 输出,能够处理舞蹈等更大幅度动作,并允许用户在生成途中继续加入人物、服装、道具或场景参考图。 S2-Editing 则是本次最显眼的新能力。它持续接收摄像头或源视频流,让新规则即时作用于后续画面,在保留原有姿态、肢体运动、镜头轨迹和时间顺序的同时,实时改变风格、服装、人物主体或背景。 此外,S2-Avatar [Offline] 面向预设内容生产,可根据图片、文案或音频批量生成动作时间点可控的数字人口播视频。 这些能力并非只停留在演示视频里。产品发布前夕,生数团队还公开了技术论文,详细披露实时数字人、流式视频编辑和空间视频背后的技术路线,并在发布当天开放网页体验与 API。 产品仍在持续打磨,团队希望从 Day 1 就把它作为一个开放实验交给用户进行共创。 体验链接: https://vidu.cn/vidu-stream API 平台: http://platform.vidu.cn/vidu-stream/doc 技术报告: https://arxiv.org/pdf/2609.11638 从 S1 论文于 7 月 3 日提交,到 S2 论文于 9 月 10 日正式公开, 前后仅相隔约 69 天 ,生数团队的技术迭代节奏相当紧凑。Vidu S1、Vidu S2 的全链路研发均由朱军教授的博士生、生数科技流式视频生成与推理负责人张金涛负责。 如此短的周期里,升级并非只多了几个功能:控制对象从固定数字人扩展到动态参考图和完整视频流,输出从 540p 提升到 720p,动作从说话为主扩展到舞蹈等全身表演,并进一步把实时链路延伸到左右眼同步的空间视频。 如果说 S1 实现的是数字人在视频生成过程中与用户实时对话,S2 则将实时控制范围进一步扩大。当角色开始大幅运动、用户不断递进新素材、输入本身变成连续视频流时,系统还能否及时、稳定、精确地接住每一次变化? 这对系统提出了更高要求,需要 同时兼顾速度、稳定性与精准控制 。足够快,画面才能实时返回;足够稳,误差才不会在长时生成中滚成崩坏;足够准,新指令只改变该改变的部分,并在正确时刻作用于后续画面。 Vidu S2 的技术路线,正是围绕这组「速度 — 稳定 — 控制」三角展开。 实时视频的难题:不只是快,还要一直稳、随时能改 实时视频比离线生成更难。 普通视频扩散模型通常可以看到完整片段,经过多轮去噪后一次性交付结果。流式模型只能依赖已有画面,逐段生成后续内容,前一段里的面部变形、动作偏差或背景变化,都会成为下一段的历史条件。运行时间越长,误差越容易累积。 用户中途加入新指令后,模型还要记住人物当前正在做什么,判断哪些内容需要保留,以及新的动作或参考图应该如何影响后续画面。 Vidu S2 概览 从完整视频转向流式生成 要让数字人物在持续生成的视频中响应用户,模型既要学会连贯地表现人物、动作与声音,也要适应一段段向前生成的方式。Vidu S2-Avatar 从数据准备和训练方式两方面入手,逐步建立这种能力。 在数据准备上,团队除了继续扩充直播、访谈和影视素材,还加入了舞蹈、二维动画和三维动画视频,丰富人物的动作与表情。与之配套的视频标注按照事件发生的顺序展开,记录动作何时开始、带来了什么变化,以及结束后人物处于什么状态,为学习连续动作之间的衔接提供更清晰的监督。 Vidu S2-Avatar 与 Vidu S2-Editing 的数据准备流程 基于这些数据,Vidu S2-Avatar 首先训练双向音视频联合扩散模型,同时学习图生视频和参考生视频,建立人物、动作、声音与场景之间的关联。在这一阶段,每个时间片段都有对应的条件描述,使模型能够将指令与具体片段中的动作和状态变化联系起来。 在双向训练的基础上,团队进一步将双向时间注意力改为分块因果注意力,并进行流式适配
发表评论