​生数科技正式发布 Vidu S2,支持实时编辑、动态参考图与头显适配

9月15日,生数科技正式推出全新Vidu S2视频大模型系列,本次发布包含两款核心细分模型,同时延伸出VR头显适配能力探索,全链路研发由朱军教授博士生、生数科技流式视频生成与推理负责人张金涛牵头负责。不同于部分实时交互模型的限量预览策略,Vidu S2在发布当天就全量开放在线体验与API调用权限,同时公开了支撑相关能力的技术论文,明确以开放实验的形式推进产品迭代。

​生数科技正式发布 Vidu S2,支持实时编辑、动态参考图与头显适配

生数科技9月15日全量上线Vidu S2双模型

本次发布的Vidu S2系列包含两款核心定位清晰的模型:面向持续交互数字角色生成的Vidu S2-Avatar,以及面向输入视频流进行实时编辑的Vidu S2-Editing。在两大核心能力之外,生数科技还进一步探索了面向VR头显的实时空间视频生成与编辑能力。从迭代节奏来看,Vidu S1论文于7月3日提交,到S2论文9月10日正式公开,前后仅相隔69天,研发迭代速度十分紧凑。

双模型实现实时互动与视频流边播边改

两款核心模型分别覆盖不同的实时视频处理场景,核心能力均基于流式视频生成与推理技术落地:

  • Vidu S2-Avatar:实时输出分辨率从上一代的540p提升至720p,角色面部、服装细节更丰富,支持25-42FPS输出,可处理舞蹈等全身大幅度动作;用户在互动过程中可随时加入新的参考图,生成角色能够持续响应新的指令与视觉信息。此外还推出离线版本S2-Avatar [Offline],支持根据图片、文案或音频批量生成动作时间点可控的数字人口播视频。
  • Vidu S2-Editing:针对持续输入的视频流(包括摄像头捕捉画面、预设视频素材等)进行实时处理,可在保留原有姿态、肢体运动、镜头轨迹和时间顺序的前提下,实时修改画面风格、服装、人物主体或背景,实现视频边播边改的效果。基准测试显示,S2-Avatar在实时数字角色生成基准StreamAV-Bench的九项指标中均取得对比模型最优成绩,S2-Editing在多项视频编辑基准中总分超过同期离线与流式对比模型。

Vidu S2落地VR空间视频实时生成能力

Vidu S2进一步将能力边界延伸至XR领域,实现了VR头显适配的实时空间视频生成与编辑:模型可将实时生成或实时编辑的视频转换为左右眼双目视频,通过VR头显观看。例如S2-Avatar生成的数字角色可在持续对话互动的同时以空间视频形式呈现在头显中,现实世界持续输入的视频经S2-Editing实时修改后,也可转换为空间视频观看。针对已有双目视频,模型还支持将左右视图横向拼接后一次完成编辑,再重新拆分输出,为虚拟拍摄、混合现实场景提供新的实时控制方案。目前行业已有字节跳动开发Seedance实时空间视频模型、计划绑定PICO头显的相关布局,空间视频正成为视频模型与XR硬件竞逐的新方向,Vidu S2目前已跑通完整技术流程,下一步将优化端到端延迟、