实时互动、实时改视频、探索空间视频,Vidu S2一次放了三个大招
9月16日,生数科技正式对外发布全新一代流式视频生成模型Vidu S2,区别于部分同类产品仅开放申请体验或研究预览的节奏,Vidu S2在发布当日即实现全量上线,用户可直接访问官方平台体验相关功能。本次发布的Vidu S2由两款细分模型组成,分别针对实时数字角色交互、视频流实时编辑两大核心场景打造,同时首次将能力延伸至空间视频领域,实现了视频模型从单次生成到持续视频流实时处理的跨越。该模型全链路研发由朱军教授博士生、生数科技流式视频生成与推理负责人张金涛负责。

生数科技全量上线Vidu S2,双模型落地核心场景需求
与部分实时交互模型采用申请体验或研究预览的方式不同,Vidu S2此次选择在发布后直接全量开放,大幅降低了普通用户的体验门槛。两款核心模型分别瞄准不同使用需求:S2-Avatar面向持续交互的数字角色生成场景,S2-Editing则针对输入视频流的实时编辑需求,覆盖从内容生成到后期修改的全链路视频处理场景。
S2-Avatar升级720P实时互动,动态参考注入提升交互上限
相比上一代产品,S2-Avatar将实时输出分辨率从540p提升至720p,生成角色的面部特征、服装细节表现力大幅提升。在交互过程中,用户可随时加入新的参考图,让生成角色能够持续响应新的指令和视觉信息,实现更自然、更灵活的实时互动体验。
S2-Editing实现视频流实时编辑,四大功能覆盖边播边改需求
S2-Editing针对持续输入的实时视频流,支持边播放边修改的核心能力,可覆盖四大编辑场景:
- 整体风格重绘:可将真实拍摄的视频实时转换为动漫等指定视觉风格
- 服装替换:实时修改画面中人物的穿戴内容
- 人物替换:将原视频中的人物更换为其他指定角色
- 背景替换:实时调整人物身后的场景内容
所有编辑操作均支持通过文本指令引导,也可搭配参考图明确目标效果,其核心采用帧对齐注意力机制,确保每一帧的编辑效果都与源视频内容高度匹配。实验数据显示,Vidu S2的相关表现超过所有基线模型,目前可交互的在线Demo已同步对外开放。
延伸至空间视频场景,实时生成内容适配VR头显观看
除实时生成与编辑能力外,Vidu S2还将探索方向延伸至空间视频领域:模型可将实时生成或实时编辑的视频转换为左右眼格式的空间视频,用户佩戴VR头显即可获得立体观看体验。例如,由S2-Avatar实时生成的数字角色,可在持续对话互动的同时以空间视频形式呈现在头显中;基于S2-Editing,现实世界持续输入的视频流也可被实时修改后,转换为空间视频供用户观看,进一步拓展了实时视频内容的消费边界。