全新统一流式架构,Vivix灵动时刻正式发布首个实时互动模型

实时交互模型登场:AI角色不再“只会动嘴”

7月24日,成立仅一年多的AI公司Vivix推出两款激活参数约30B的实时交互多模态模型——Vivix-A1与Vivix-W1。这是全球首个将多模态参考、原生交互与流式视频生成整合于单一基座模型的方案。与常见的“talking avatar”不同,Vivix-A1不再局限于生成一张会说话的脸,而是让AI角色拥有完整的身体:它能感知周围环境,自由走动、拿取物品,并完成全身表演。用户说出指令,角色的表情、视线、手势和全身运动会同步响应,仿佛一个真实的“生命”在实时互动。

全新统一流式架构,Vivix灵动时刻正式发布首个实时互动模型

小狐狸导览、房产销售与露营:三个场景展示全身表演能力

Vivix官网展示了A1在三个典型场景中的实际表现。在小狐狸导览场景中,AI角色用生动的肢体语言为用户介绍环境;房产销售场景中,角色能指向虚拟房源并完成物体交互;露营场景则展示了角色在开放空间中的移动能力。这些场景共同验证了A1的三大核心能力:全身表演、物体交互与空间移动。模型覆盖写实人物、3D角色和动漫形象,微表情、手势与全身运动被视作模型的关键能力。Vivix为A1设计了原生多模态生成循环,让模型持续处理声音、图片和交互信息,同时生成对应的声音与画面,实现真正的“边听、边说、边行动”。

从角色到世界:W1让整个场景随用户指令实时演变

如果说A1让一个AI角色活了起来,那么Vivix-W1则将这套能力扩展到了整个场景和故事。W1能实时改变人物、物体、场景、镜头、声音和事件,让用户可以通过文字、语音、触控甚至动作来塑造世界的走向。为了支撑这种实时交互,Vivix推出了两大技术底座:Vivix-Turbo通过“超低步数蒸馏”大幅减少每段音视频所需的推理步骤,同时利用镜头规划和时间连续性优化保持人物、场景和镜头的稳定;Vivix Infra则搭建了实时推理系统,让输入处理、音视频生成、解码和推流同时运行,模型在生成当前画面时就能继续接收用户的新指令。

速度与成本双突破:实时交互走出实验室

Vivix官方报告显示,A1和W1的可见反应延迟低于0.6秒,计入网络传输和直播推流后,端到端首次反应延迟(TTFR)低于1.7秒。更让人振奋的是成本:团队的实时视频推理成本在过去一年内降低了两个数量级,已接近主流视频平台每小时CDN带宽成本量级。这意味着实时交互多模态技术终于具备了大规模落地的可能性。Vivix同时推出API平台,让开发者可以快速集成这些能力。团队认为,互动是一件“很重”的事情,需要为用户带来体验增益——比如游戏级别的沉浸感与真实反馈。A1和W1正是这一探索的起点,推动AI视频从生成“一段固定的内容”走向生成“一场持续的互动体验”。