京东在 JDD 上甩出可交互视听世界模型:EchoWM 开源,长视频生成同步冲到 10 分钟以上
1月29日,京东在JDD大会现场正式发布并开源可交互视听世界模型EchoWM,该模型在长视频生成稳定性、实时交互能力、场景泛化性等核心指标上均达到行业领先水准,可为具身智能、自动驾驶、游戏开发等领域提供高保真的可交互数字演练场,目前已在多个主流开源社区同步上线,开发者可免费获取使用。

京东JDD大会发布可交互视听世界模型EchoWM并全量开源
本次发布的EchoWM是京东在视听生成与交互模拟领域的最新研究成果,核心瞄准当前世界模型存在的长序列生成不稳定、交互延迟高、泛化能力弱等痛点,在视频质量、动态程度、长时一致性、交互能力等关键维度均表现优异,旨在为AI Agent训练、数字内容生成等场景提供更可靠的底层支撑。
EchoWM攻克长视频生成漂移难题,稳定输出时长突破10分钟
针对视频生成领域普遍存在的“长时漂移”痛点——即生成时长增加后容易出现物体变形、细节塌陷、主体消失、场景结构崩坏等问题,EchoWM通过多阶段训练策略与并行化加速技术,实现了近10分钟的连续稳定无损生成,能够支撑长序列、多步骤的复杂任务训练需求。
在一致性压力测试中,模型表现尤为突出:镜头最长移开60秒后返回,目标物体依然存在且结构保持一致;高动态环境下,镜头长时间移开后返回,车辆形态外观、房屋整体结构均无异常,彻底解决了长视频生成过程中的内容漂移问题。
实时交互性能拉满,16FPS生成吞吐端到端延迟低于1秒
EchoWM的交互能力达到实用化水准:可实现约16FPS的生成吞吐,端到端交互延迟严格控制在1秒以内,用户可通过键盘、鼠标实时控制角色移动与相机视角,画面随操作指令即时反馈,交互过程流畅无卡顿。
除常规操作控制外,模型还支持文本触发环境变化与世界事件:用户输入文本指令即可调整天气、切换画面风格、生成特定事件,且所有变化均可在保持场景几何关系相对一致的前提下完成,满足多元化的内容生成与控制需求。
Zero-shot泛化能力加持,单张素材即可生成可交互场景
EchoWM具备优秀的Zero-shot泛化能力,仅需输入一张真实城市街景照片或游戏截图,即可零样本生成对应的可交互视频流,无需针对单一场景开展额外训练或数据采集,大幅降低了多场景下的部署与使用成本。
为解决世界模型训练中高质量交互数据匮乏的核心痛点,EchoWM采用了混合采集策略:
- 清洗大规模网络视频,覆盖多样化真实场景
- 结合虚幻引擎(UE)合成管线,从渲染层直接提取无UI干扰的纯净画面,同步记录操作指令与相机位姿,为模型学习“动作如何改变环境”提供精确对齐的训练信号
EchoWM为具身智能等场景提供低成本高保真试错空间
具身智能规模化落地长期面临复杂长程任务真机训练数据极度稀缺的挑战,EchoWM凭借长时序一致性、实时交互响应,以及对“动作-环境变化”因果关系的理解,能够在数字世界中模拟物理世界的运行规律,为智能体的场景理解和长程任务执行提供低成本、高保真的试错空间。
同时EchoWM支持光照调整、物品摆放位置变化等场景多样化生成,可有效提升具身智能算法在真实场景中的泛化能力,除具身智能领域外,还可广泛应用于自动驾驶仿真测试、游戏内容动态生成等多元场景。