2026-09-11 10:44
导语:导航评测81.7分登顶,多轮探索视听仍同步。EchoWM是什么 EchoWM 是京东探索研究院开源的交互式视听世界模型。
EchoWM 是京东探索研究院开源的交互式视听世界模型。模型延续JoyAI-Echo的原生音视频生成能力,让用户以第一/第三人称视角在AI生成的世界中实时移动探索,画面、空间关系与环境音、语音持续同步且长时间不跑偏。模型采用统一相机意图接口与世界数据引擎训练,WBench导航评测平均分81.7位列第一。


微信关注回复“开源”,加入AI开源项目交流群
git clone 下载 github.com/jd-opensource/JoyAI-Echo,进入 echo_wm/ 目录(与长视频项目 echo_longvideo/ 相互独立)。conda create -n echo-wm python=3.11 创建独立环境并激活。pip install -r requirements.txt,并用 torch.cuda.is_available() 验证显卡可用。hf download Echo-Team/Echo-WM 下载模型 checkpoint;另需下载 Gemma 3 文本编码器(gated 仓库,需先在 HF 页面接受许可并 hf auth login)。scripts/run_wm_case.py --case examples/wm_cases/0010 等内置完整案例,确认环境配置无误。inference_wm.py,传入首帧图片 + 六字段提示词+ 动作串(Action DSL)即可输出带声音的视频。<按键>-<帧数>,逗号连接,如 w-60,a-60 表示前进60帧后左移60帧,支持 w/s/a/d/i/j/k 组合。| 对比维度 | EchoWM(京东) | HappyOyster |
|---|---|---|
| 产品定位 | 可进入的全模态世界模型 | 音视频联合生成 + 实时交互模型 |
| 交互模式 | 第一人称 + 第三人称双视角 | 导演模式 + 第一人称漫游模式 |
| 控制方式 | 统一相机意图接口(6-DoF 轨迹,WASD 映射) | 视角与动作控制(具体接口公开信息有限) |
| 音视频生成 | 原生联合生成 720p 视频 + 环境音/音乐/语音 | 支持音视频联合生成 |
| 长时程能力 | 多轮延续 + 自回归后训练,长时程一致性突出 | 支持交互式生成,长时程细节公开较少 |
| WBench 平均分 | 81.7(第1) | 76.8 |
| 用户研究(整体偏好) | 63.13% | 27.06% |
来源:AI工具集
免责声明:含第三方意见,不构成财务建议
Hy4 preview 轻量版 – 腾讯混元开源的Hy4量化压缩模型
10 天前
Claude Fable 5.1 – Anthropic 推出的最新旗舰大模型
10 天前
开源版Retool来了,60+组件拖拽搭后台
24 天前
Claude Opus 5来了:半价逼近Fable 5
07-25
腾讯开源260个真实任务,考AI打工能力
07-25
美团开源AI考场:813个Minecraft任务
07-25
微软图像模型进PPT,GPU成本降84%
07-24






