京东重磅发布可交互视听世界模型,长视频生成同步升级

                    

本文由 电器杂志 发表,转载请注明来源!

9月9日,在京东全球科技探索者大会(JDD)上,京东探索研究院发布JoyAI-Echo系列两项最新进展:超长音视频生成模型升级至JoyAI-Echo 1.5,同时发布并开源可交互视听世界模型EchoWM。前者支持10分钟以上音视频持续生成,后者将原生视听生成与用户控制结合,让AI生成内容进一步从“可以看”走向“可以进入和探索”。

打通视听生成与世界交互,JoyAI-Echo系列突破长视频生成边界

随着AI视频画质不断提升,行业竞争正转向生成时长、推理效率与持续交互。JoyAI-Echo 1.5基于音视频Memory Bank架构,在多镜头、长时程生成中保持人物形象、声音和故事线索连贯,支持10分钟以上音视频持续生成。模型通过长视频后训练实现最高7.5倍推理加速,仅需2张H200,即可在480P下平均每秒生成24帧,实现1:1等时生成;Director Agent还可根据自然语言完成故事展开、分镜规划、生成审核与成片组装。

当前世界模型通常沿两条路线发展:一类能够根据用户操作持续生成画面,却缺少自然声音;另一类可以联合生成音视频,但用户难以持续进入并改变内容。EchoWM将两类能力结合,可原生联合生成720P视频、环境音、音乐和语音,使声音随场景、摄像机与主体运动同步变化;通过统一的“相机意图”,模型支持第一人称导航、第三人称摄像机与主体协同控制,以及多轮连续探索。在WBench Navigation评测中,EchoWM与四步因果流式版本EchoWM-Flash位列前两名。

在涵盖 158个多轮导航案例的WBench Navigation上,EchoWM取得综合排名第一的成绩

JoyAI基础模型矩阵集中升级,完善面向物理世界的技术体系

本次大会上,京东集中呈现JoyAI基础模型矩阵,能力覆盖图像与视频生成、多模态理解、实时交互、世界建模、智能语音和具身操作等方向,推动JoyAI从内容生成进一步拓展至对动态环境的感知、模拟与交互。

JDD现场,京东还展示了新一代音视频基础模型JoyAI-Video。该模型重点提升商业视频生成、物理规律呈现、第一人称视角和多镜头连续叙事能力,可应用于电商广告、短剧创作与具身智能演练等场景,并将于10月正式发布。

在模型之外,京东同步展示EgoLive真实数据、JoyAI-Sim仿真转换工具链及大模型基础设施,形成涵盖真实数据、仿真转换和模型开发的研发支撑体系,为面向物理世界的模型研发提供基础能力。

五大行业模型集中亮相,京东产业基因加速AI场景落地

在基础模型持续拓展能力边界的同时,京东还集中呈现零售、物流、医疗、工业和政务五大行业模型与智能体应用,依托长期积累的专业数据、供应链能力和真实业务流程,推动AI进入产业核心环节。

其中,零售多模态模型服务图搜、智能导购和素材质检;物流超脑3.0以Agentic智能体框架连接决策、流程和物理执行;京医千询3.0强化医疗影像分析、模拟问诊与可信推理;工业大模型深入专业选型、维保与CAD设计;政务大模型则服务政策咨询、智能办公和数据分析。

基础模型创新与产业AI实践双线推进,构成京东推动AI从数字世界迈向物理世界的整体布局,助力京东构建成为全球最大的物理世界运营中心。

 

(0)

本文由 电器杂志 发表,转载请注明来源!