在近期举办的JDD技术大会上,京东展示了一系列面向物理世界的人工智能技术突破,其中一款专为视障群体设计的AI眼镜成为焦点。这款设备通过集成JoyAI-VL-Interaction交互模型,实现了对动态环境的实时感知与精准提示,标志着AI技术从被动响应向主动场景理解的范式转变。
传统辅助设备多采用模块化架构,依赖传感器识别、规则引擎判断和语言模型生成的多环节协作,导致响应延迟高达数秒。京东研发的80亿参数模型突破性地将视觉感知、环境推理与交互决策整合为统一架构,使设备能在亚秒级时间内判断是否需要提醒用户。面对复杂场景如倒车车辆、前方台阶与行人打招呼同时发生时,系统可自主决定信息传递的优先级与时机。
该模型在58项真人盲测中表现优异,对比豆包视频通话助手胜率达77.6%,较Gemini提升87.9%。这种技术优势源于其独特的持续在场能力——不同于传统问答式AI,系统能根据环境变化动态调整交互策略,遇到超出处理能力的问题时,会异步调用后台智能体继续处理,确保用户不被搁置。
京东同步推出的JoyAI-EchoWM世界模型,构建了物理交互的新维度。该模型可实时生成包含环境音效、语音对话的动态场景,用户通过控制信号能影响虚拟世界的发展轨迹。在WBench导航评测中,其交互得分达87.2分,生成的虚拟场景不仅视觉保真度高,更实现了物理规则的精准模拟,为机器人训练提供了低成本验证环境。
支撑这些突破的是京东构建的完整技术链条。EgoLive数据集收录2000小时第一视角视频,覆盖仓储、药房等346个真实场景任务;JoyAI-Sim仿真工具链通过合成数据将机器人训练效率提升3.2倍;JoyAI-RA 0.5框架则实现了跨异构数据的操作学习,使机械臂在真实环境中的操作稳定性显著提高。这些技术共同构成了从数据采集到场景落地的闭环系统。
在行业应用层面,京东展示了五大领域的技术转化成果。京医千询3.0医学影像分析准确率超越GPT-5.5近15个百分点;JoyIndustrial 2.0工业模型经受超10亿次调用验证;VisCAD 1.0系统实现从文本描述到CAD图纸生成的全链路打通。这些案例表明,AI技术正在从处理提示词转向直接解析订单、病历等现实生产要素。
京东探索研究院将技术演进划分为三个阶段:数字智能阶段聚焦内容理解,附身智能阶段实现设备自然交互,具身智能阶段推动机器人执行复杂任务。这种路径规划基于京东独特的优势——20余年积累的仓储物流场景、海量终端设备数据和完整业务闭环,为模型训练提供了其他企业难以复制的验证环境。
技术团队透露,未来三年将重点突破全模态实时交互模型的世界级水准,完成具身数据集的规模化采集,并推动基础模型矩阵在千行百业的深度应用。从鼻梁上的智能眼镜到覆盖全球的物理世界运营网络,京东的技术布局正在重新定义人工智能与现实世界的交互方式。这种转变不仅需要算法创新,更依赖对真实业务场景的深度理解与持续投入。











