站长之家 - 业界 2026-06-22 17:37

全球首个!京东全栈开源JoyAI-VL-Interaction:让大模型边看边说

本报讯 6月22日,京东正式向开发者社区开放了Joy视觉语言交互模型(Joy VL-Interaction)及其完整部署方案,这也是业界首套从模型权重到工程框架全栈开源的实时视频视觉交互系统。

该模型原生适配vLLM-Omni,彻底改变了传统多模态系统“一问一答”的被动交互方式,使设备能够在持续观察实时画面的同时,自主判断、主动响应,实现流畅的流式交互

与此前主流的图文、视频类大模型不同,新系统带来了三项关键突破:

主动自主判断:系统持续接入摄像头、监控、直播等实时视频流,能够自行识别关键事件并主动发出提醒,无事件时自动保持静默,无需人工触发指令。例如,监测到火情、老人跌倒等紧急情况时可即时预警。

低延迟实时响应:以流式方式对正在发生的画面进行处理,无需等待完整视频上传后再做分析,充分满足安防、实时翻译、直播讲解等高时效性场景的需求。

前台观测与后台分工协作:面对复杂推理、代码生成或工具调用等繁重任务时,可委托后台代理处理,前台模型则不间断地持续观测现场画面,任务完成后无缝接续交互过程。

与多数仅开放模型权重的项目不同,此次开源内容包含模型权重、专属交互数据集、完整训练方案以及可部署的全套工程框架,并支持灵活替换语音模块、可视化界面、第三方代理与业务接口。

该系统兼容摄像头、监控流、直播流等多路视频输入,内置长期记忆、语音收发和vLLM快速部署能力,能够快速搭建各类实景智能应用:居家老人与儿童看护、安防自动预警、直播实时解说、电商导购、智能眼镜无障碍辅助、工业操作指导等。

全球首个!京东全栈开源JoyAI-VL-Interaction:让大模型边看边说

在覆盖监控预警、实时计数、实时翻译、直播解说等58组真人盲测案例中,对比豆包视频交互助手,新模型整体胜率为77.6%;对比Gemini视频交互助手,整体胜率达到87.9%;在安防预警场景中,对两款竞品均取得100%的胜率。

这一表现源于交互模型将主动交互能力内化于模型自身,而非依赖外部触发,从根本上区别于传统的一问一答回合制模式。

推荐关键词

24小时热搜

查看更多内容

大家正在看