快科技6月16日消息,据媒体报道,阿里巴巴近日正式推出千问机器人实体大模型系列Qwen-Robot,包括操作模型Qwen-RobotManip、移动导航模型Qwen-RobotNav和世界模型Qwen-RobotWorld三大核心组件,这也是千问大模型家族首个面向机器人完整能力矩阵的成套方案。
三个模型分别为机器人赋予精细操作、自主移动和环境理解能力,既可以单独运行,也能够协同配合,为不同形态的机器人进入真实应用场景提供统一的底层支撑。
当前,机器人技术正从实验室研究迈向商业化落地的关键时期。在未知环境中准确理解自然语言指令并稳定执行任务,是必须突破的核心挑战。Qwen-Robot系列通过三大模型的联合设计,将语言理解、三维空间感知和物理规律认知融合起来,引导机器人在真实世界里自主完成复杂操作与精准移动,甚至能够泛化处理从未见过的任务。

VLA(视觉-语言-动作)模型是机器人实体操控的核心基础架构,它将视觉感知、语言理解和动作决策融为一体,使机器人能看懂指令并付诸行动。传统VLA模型的一大痛点是迁移能力不足,更换硬件平台或应用场景后性能往往显著下滑。Qwen-RobotManip从动作表征和空间感知两个层面切入解决这一难题。
一方面,该模型采用一套80维的统一动作表征,为不同硬件定义了通用的“肢体语言”,使机器人能习得基础物理规律和动作逻辑,不再停留于简单模仿。另一方面,它摒弃了繁琐的绝对坐标计算,直接依据摄像头画面中的相对位置进行操作,面对环境变化时反应更快更准。部署到不同硬件平台后,仅需少量交互反馈即可自动适配,性能稳定高效,恰如经验丰富的驾驶员换开陌生车辆,稍加熟悉便能平稳上路。
在训练层面,Qwen-RobotManip完成了超过38000小时的语料预训练,且全程仅基于开源数据,打破了行业对私有采集数据的高度依赖,依然取得了优异表现。在横跨30项真实任务、覆盖4个机器人平台的第三方真机测评RoboChallenge Table30 v1中,代号为“Lira”和“Atlas”的两个Qwen-RobotManip版本包揽前两名,任务涵盖拧水龙头、插网线、双臂倒薯条等,评测方评价称其“基础任务稳定,高难任务可突破”。
如果说VLA模型赋予机器人动手能力,VLN(视觉-语言-导航)模型则让机器人具备认路与移动能力。Qwen-RobotNav基于Qwen-VL构建,将语言指令导航、目标搜索、自动驾驶等五大类导航任务统一到同一框架内,面对复合指令无需人工切换模型。针对传统VLN模型记忆策略僵化导致的“记少则迷路、记多则混乱”现象,该模型创新采用了任务自适应观察机制,能够根据具体任务灵活调整记忆策略。
同时,模型被设计为通用接口,可被上层系统调用,是业内少数原生支持多种机器人控制框架的VLN模型。它帮助机器人实现边走、边看、边规划最优路径,并将导航能力从孤立模块升级为可供统一调用的工具,为完整的机器人实体系统补上了关键一环。以搭载该系统的宇树Go2四足机器人为例,当用户说出“帮我找找不知道放在哪里的行李箱”时,机器人可自主巡逻并结合视觉推理,顺畅完成寻物导航任务。
会动手、能跑腿,还需要“想得深”。正如体操运动员在脑海中反复预演动作,机器人同样需要具备对物理世界的推演能力,这正是世界模型所承载的作用。Qwen-RobotWorld是千问在这一方向的最新探索,它基于物理规律建模,可以推演并模拟机器人下一时刻的合理动作与状态,让机器人在现实世界中“按图索骥”地执行任务。
在实际应用中,Qwen-RobotWorld不仅能生成视频数据用于模型训练,有效缓解训练数据不足的问题,还能在动作执行前帮助机器人预演未来轨迹,使操作更加精准可靠。