站长之家用户 - 传媒 2026-08-04 11:49

超越英伟达、MIT!卓世科技登顶 MolmoSpaces 全球榜首,斩获具身智能全新SOTA

重磅突破!卓世科技自研 ZoeInside-VLA 在 MolmoSpaces 全任务榜单拿下全球第一,斩获全新 SOTA 成绩,性能领先英伟达、MIT 等团队主流模型。我们跳出单纯比拼大参数量的内卷赛道,用轻量化4B 模型聚焦VLA走向真实场景时的两个关键问题:一是训练数据过于理想,模型缺少状态偏离后的恢复经验;二是动作执行缺少及时反馈,原有计划难以适应环境变化。为此,我们引入包含偏差与恢复过程的操作数据,并新增实时执行反馈模块,让模型既能学会应对真实环境。这套核心模型更是卓世「启元」具身通用大脑的直觉系统核心,搭配逻辑规划、人机共情三核架构,真正把实验室 SOTA 算法转化为工业、康养等场景可落地的具身通用大脑解决方案。

卓世科技登顶 MolmoSpaces 全球榜首

让机器人在固定桌面上抓起一个熟悉的物体,已经不再是一项足以说明模型能力的测试。

真正困难的是:当房间布局、目标物体、相机视角和视觉风格同时发生变化,机器人还能否理解指令,并稳定完成操作?这正是MolmoSpaces希望回答的问题。

MolmoSpaces Benchmark 是由美国艾伦人工智能研究所(Allen Institute for AI, AI2)推出的大规模具身智能评测基准,旨在系统评估机器人策略模型(Robot Policy)在复杂环境中的泛化能力。该 Benchmark 基于 MolmoSpaces 开放仿真生态构建,覆盖抓取(Pick)、抓取放置(Pick & Place)、开关操作(Open/Close)等多类机器人操作任务,通过随机化场景布局、物体属性、相机视角和语言指令等因素,测试模型从视觉理解、任务推理到动作执行的完整闭环能力。相比传统机器人评测,MolmoSpaces 具备大规模、多样化、可复现的特点,支持在数十万级室内场景和丰富物体资产中进行策略评估,被用于衡量当前VLA/WAM等模型的泛化水平。目前已有 NVIDIA、Physical Intelligence、AI2、MIT & UPenn、X Square Robot、TeleAI、PsiBot、 NYU & Berkeley等多家机构和团队参与评测,包括 Cosmos3-Nano-Policy、WALL-OSS、π0.5、TiPToP等代表性机器人策略模型。

近期,我们发布了ZoeInside-VLA,在9项任务上平均分数取得SOTA水平,超过了Cosmos3-Nano-Policy、WALL-OSS-0.5等行业优秀模型。

ZoeInside-VLA选择了一条相对克制的技术路线:完整模型参数量4B,采用主流的Mixture-of-Transformers(MoT)架构,由视觉语言模型负责理解场景与任务指令,Flow Matching动作专家负责生成连续动作。

在早期实验中,我们逐渐观察到,模型在陌生场景中的失败并不总是源于参数不足。很多时候,问题发生在两个更具体的环节:训练数据只展示了理想状态下的一次成功,使模型缺少应对偏差的经验;而Action Chunk开始执行后,模型又难以及时利用真实执行结果修正原有动作。

因此,我们将优化重点放在两个更容易被忽视、却直接影响陌生场景表现的环节:

1.如何从现有数据中,提取更有效、更接近真实世界的操作经验;

2.如何让模型在动作执行后读取环境反馈,并根据最新状态持续更新后续动作。

benchmark部分推理结果展示:

一、数据变多,不等于模型学到的经验变多

近年来,VLA研究正在快速走向数据规模化。Xiaomi-Robotics-1使用超过10万小时真实操作轨迹研究机器人数据Scaling;Qwen-RobotManip则进一步指出,不同本体、传感器和动作空间的数据只有先完成对齐,规模增长才会稳定转化为泛化能力。

但在实际训练中,数据规模只是问题的一部分。ZoeInside-VLA使用的数据全部来自开源数据和自主采集数据,其中包括真机自采轨迹和仿真数据,也使用了部分EGO第一视角操作数据,补充自然环境中的物体、视角和交互多样性。

这些数据看起来都在描述机器人操作,但它们并不会天然形成互补关系。

同一个“抓起物体”任务,在不同数据中可能具有完全不同的表达:

●相机安装位置不同,机器人看到的目标外观和空间关系不同;

●控制频率不同,同一段动作被切分成不同数量的控制步骤;

●坐标系和动作尺度不同,相似动作可能对应完全不同的数值;

●图像、状态和动作之间存在不同程度的延迟;

●部分轨迹包含停顿、抖动、误操作和不完整的任务过程。

如果未经处理直接混合,增加的数据可能不是更多经验,而是更多相互冲突的监督。

从“数据清洗”到“有效经验构建”

因此,我们没有简单按照数据条数组织训练集,而是把数据处理的目标定义为:

让不同来源的数据,以尽可能一致的方式告诉模型:当前看到了什么、应该完成什么、采取了什么动作,以及动作产生了什么结果。

围绕这一目标,ZoeInside-VLA的数据处理主要包含四个环节。

1. 对齐视觉、状态与动作

我们校准图像、机器人状态和控制动作之间的时间关系,识别错帧、控制延迟、长时间停顿和异常动作突变。

这一环节解决的是一个基础问题:

模型看到的场景,是否真的对应它正在学习的动作?

如果视觉已经进入下一状态,动作标签仍然来自上一时刻,即使数据量很大,也会持续向模型提供错误监督。

2. 统一不同数据的动作表达

不同数据源中的坐标系、控制频率、动作范围和夹爪定义并不统一。

我们对这些动作进行标准化处理,使来自不同数据集的相似操作,在动作空间中也具有更一致的结构,降低模型在学习不同数据源时产生的冲突。

3. 保留“非完美但最终成功”的操作经验

传统机器人数据往往更偏好“一次成功”的标准示范:机器人准确接近目标、一次完成抓取、平稳移动物体,并顺利完成放置。这样的轨迹动作清晰、监督稳定,是模型学习基础操作能力的重要来源。

但真实世界很少始终如此顺利。

机器人可能第一次没有抓稳,可能在搬运过程中发生滑动,也可能在放置时意外掉落物体。此时,真正决定任务能否完成的,不只是模型在理想状态下能否做出正确动作,还包括:

当当前状态已经偏离理想轨迹时,模型是否知道接下来应该做什么。

我们在失败案例中观察到,一些模型并不是完全不会完成任务,而是缺少面对异常状态的经验:

第一次抓取失败后,仍然重复原来的抓取动作;

●物体位置已经发生变化,却继续执行基于旧位置生成的动作;

●物体在搬运过程中掉落后,机械臂仍然完成后续“放置”动作;

●一次错误逐步累积,最终进入训练数据从未覆盖的状态。

其根本原因之一,是训练数据中绝大多数轨迹只展示了:

从正确状态出发,如何一次完成任务。

却很少展示:

当操作不完全顺利时,如何重新观察、调整动作并最终完成任务。

因此,在保证数据语义正确和任务最终完成的前提下,我们有意识地保留并补充了一部分带有尝试、扰动和恢复过程的操作轨迹,例如:

第一次抓取没有成功,调整末端位置后再次抓取;

●抓取过程中物体发生轻微滑动,机器人重新建立稳定接触;

●物体在搬运或放置过程中掉落,机器人重新定位并完成任务;

●动作执行出现偏差后,机器人停止原动作,根据最新状态重新调整;

●同一个任务经过数次尝试后最终成功。

这些轨迹并不是传统意义上的“完美示范”,但它们包含了一类非常重要的操作知识:

状态偏离之后,如何重新回到能够完成任务的轨道。

这使模型学习到的不只是理想状态下的动作分布,还包括从非理想状态向成功状态转移的过程。

换句话说:

完美数据教模型怎样一次做对,非完美但最终成功的数据教模型没有一次做对时,下一步还能怎么做。

4. 过滤噪声并重平衡数据分布

当然,还有很多数据存在大量的噪声,无法提供有效监督的噪声可能让模型学到错误行为,对于下列数据做剔除:

●轨迹无故中断;

●操作目标与指令不一致;

●机器人长时间进行无效或随机运动;

●失败之后没有任何有效恢复过程;

●数据损坏,无法判断动作与结果之间的关系。

此外,重新调整不同任务和难度样本的比例,避免少数高频模式主导模型学习,同时通过难度从低到高的渐进式训练,逐步提升模型的能力。

什么是有效操作经验?

通过上述处理,我们对“高质量数据”有了一个不同的理解。

高质量并不等于动作毫无瑕疵,也不等于每条轨迹都必须一次成功。

真正有价值的数据,应该能够清楚地表达:

●机器人当前处于什么状态;

●为什么采取当前动作;

●动作对环境产生了什么影响;

●当结果不符合预期时,后续动作如何调整;

●整个过程是否最终推动了任务完成。

因此,ZoeInside-VLA关注的不只是成功轨迹的数量,而是训练集中是否同时包含三类经验:

1.标准操作经验:理想状态下如何高效完成任务;

2.状态变化经验:不同动作如何改变物体和环境;

3.恢复操作经验:发生偏差后如何调整并继续完成任务。

这三类数据共同构成了模型面对真实环境所需要的操作经验。

现实世界不是一条始终正确的标准轨迹。机器人不仅需要学习成功动作,还需要见过成功之前可能发生的偏差。

二、动作生成中的执行反馈

生成式VLA通常采用Action Chunking策略:模型根据当前视觉观察、任务指令与机器人状态,一次生成未来一段连续动作,而非在每个控制周期重新调用完整策略。

这一设计能够降低推理频率,提升动作连续性和系统运行效率,但也使机器人在Action Chunk执行期间处于短时开环状态。动作序列生成后,模型默认环境将沿预期方向变化;然而在真实执行中,接触误差、物体滑动、定位偏差及外部扰动都可能改变系统状态。

因此,随着动作持续执行,模型生成动作时所依据的初始状态,可能逐渐与机器人当前面对的真实状态产生偏差。我们将这一现象概括为:

执行过程中的状态—动作失配。

例如,在抓取与搬运任务中,可能出现以下情况:

●夹爪已经闭合,但目标物体并未被稳定抓取;

●机械臂开始抬升,但物体未随末端执行器同步移动;

●目标物体在接触过程中被意外推动,位置发生改变;

●抓取初期产生的小幅姿态误差,在后续搬运和放置阶段被进一步放大。

此时,动作序列本身可能仍然平滑且连续,但其生成条件已经失效。如果机器人继续执行剩余Action Chunk,局部偏差就可能沿时间维度累积,最终表现为抓空、掉落、碰撞或放置失败。

因此,提升VLA的实际执行能力,不仅需要生成高质量动作,还需要在动作执行过程中持续利用最新观测,判断原有动作是否仍然适用于当前状态。

执行反馈模块

针对上述问题,ZoeInside-VLA在视觉语言主干与Flow Matching动作专家之外,引入了轻量级执行反馈模块。

该模块不试图保存完整的长程任务历史,而是针对当前Action Chunk建立短时执行上下文,回答一个更加具体的问题:

已执行动作产生的实际结果,是否仍然支持原有动作计划继续执行?

传统动作生成主要依赖:

当前图像+任务指令+机器人状态

ZoeInside-VLA在此基础上进一步引入:

近期视觉变化+已执行动作+机器人状态变化

执行反馈模块首先读取最近若干步的视觉特征、机器人状态和已经执行的动作,再将这些信息压缩成固定长度的执行上下文。

这一上下文重点描述的不是完整历史,而是与当前操作直接相关的信息,比如:

●机械臂刚刚向哪个方向移动;

●夹爪是否已经闭合;

●目标物体是否产生预期位移;

●当前观察相较动作执行前发生了什么变化;

●最近动作是否仍然在推动任务完成。

随后,执行上下文会作为条件信息反馈给动作生成模块,用于更新后续Action Chunk。

下面的一些例子展示了模型在面对失败时能够通过执行反馈生成正确的动作,从而完成任务。

三、从ZoeInside-VLA到卓世「启元」通用大脑:把模型能力变成具身系统能力

ZoeInside-VLA解决的是一个关键问题:机器人如何根据视觉观察和语言指令以及本体状态,生成能够在物理世界中执行的连续动作。

但一台真正进入生产和服务场景的机器人,面对的并不只是一次抓取任务。它还需要理解长程目标、拆解任务、调用不同技能、处理执行过程中的变化,并与用户保持自然交互。单一VLA模型即使具备较强的操作能力,也只是完整机器人智能系统的一部分。

为此,卓世构建了「启元」具身通用大脑。它不是将所有能力集中到一个大模型中,而是通过逻辑系统、直觉系统和共情系统组成的TriCore三核认知架构,将任务理解、动作执行与人机交互分配给不同系统,并由统一平台进行管理和协同。

逻辑系统:把复杂目标转化为可执行任务

逻辑系统承担具身大脑的高层决策。

当用户提出“前往货架取出指定物品,并送到另一楼层的工作台”时,机器人不能直接依靠一个动作模型完成全部过程。它需要理解环境、识别任务约束,并将长程目标拆解为一系列能够被执行的步骤,例如:

识别目标位置 → 调用导航技能 → 到达货架 → 定位目标物体 → 调用抓取技能 → 搬运物体 → 到达工作台 → 完成放置

在「启元」通用大脑中,逻辑系统以具备物理世界认知能力的视觉语言模型为核心构建中枢Agent,可以订阅机器人多模态数据,负责长程规划、物理关系推演、任务拆解以及底层技能调用。

它并不直接控制每个关节,而是回答三个问题:

当前要完成什么?

应该依次调用哪些能力?

任务是否已经达到目标状态?

直觉系统:让机器人快速、稳定地完成动作

完成任务拆解后,具体动作由直觉系统执行。

直觉系统面向高频、低延迟和高精度的机器人任务,采用“模型驱动”和“显式运控驱动”并行的双轨路线:一类能力由VLA等具身模型生成,另一类能力由导航、机械臂控制和预设动作等确定性模块完成。

ZoeInside-VLA正是直觉系统中的核心模型能力之一。

对于目标位置固定、动作规则明确的任务,系统可以优先调用确定性技能;对于物体外观、摆放位置和环境条件持续变化的开放场景,则可以调用ZoeInside-VLA等VLA/WAM模型,根据视觉与语言信息实时生成操作动作。

这种设计并不是让VLA替代所有传统机器人模块,而是让两类能力各自处理更适合的问题:

●确定性技能保证导航、预设动作和标准运动控制的稳定性;

●ZoeInside-VLA模型技能处理物体变化、视觉变化和开放场景下的柔性操作;

●逻辑系统根据任务和环境状态选择、组合并调度这些技能。

在ZoeInside-VLA内部,执行反馈模块进一步利用近期视觉、机器人状态和已执行动作,对后续Action Chunk进行更新。当抓取没有真正发生、物体被意外碰动或原动作不再适用于最新状态时,模型可以基于执行结果调整后续动作。

因此,ZoeInside-VLA为「启元」提供的不只是一个“抓取模型”,而是一类能够被逻辑系统调用、能够接收环境反馈、也能够与其他技能组合的模型化操作能力。

共情系统:让机器人理解“人”而不只是理解任务

具身机器人不仅要处理物体,也需要与人进行持续交互。

「启元」的共情系统承担低延迟语音交互,可以根据不同应用场景配置音色、音量和交互方式;结合人脸记忆能力,平台还能够维护人员身份信息,为个性化服务和连续交互提供基础。

例如,当机器人执行取物任务时,共情系统可以负责:

●确认用户指令及目标物品;

●在任务信息不完整时进行追问;

●汇报当前任务状态;

●在操作异常时向用户说明情况;

●根据身份和场景调整交互方式。

这使机器人不再只是接收一条指令后沉默执行,而能够形成“理解—执行—反馈”的完整交互过程。

三大平台:支撑「启元」从数据到执行闭环落地

为了将模型能力转化为可持续建设的具身智能产品,卓世围绕「启元」具身通用大脑建设了数采平台、训练平台和大脑管理平台三大基础平台。

数采平台:沉淀真实世界操作数据

数采平台面向机器人真机与仿真数据采集,支持遥操作数据记录、数据可视化、质量检查和标准化管理,为模型训练持续沉淀视觉、机器人状态、动作与任务指令等多模态数据。

训练平台:完成模型训练、评估与部署

训练平台为「启元」直觉系统提供模型研发支持,将训练任务创建、参数配置、日志监控、Checkpoint管理、Benchmark评估和推理服务部署统一到可视化平台中。平台支持组合不同视觉语言骨干、动作预测头和训练策略,帮助研发团队快速验证和迭代不同模型方案。

大脑管理平台:统一配置和调度机器人能力

大脑管理平台是「启元」的运行与调度中枢,负责统一管理逻辑系统、直觉系统和共情系统,并对大脑模型、系统提示词、机器人技能和交互配置进行集中管理。逻辑系统完成任务规划与技能编排,直觉系统承载导航、抓取和预设动作等执行能力,共情系统负责语音与个性化交互。

三大平台分别解决数据从哪里来、模型如何训练,以及能力如何配置和运行的问题,共同形成:

数据采集与管理 → 模型训练与评估 → 大脑配置与技能调度 → 机器人执行

通过三大平台协同,ZoeInside-VLA等模型不再只是独立的算法成果,而能够作为「启元」直觉系统中的模型技能,被统一训练、部署、管理和调用。

相关话题

特别声明:以上内容(如有图片或视频亦包括在内)均为站长传媒平台用户上传并发布,本平台仅提供信息存储服务,对本页面内容所引致的错误、不确或遗漏,相关信息仅供参考。任何单位或个人认为本页面内容可能涉嫌侵犯其知识产权或存在不实内容时,可及时向站长之家提出书面权利通知或不实情况说明,并提供身份证明、权属证明及详细侵权或不实情况证明(点击查看反馈联系地址)。本网站在收到上述法律文件后,将会依法依规核实信息,沟通删除相关内容或断开相关链接。

推荐关键词

24小时热搜

查看更多内容

大家正在看

海尔智家出口“好房子

AI古偶,躺着吸粉