灵初智能与北大-灵初联合实验室共同发布并开源双灵巧手通用模型和全栈系统 EgoSteer

灵初智能与北大-灵初联合实验室共同发布并开源 EgoSteer,一套双灵巧手通用操作大模型和全栈系统。EgoSteer 采用近万小时第一人称人手数据预训练+人在闭环的真机后训练,可以遵循开放式自然语言指令完成百余种不同语义的灵巧操作任务,同时支持少样本快速学习复杂任务。模型、代码、机器人系统均已开源,数据也将在近期开放。

从 24 年爆火的 VLA 到 26 年兴起的 WAM,具身大模型的范式快速更迭,但领域追求的目标从未改变:让机器人理解自然语言指令,在开放环境中执行多种任务。迄今为止,VLA/WAM 领域的大部分工作都需要在指定任务上进行微调,再展示模型在单一任务上的效果。近期的 PI0.7、DreamZero 等模型在通用性方面取得重要进展,它们能够完成多种任务,并在全新场景中展现泛化能力。不过,这些工作往往存在两个局限:一是依赖昂贵的真机数据,二是与夹爪深度绑定。一个有望达到更高上限的方案是人手数据预训练+灵巧手末端执行器——人手数据的可拓展性远远强于真机数据,灵巧手则可以对标人类的操作能力。而灵巧手基模的训练是一个极具挑战性的系统工程,数据、模型、真机方面都不能有短板:

  • 数据:人手和真机数据的规模化收集和处理
  • 模型:高效的模型架构和训练 Infra
  • 真机:高效的数采、部署和人在闭环改进系统

当前这些方面都存在较大挑战,导致上限更高的灵巧手模型展示出的效果反而远远不如夹爪模型。

针对这几个方面,灵初智能首席科学家杨耀东助理教授团队的研究工作“EgoSteer: A Full-Stack System Towards Steerable Dexterous Manipulation from Egocentric Videos”发布了一套双灵巧手通用操作全栈学习系统。这个系统包含三个部分。第一部分是 EgoSmith ,一个高效的第一人称人手数据处理管线。EgoSmith 通过四阶段流程将in-the-wild人类视频数据处理为带有精细的语言/动作标注的可训练数据,其质量和效率相较于以往方案都有大幅提升。论文中总共从12个开源数据集中清洗出了 9.6K 小时高质量数据用于预训练。第二部分是 Robot Stack,一个集成遥操作、模型部署和人在闭环介入纠偏的机器人技术栈。使用该技术栈,论文总共收集了 193 个任务的 187 小时真机数据,用于目标本体 grounding;同时也高效采集了很多人类丝滑介入纠偏的模型修正数据。第三部分是 EgoSteer,一个世界模型增强的 VLA 模型和高效的分布式训练 Infra。EgoSteer 以 9.6K 小时大规模人类第一人称操作数据进行预训练,再通过真机遥操作数据与人在闭环 DAgger 纠偏完成模型后训练,最终可以限随自由形式自然语言指令完成一百多种语义多样的桌面操作任务,并基于少量量示范快速适配复杂长程任务该全栈系统已完整开源代码、模型权重,数据也将近期开源,为双灵巧手通用操作开究提供了一套高质量、可复现、可迭代的全栈基线。

  • 论文标题:EgoSteer: A Full-Stack System Towards Steerable Dexterous Manipulation from Egocentric Videos
  • 项目网站:https://egosteer.github.io/
  • 论文地址:https://egosteer.github.io/EgoSteer.pdf
  • 代码仓库:
    • 模型训练与推理:https://github.com/egosteer/egosteer
    • 机器人遥操、推理、人在闭环介入:https://github.com/egosteer/robot-stack
    • 人类数据处理管线:https://github.com/egosteer/egosmith
  • 模型权重:https://huggingface.co/EgoSteer

EgoSmith:高效的第一人称数据处理管线

第一人称视频蕴含了丰富的人类操作先验,且具有天然的规模化优势,是训练通用灵巧操作模型的理想数据源。然而,in-the-wild 的原始视频通常伴随相机剧烈抖动、频繁遮挡,且缺乏动作与语言标签,难以直接用于模型训练。

EgoSteer 全栈系统包含了高效的单目第一人称数据处理管线 EgoSmith,它能对 in-the-wild 视频进行全自动清洗,并生成带有高精度 4D 动作轨迹和多层级语言标注的高质量数据。相较于先前的开源 SOTA  HaWoR,EgoSmith 不仅在多项关键数据质量指标上取得了显著提升,更实现了约 9 倍的吞吐量加速。

为了实现高效、高质量的数据处理,EgoSmith 设计了一套全自动的四阶段流水线:

  1. 预过滤:快速剔除无用画面通过双重筛查自动过滤掉镜头剧烈晃动、双手被严重遮挡等画面,只保留手部操作清晰可见的有效片段。
  2. 4D 运动估计:空间轨迹还原将头部与手部运动还原到物理空间中。EgoSmith 使用轻量稳定的 DPVO 结合 Any4D 进行深度预测,精准重建出相机与手部轨迹。
  3. 多层级语言标注:由粗到细的意图对齐利用多模态大模型过滤无意义片段,并为有效视频自动生成五级语言指令(涵盖核心任务、大意摘要、手/物细节到分步动作),帮助机器人理解不同粒度的人类意图。
  4. 后过滤:全方位质检进行多级质量筛查,过滤违背物理常理的离群轨迹,并剔除由于三维重建算法带来的漂移与异常跳变帧。

通过上述流程,EgoSmith 最终成功产出了一个包含 9.6K 小时、209 万个片段、10.4 亿帧的标准化第一人称人手操作数据集,为后续通用具身模型的灵巧操作预训练打下了坚实的数据基础。

Robot-Stack:统一支持遥操、部署、人在闭环纠偏的机器人技术栈

虽然第一人称人类数据预训练提供了强大的操作先验,但由于人机之间存在视觉与运动学鸿沟,仅靠人类视频并不能让机器人直接学会上手操作。要让机器人真正学会灵巧控制,必须通过真机遥操作数据进行对齐。

为此,EgoSteer 全栈系统包含了机器人软硬件控制栈 Robot-Stack。它不仅能高效地采集真机数据,更是巧妙地将遥操作数据采集、策略推理部署、以及人在闭环纠偏融合在同一套底层系统内

其核心设计亮点主要体现在以下三个维度:

  1. 统一底层控制:让遥操作与自主推理无缝对齐不论是机器人自己跑模型执行任务,还是人类通过数据手套进行手控采集,底层都共用完全相同的控制环路和计算逻辑,从而提供了模型训练-推理的动力学一致性。
  2. 相对动作映射:丝滑的人在闭环纠错在策略能力尚不完善时,执行复杂任务时难免会出现动作失误。Robot-Stack 为此提供了极其平滑的专家在线接管与纠偏机制,从而实现针对性的纠偏数据采集与模型增强:
    • 零突变平滑接管:Robot-Stack 提出“相对动作映射”的方法,将人类手部的相对运动量平滑映射到当前状态,避免接管瞬间由于状态突变产生的物理剧烈抖动。
    • 无缝闭环纠偏:专家可以在机器人发生失败的任意状态下无缝接管并示范纠正,纠正完成后再交回控制权。这使得 DAgger 在线纠偏数据的收集变得极其低门槛且顺畅。
  3. 自动手眼重标定:长期采集的数据质量保障在长期的物理遥操作和实验中,碰撞或震动极易导致相机外参发生微小漂移。系统集成了自动重标定工具,能够通过点云重合度在后台自动修复外参,省去了频繁人工标定的繁琐过程,确保了长期收集的数据始终高精度、高质量。

基于这一套高效率的控制栈,团队以最低的人力成本收集了涵盖 193 个桌面操作任务的 187 小时高质量真机遥操作与 DAgger 纠偏数据集,为模型在实际应用场景中的快速训练部署打下了基础。

EgoSteer:世界模型增强的VLA模型与训练Infra

基于 EgoSmith 与 Robot-Stack,EgoSteer 系统能够积累三类互补的训练数据:EgoSmith 产出的大规模人类第一人称数据提供了丰富的操作先验,Robot-Stack 采集的真机遥操作数据实现了从人到机器人的对齐,其中多轮 DAgger 在线纠错数据则针对性地修复了策略的失败模式。然而,数据本身并不会自动转化为操作能力,还需要一个能够同时吸收人类先验、真机对齐与在线纠错的具身模型。EgoSteer 全栈系统包含了世界模型增强的视觉语言动作模型 EgoSteer,用于从上述数据中充分学习语言指令跟随的灵巧操作能力。

在架构层面,EgoSteer 采用共享视觉语言主干的动作/世界双专家架构,由三部分组成:一个预训练视觉语言模型 Qwen3-VL,一个基于流匹配生成动作的动作专家,以及一个以动作为条件、预测未来状态 DINOv3 表征的世界模型专家。训练时,未来状态建模目标所产生的梯度由世界模型专家回流至视觉语言模型,增强了它对物理状态变化的理解与想象能力,从而进一步提升了动作专家的动作建模精度。推理时,世界模型专家不再输出,不产生任何额外推理负担。

在训练流程上,EgoSteer 遵循三阶段范式:第一阶段使用 9.6K 小时的人类 egocentric 数据进行预训练,第二阶段使用 187 小时多样化真机数据进行微调,第三阶段在多任务上进行多轮人在闭环的 DAgger 纠偏。

在数据利用层面,为了让后训练仅凭尽可能少的真机数据就能迁移预训练中习得的海量人类操作知识,EgoSteer 构建了一套统一动作空间:手腕位姿由 3D 位置与 6D 旋转表示,手部姿态由五指指尖在手腕坐标系下的位置表示,双臂双手合计构成 48 维动作空间。同时,机器人的腕部坐标系设在和人手尺寸相当的位置。这一设计使人类操作先验与机器人动作能够在同一表示下对齐,为高效的人机迁移提供了基础。

在真机推理方面,为避免机器人执行时因模型推理而停顿,EgoSteer 采用 Training-RTC 技术实现异步推理。执行过程中,机器人得以流畅、无缝地连续执行模型推理出的每一个动作块,全程不产生任何停顿。

在训练 infra 方面,EgoSteer 通过HSDP、算子融合、I/O优化,能够实现高效的预训练和后训练,在 8 卡 A800 上可达到 44.5% 的 MFU 和每秒 97 个样本的高训练吞吐,并可近线性地扩展至 128 卡及以上

实验结果

为了验证 EgoSteer 全栈系统的实际效果,该研究在真实的双灵巧手平台上进行了系统、多维度的真机实验评估。

其核心实验结论与表现主要体现在以下五个维度:

1. 强大的自由指令跟随与多任务泛化能力

在涵盖 7 大类、40 个日常复杂操作任务(如收纳、倾倒、擦拭等)的开放式随机杂乱场景评测中,EgoSteer 展现出稳健的指令遵循和操控表现:

  • 高成功率:实现了 75% 的整体平均成功率。其中在已见任务上成功率为 78%,在重组指令的组合泛化任务上为 65%,在完全未见的新语义任务上仍能达到 62% 的高成功率。
  • 自主容错: 策略模型表现出极强的故障恢复能力,当某一步骤因外界干扰偶发失败时,模型能够自主调整姿态并进行多次尝试,直至最终完成任务。

2. DAgger 高效纠错

  • 极高的样本效率: 仅投入约 8.3 小时的人在闭环纠偏数据(DAgger),失败率高的困难任务的平均成功率便从 22.5% 跃升至 62.5%,证明了 Robot Stack 纠错机制的显著成效。

3. 数据规模化红利与基座模型横向对比

  • 清晰的 Scaling 效应:实验对比了 0、3K、6K 到 9.6K 小时不同预训练数据规模下的表现。随着预训练规模的逐步扩大,真机操作成功率和动作精准度呈现出清晰的提升趋势,证明了大规模预训练注入了强大的物理常识与操作直觉。
  • 表现大幅领先基准:在 10 项基准对比任务中,EgoSteer 达到了 74% 的平均成功率,远超同期优秀基座模型 Being-H0.5(39%)与 π0.5(22%)

4. 消融实验证明各模块重要性

  • 关键模块验证:消融实验表明,去除“预测性世界模型”、“Training-RTC”或“EgoSmith 的前/后数据清洗过滤”,均会导致真机操控精度大幅退化,证实了全栈系统的协同设计不可或缺。

5. 跨本体、复杂长程任务的“少样本”迁移

同样令人振奋的是,借助强大的预训练灵巧操作先验,EgoSteer 无需庞大的数据量便能在不同本体上快速攻克极具挑战的长程、接触密集型任务:

  • 复杂长程任务:在 RealMan 机器人上仅用 120 条示教数据,便在 18 步、40 秒的折纸盒任务上达到了 75% 的成功率;在 AgiBot G1 机器人上仅用 200 条示教数据,在 9 步、1 分钟的拆蛋糕盒任务上达到了 83% 的高成功率。
  • 少样本快速适配:在相同的样本量下,传统的模仿学习方法(如 Diffusion Policy、IMLE)以及非预训练模型均遭遇了完全失败(成功率均为 0%)。这充分证实了 EgoSmith 提纯的 9.6K 小时先验为策略模型提供了关键的通用灵巧操作基础,带来极高的样本效率。

结语

通用灵巧操作能力需要更大的模型和更好的架构,更需要高质量数据、稳定控制栈和后训练体系的共同支撑。EgoSteer的意义不只是完成了一个双灵巧手操作模型,更在于打通了一条人类视频数据、真机遥操作、模型训练部署、人在闭环纠偏的完整链路。我们希望通过开源,持续为行业贡献灵初力量。我们相信,随着数据、代码、模型权重和完整技术栈开源,EgoSteer将为双灵巧手通用操作研究提供一套可复现、可迭代的全栈起点。

发表评论

您的邮箱地址不会被公开。 必填项已用 * 标注

滚动至顶部