具身智能的瓶颈从来不在于模型架构,而在于数据。架构可以快速迭代,但是怎么 scaling 数据,需要 scaling 什么样的数据,仍然是一个值得探究的问题。

Psi‑R2.5:Scaling Quality, Not Just Size
Psi‑R2.5 创新采用高层规划器+低层控制器双层架构,模拟人类“大脑‑小脑”协同工作机制,实现复杂任务的精准拆解与闭环执行:
· 上层(高层规划大脑):上层模型使用 QwenVL3.5-4B作为骨干网络,主打长时序任务理解与智能拆解,可将复杂自然语言指令拆解为精细化子任务,同时向底层模型传递专属任务子文本(Subtext)与价值优先级信息(Value);
· 下层(低层控制小脑):下层模型使用 Wan2.2-IT2V-5B作为骨干网络,精准对接环境观测信息与上层任务指令,输出机器人可直接落地、连续稳定的完整操作轨迹。
双层级模型依托同一套高质量预训练数据完成联合训练,架构协同性、任务适配性大幅升级。

我们明确核心认知:数据总时长绝不等于数据信息量。同等数据体量下,覆盖百类任务、多元场景的碎片化优质数据,远优于单一任务的重复冗余数据,泛化能力差距显著。
基于此,Psi‑R2.5大幅压缩单任务重复样本,极致提升任务与场景多样性,搭配自研全自动标注管线,对每一项原子动作、子任务进行细粒度标注、校验与优化,从源头严控数据质量。
在评测体系层面,我们创新将仿真评测深度嵌入模型预训练全流程,同时自研搭建包含50项高难度复杂任务的真机多任务专属评测集,测评全程随机重置任务初始状态,有效规避模型过拟合问题,客观、精准衡量模型的组合泛化与复杂场景适配能力。
弱Pair Data VS 强Pair Data,破解人机数据对齐核心难题
当前行业普遍通过Pair Data(配对数据)实现人类与机器人行为对齐,但绝大多数方案均依赖弱Pair Data:仅满足任务语义相似,场景细节、时序帧序列无法精准匹配,数据噪声大、适配性差。
灵初智能全新定义并落地强Pair Data标准:在交互对象一致的基础上,实现场景细节逐帧对齐、时序轨迹一一匹配,转换生成的机器人动作序列可直接在真机回放、完整复现对应任务,彻底将人类操作动力学域,精准对齐至机器人执行动力学域。


本次Psi‑R2.5 模型能力的跨越式升级,核心依托两大技术突破:
· 依托大规模高质量强Pair Data,彻底打通人类示教数据与机器人真机数据的跨域对齐壁垒;
· 升级数据标注体系,大幅提升语言指令、动作轨迹的标注精度,以极致数据多样性赋能模型全域泛化。
行业粗放式将人类视频直接输入模型训练的方式,会产生海量噪声,甚至让模型沦为“数据分类器”——优先区分输入为人类数据或机器人数据,再被动适配执行,完全丧失智能决策能力。灵初智能核心技术理念:真正有价值的人类示教数据,是经过精准转换、可直接驱动机器人自主完成任务的高质量数据。
逆向生成技术,规模化破解两大核心具身鸿沟
长期以来,利用人类示教数据训练机器人的方案,始终受限于两大Embodiment Gap(具身鸿沟),成为行业规模化落地的核心瓶颈:
· 视觉具身鸿沟:人手与机械手的外观像素差异、相机拍摄参数、环境视角等视觉偏差,导致模型认知错位;
· 动力学具身鸿沟:包含三重核心误差——手部姿态识别的传感与视觉误差、人手与机器人关节的运动学误差、人机材质摩擦等物理参数误差,直接导致动作复刻失效。
过往主流解决方案,无论是Real2Sim仿真重建迁移,还是图像分割+修补替换机械手,均存在致命短板:要么无法规模化量产,要么图像修复会破坏手部与物体的遮挡交互细节,仅能适配极简任务,无法支撑复杂灵巧操作。
在迭代R2版本时,灵初智能依托自研Psi‑W0世界模型替代传统仿真器,通过强化学习将人手操作轨迹优化为机器人可精准执行的轨迹,初步解决人机数据转化难题。但该方案流程繁琐,依赖策略模型与世界模型反复迭代推演,落地效率偏低。
为此,我们突破行业固有思维,创新提出逆向生成核心思路:不再从人类数据拟合机器人数据,而是从真实机器人真机执行数据反向生成匹配的人类示教样本。


通过逆向调用Psi‑W0世界模型,基于海量高精度机器人执行轨迹,批量生成场景、时序、动作高度匹配的人手示教视频,高效量产高品质强Pair Data。依托这批优质配对数据,我们蒸馏训练出端到端人机数据转换模型,实现普通手机、相机拍摄的任意人手操作视频,均可一键转化为精准的机器人视觉画面与可执行动作序列。

为严格把控数据转化质量,我们设立两大硬核验证标准:
· 转换后的机器人轨迹,可直接在真机设备上回放、完整复现任务;
· 基于转换数据做模型后训练,模型可稳定泛化适配同类全新任务。
实测验证,经模型转换的人类示教数据,绝大多数可直接驱动机器人完成对应任务;即便是高难度双手精密操作任务,也能生成精准、贴合目标的操作轨迹,效果行业领先。
模型能力强化:HIL+RL后训练框架,极致降低部署成本
纯预训练基础模型,短期内无法实现客户现场零成本、零适配、开箱即用。工业场景SKU品类繁杂、作业节拍高度定制化,高效轻量化后训练,是具身智能模型商业化落地的核心刚需。
灵初智能为Psi‑R2.5配套自研灵巧手HIL人在回路+RL强化学习后训练框架:依托高性能基础模型底座,仅需少量示教数据,即可快速微调适配各类复杂业务场景;部署过程中实时收集任务失败案例,数据自动回流迭代,持续优化模型能力。
通过使用我们的HIL与后训练RL框架,在经过几轮迭代之后,模型可以将成功率提高到99%,并且只需要花费1-2个工作日。该方案同时也部署在了我们实际的客户现场,来持续解决各类复杂边界场景作业难题。
我们认为:具身智能区别于传统非标自动化的核心商业价值,正是通过模型与数据技术,极致降低行业现场的部署、适配与迭代成本。
上下文学习ICL,观摩示范即可执行新任务
大模型上下文学习能力已深度赋能机器人领域,与大语言模型不同,机器人的核心上下文Prompt是真实场景的人类示教视频,而非纯文本指令。
依托灵初智能自研强Pair Data数据转换管线,可将任意人类示范视频,实时转化为机器人视角的精准Prompt,实现高效机器人上下文学习(ICL):无需更新模型参数、无需二次训练,仅通过测试阶段的文本指令或人类物理示范,即可让机器人零样本泛化完成全新复杂任务,自主推理任务逻辑、规划操作流程。
多组完整演示Demo已上线项目主页,更多ICL相关技术细节将在后续发布。
项目演示与完整技术博客:
Scaling Pair Data for Embodied Intelligence(https://www.psibot.ai/scaling-pair-data-for-embodied-intelligence-zh/)