返回 AI 资讯
AI 资讯量子位

教机器人干活,光“刷课时”可不够!灵初这次较真数据质量

看这组对照视频:一边是人手操作,一边是机械手操作。乍一看,像是人先做了一遍,机器人再照着学。但顺序恰好反了——机械手那段才是真实记录,人手那段则是AI根据它生成出来的。 △Psi-W0将人手示范转化为机械手可执行的操作轨迹 为了让机器人学人,为什么反而要从机器人的动作开始?这看起来有点绕,却指向了一个很实际的问题:人类每天都在干活,这些经验,到底怎样才能交给机器人? 就在上周,Figure发布Helix 2.5,使用人类行为数据集Index进行预训练,在完成三类家务任务的适配后,将机器人带进30个未采集过数据的家…

内容摘要

看这组对照视频:一边是人手操作,一边是机械手操作。乍一看,像是人先做了一遍,机器人再照着学。但顺序恰好反了——机械手那段才是真实记录,人手那段则是AI根据它生成出来的。 △Psi-W0将人手示范转化为机械手可执行的操作轨迹 为了让机器人学人,为什么反而要从机器人的动作开始?这看起来有点绕,却指向了一个很实际的问题:人类每天都在干活,这些经验,到底怎样才能交给机器人? 就在上周,Figure发布Helix 2.5,使用人类行为数据集Index进行预训练,在完成三类家务任务的适配后,将机器人带进30个未采集过数据的家庭进行测试。 这项研究关心的,正是从人类经验中学到的能力,能否帮助机器人应对新的环境。 灵初智能这次进一步追问: 人类数据进了模型,不等于人的操作经验就能被机器人直接使用。这中间,还缺什么? 在十万小时级数据积累的基础上,灵初智能的 模型Psi-R2.5 继续改进数据质量与人机数据对齐方法,并进一步推进具体任务适配。它关注的不只是让机器人看过更多操作,还包括怎样把这些操作变成有效的训练材料,以及面对新任务时,怎样更容易地教会它。 而开头那个看似绕远的办法,恰恰是为了少绕一些弯路。 教机器人学人,这次先倒着来 人和机器人,都能拿起一瓶可乐。但两段“拿可乐”的视频放在一起,就能教机器人照着做吗? 这里面仍然存在一些“老生常谈”的问题:人手和机械手不仅长得不一样,关节结构、接触物体时的摩擦条件也不同。再加上人手姿态估计的误差,一个人可以顺利完成的动作,转换成机器人的关节运动后,未必还能成功。 所以,给机器人看懂“这是在拿可乐”,和提供一份“可以这样拿起可乐”的动作数据,是两回事。 灵初把人和机器人执行类似任务、主要在任务含义上对应的数据,称为“弱配对数据”。它更希望获得的,是另一种对应关系:除了人和机器人本体不同,两边的场景基本一致,动作时序逐帧对应,而且机器人一侧的动作能够在真机上直接回放成功,这就是“ 强配对数据 ”。 △弱Pair与强Pair的对比 强配对数据强调对齐,不只是要求人和机器人“都做了同一件事”,而是“ 人的这段操作,对应着机器人这段可执行的动作 ”。 但这样的数据,很难直接采集。 让人和机器人各做一遍,很难保证场景和动作时序逐帧对应。直接照搬人的轨迹也未必成功,因为两者的关节结构、摩擦条件并不一样。 今年4月,灵初已经尝试让Psi-R2与世界模型Psi-W0配合,通过轨迹推演和强化学习,将人类操作转换成可执行的机器人数据。问题是,这套流程涉及多个模型协同和策略优化,生产数据的过程比较重。 灵初巧妙地换了一个方向:为什么一定要从人类操作出发,再费力生成一段能够成功的机器人动作? 反过来,真实机器人操作的图像和动作,本来就是可用的。以它们为起点,生成匹配的人类数据,不就可以获得一份新的对照样本? 按照这条思路,灵初 逆向使用Psi-W0 ,从真实机器人数据出发,生成对应的人手操作数据,再将这些高质量配对数据用于训练端到端转换器。这个转换器的输入是 人类操作数据 ,输出则是匹配的 机器人图像和动作 。 △高质量机器手-人手配对视频 △只需用手机在日常场景中录制一段人手操作视频,即可通过模型转换为对应的机器人数据。 那怎么判断转换有没有用? 灵初设置了两种验证方式:一种是直接在机器人上回放转换后的轨迹,看能否完成相同任务;另一种是把转换后的数据用于后训练,再看训练出的模型能否完成相关任务。 判断标准不再只是“生成的视频像不像”,而是 数据能不能支持实际操作 。据灵初介绍,转换后的数据已在上述两类测试中得到验证。不过,部分特别复杂的任务仍未直接完成,数据转换并不等于所有任务都已经解决。 沿着这条思路,Psi-R2.5也重新梳理了数据本身的质量。灵初减少同一任务的重复堆积,增加任务多样性,并通过自动标注管线,把任务拆解到更细的原子动作,再进行标注和审核。 毕竟,数据的价值,不能只按小时算,还得看覆盖了多少种任务、机器人能用上多少。 △Psi-R2.5多任务评测效果 视频,也能当机器人的prompt 如果一段人类操作,已经能转换成机器人更容易使用的参考,那么它或许也可以有另一种用途:不只是进入训练集,也可以成为当前任务的提示。 这也意味着不必把所有要求都写成一大段指令,而是给机器人一个例子——“照着这个来”。 这是灵初在Psi-R2.5中进一步探索的上下文学习,也就是 In-Context Learning ,简称ICL。在其展示的任务中,机器人不需要更新模型参数,而是 根据当前上下文提供的线索,推断该做什么、该如何做 。 △Psi-R2.5 In-Context Learning展示 这里有一个关键变化:新示范不一定要再走一遍训练流程,才能影响机器人的行为。它也可以作为当前任务的参考,交给已经训练好的模型使用。 难点仍然在于,示范来自人,执行者却是机器人。灵初的思路,是利用前面的强配对数据模型,将人类示范转换成对应的机器人数据,再更好地作为提示输入模型。 同一种数据转换能力,由此有了两个用途: 一是准备训练材料,二是帮助机器人理解眼前的示范 。 这也与Psi-R2.5的双层架构相衔接。它的上层模型负责拆解长程任务,把一段较长的指令分成子任务;下层模型则结合子任务和当前观测,输出具体操作轨迹。一个负责拆清楚要做什么,一个负责落实到动作。 换个任务,不一定要重新训练模型,也可以用一段示范告诉机器人该怎么做。 当然,这里的不用重新训练,不等于模型此前没有训练过,也不等于随手拍一段视频,就能让机器人完成任何工作。目前灵初展示的是特定任务中的ICL能力,更多实现细节尚待公布。 但它提供了一个值得继续观察的方向:人的示范,不一定只能是离线训练时使用的材料,也可能成为实际使用机器人时的一种交互方式。 99%成功率,不止靠预训练 预训练已经用了十万小时级的数据,为什么到了客户现场,机器人还得接着练? 在灵初看来,真实部署面对的物品种类、规格和作业节拍,往往带有很强的定制化要求。短期内,不能指望基础模型完全不做适配,就直接进入所有客户现场;后训练仍然是必要的一环。 那训练基础模型的意义是什么? 灵初在最新的Tech blog中明确指出,预训练并不是让后训练立刻消失。从部署角度来看,现阶段训练基础模型的意义应该是 让后训练需要的数据更少,从而降低适配与部署的成本 。 手机盒装配,就是一个具体例子。这个任务涉及多个步骤,对操作精细度也有较高要求。据灵初介绍,通过结合人工参与与强化学习的后训练框架,经过几轮迭代, 任务成功率达到约99%,耗时1-2个工作日 。 预训练积累的本事,在这里派上了用场:机器人不用从零学起,只需补充少量任务数据,再通过人工参与和强化学习,把容易出错的地方练好。 到了客户现场,训练也没有结束。机器人在哪里失败,相关数据就被收集回来,用于下一轮改进。团队表示,这套方案已经用于实际客户现场,处理作业中遇到的复杂情况。 这与前面的示范引导并不矛盾。示范提供一种表达新任务的方式,后训练则继续处理具体操作中的难点。两者不是要求机器人每次都从零开始,而是在已有能力上,减少适应新需求的额外投入。 Psi-R2.5正把预训练积累的能力用到具体工作中。用好人类经验,让客户少花时间、少花成本就能把机器人用起来,是灵初持续改进基础模型的目标。 Tech blog:https://cypypccpy.github.io/tech-blog.github.io/ https://cypypccpy.github.io/scaling-pair-data.github.io 版权所有,未经授权不得以任何形式转载及使用,违者必究。 具身智能 数据 灵初智能 视频 思邈 扫码分享至朋友圈 相关阅读 给机器人打造动力底座,微悍动力发布三款高功率密度关节模组 覆盖从轻量精密到重型作业的全场景动力解决方案 具身智能 微悍动力 机器人 北大具身智能成果入选CVPR'24:只需一张图一个指令,就能让大模型玩转机械臂 与谷歌RT2相比,更侧重以物体为中心 CVPR 具身智能 将整本《绿野仙踪》存入纳米级DNA中,高效准确,读取无压力 DNA取代硬盘不是梦 DNA DNA存储 数据 商汤善惠烧卖购机器人小店上海“开业”,让机器人真正落地线下零售 打造“一人多面”的具身智能便利店 具身智能 商汤科技 哈工大系闯出人形机器人黑马:成立不到一年,全栈开源3m/s原型机,小米商汤都投了 硬件图纸+算法+避坑指南都有 人形机器人 具身智能 哈工大 萝博派对 清华成立具身智能与机器人研究院 具身智能,高校先all in了! 具身智能 热门文章 AGI最难一战,竟在医院!中国AI登上Science,医生不怕失业还催着上线 AI离“理解万物”还有多远?先拿癌细胞和行星轨道试试水 白天务农晚上码农,这个斐济农民跨越一万公里来拼多多取经 27B模型分分钟交付网页,Qwen 3.8还是太能了 具身智能技术路线尚未定型,基础设施却先收敛 加入我们 寻求报道 商务合作 追踪人工智能新趋势,报道科技行业新突破

资讯来源

量子位

原文链接

打开原文