Figure机器人第一次进陌生人家就会干活?56%成功率更值得看
把一台机器人送进陌生人家,不提前画地图,也不拿屋里的床、毛巾和玩具重新训练,它能不能直接开始干活?
人形机器人公司 Figure 9 月 17 日公布了一组新测试。搭载 Helix 2.5 控制系统的 Figure 03 机器人,被送进美国旧金山湾区 30 套此前从未进入的住宅,执行收拾客厅、铺床和叠毛巾三类任务。公司称,机器人没有在这些住宅里采集训练数据,也没有针对现场物品调整模型。
这段消息里有三个容易混淆的名字。Figure 是公司,Figure 03 是人形机器人,Helix 2.5 则可以理解为控制机器人观察、移动和操作物体的“脑”。Figure 还把训练 Helix 的人类行为数据集称为 Index。
“零样本”不是机器人从没学过
Figure 把这项能力称为“零样本全身泛化”。翻成日常语言,就是机器人第一次走进一套新房子,不在现场补课,也能把在别处学到的动作迁移过来。
“零样本”并不意味着机器人从未学过铺床或叠毛巾。Figure 明确表示,这三类任务此前仍使用其他地点采集的数据做过专门训练。它没有见过的是接受测试的房间、布局和物品。区别在于,过去的机器人常常换一个工位就要重新采集数据、重新调试;Helix 2.5 试图把“一项技能”变成能带到不同住宅使用的能力。
测试也不是只要机器人碰到毛巾就算成功。按照 Figure 公布的规则,收拾客厅必须把现场 13 至 15 件玩具全部放进篮子;叠毛巾必须完成折叠并放入篮子;铺床则要把两个枕头和被子两角放到床头区域,并把被面拉平。任务超时或需要人类为安全介入,都会被判为失败。
30套住宅都成功过,整体成功率仍是56%
Figure 在视频中说,团队在 30 套住宅里“都看到了成功”。但官网同时披露,使用 Index 预训练的模型,在全部盲测中的完整任务成功率为 56%。没有经过 Index 预训练、从随机参数开始学习的对照模型,成功率只有 9%。
这两个数字并不矛盾。前者说明成功案例覆盖了每一套住宅,后者统计的是一次次具体试验有多少完整通过。也就是说,机器人已经能把技能带进不同住宅,却仍会在接近一半的试验中失败。把“30 套都成功过”理解成“成功率 100%”,会高估这次结果。
56%仍然有意义。家庭环境远比工厂流水线混乱:床的高度不同,玩具散落的位置不同,毛巾柔软且会变形,机器人还要一边走动、一边观察、一边用双手操作。它必须把看、走、抓和纠错连成一套动作,而不是只在固定桌面重复一次抓取。
Figure真正下注的是“机器人也能吃数据”
Helix 2.5 的核心变化,不只是某个动作更灵巧,而是训练方法越来越像大语言模型。
Figure 的 Index 项目收集人类完成日常动作的经验。公司视频称,目前每周有超过 9 万人参与,系统每秒新增约 35 分钟的人类行为数据。研究团队把预训练数据扩大 8 倍后发现,机器人预测下一步动作的误差会比较稳定地下降;他们甚至能在最大规模训练开始前,较准确地估计最终误差。
这就是所谓“缩放规律”:投入更多数据和计算资源,性能提升能够被大致预测。大语言模型的发展曾依赖这一规律,因为企业可以在花巨资训练前先判断继续扩大规模是否值得。Figure 现在想证明,机器人也可能走上同一条路。公司已承诺为 Helix 投入 35 亿美元计算资源。
不过,这仍是 Figure 自己发布的测试、视频和统计结果。公司公开了任务规则和对照数据,这是积极一步,但目前没有公开的独立复现实验,也不能从剪辑视频判断失败发生在什么环节。所谓“首次达到这一规模”,同样是 Figure 的自我判断。
因此,这次进展不该被概括成“家务机器人已经成熟”。更准确的说法是:Figure 初步证明,人形机器人不必为每套住宅从头学习;但从 56%走到家庭用户可以放心依赖的水平,仍有很长距离。
参考资料
[1] FIGURE. Today We’re Releasing Helix 2.5[EB/OL]. (2026-09-17)[2026-09-18].
[2] FIGURE. Helix 2.5: Zero-Shot 30-Home Generalization[EB/OL]. (2026-09-17)[2026-09-18].

智讯智库编辑部
关注:科技、财经、国际视野
邮箱:contact@infocase.world




