Figure AI 将其人形机器人送入硅谷地区 30 个从未涉足的家庭。在没有新增训练数据、未进行现场微调的情况下,机器人直接执行铺床、叠毛巾和整理客厅等任务,最终取得了 56% 的成功率。

这一本月公布的数据标志着家用机器人领域迈出了实质性一步。尽管 44% 的失败率表明可靠性仍需大幅提升才能满足无人值守运行的愿景,但从受控基准测试中 9% 的成功率跃升至 56%,有力证明了基于人类行为的大规模预训练能够有效迁移至新环境。

严苛测试下的泛化能力

Figure 在硅谷租用了 30 套房屋进行测试。机器人抵达每处住所时,仅携带针对三项任务之一的固定策略检查点。据媒体报道,在总计 420 次试验中,系统完成了 237 项完整任务。期间,公司未收集任何额外数据,未更新模型权重,也未运行任何适配程序。

评估标准极为严苛:整理玩具需将 13 至 15 件物品全部入篮,叠毛巾要求整齐收纳,铺床则需枕头归位、被角对齐且表面平整。任何细微偏差均计为失败,无部分得分。

任务表现存在差异:铺床成功率为 67%,叠毛巾为 62%,整理客厅仅为 40%。然而,核心突破在于对比实验。Figure 使用相同架构和数据训练了两个策略:一个从零开始,另一个基于包含人类行为数据的 Index 数据集预训练权重启动。结果显示,预训练版本成功率达 56%,而从零开始的模型仅为 9%。公司指出,没有任何单一评估任务占预训练数据比例超过 1.9%,这种巨大差距源于模型对广泛因素的泛化理解,而非简单的任务重复。

Helix 2.5 模型所需的特定任务适配数据仅为早期可比策略的一半,却成功将性能扩展至 30 个未见过的家庭。Figure 创始人兼 CEO Brett Adcock 表示,具备在未见过环境中工作的泛化能力是机器人的“圣杯”,这项工作对公司使命至关重要。

从实验室走向真实世界

这一进展恰逢消费者对具身智能兴趣高涨之际。调查显示,智能家居采用率在某些维度已升至 59%,但全面整合仍局限于约 8.5% 的家庭,成本与复杂性是主要障碍。若能可靠处理非结构化家务,机器人有望改变这一经济格局,但前提是必须跨越可靠性门槛。

外界对“全有或全无”的评分方式提出质疑,认为真实家庭存在宠物、儿童等更多变数。此外,Figure 尚未发布第三方验证结果,评估仍属内部进行。尽管如此,Index 数据集背后是多年的大规模人类演示收集及数十亿美元的计算资源投入,Figure 基础设施目前每秒可生成约 35 分钟的人类体验数据,Helix 2.5 正是建立在此基础之上。

批评者指出,在三项狭窄任务上的成功不等于通用家庭助手。策略仍依赖特定任务微调,高层指令并非完全开放,任意家庭中的开放式操作尚需时日。与此同时,特斯拉 Optimus、波士顿动力及 Agility Robotics 等竞争对手也在推进不同技术路径。Figure 强调的人类数据预训练使其在当前浪潮中独树一帜,但其扩展速度是否优于替代方案仍待观察。

实际部署仍面临功耗、安全、维护及成本等障碍。56% 的成功率足以用于演示,但远未达到让用户放心让其与熟睡儿童或贵重物品共处的标准。Figure 尚未披露 Helix 驱动机器人的定价或商业时间表,高管称当前工作旨在为长期产品提供研究支持。

行业观察家正密切剖析这些数据。有人关注 44% 的失败率并要求更严格指标,有人则庆祝从 9% 到 56% 的飞跃及大规模预训练的价值。尽管实验室承诺与可靠家务劳动之间仍有差距,但 Figure 的试验表明,物理任务中的泛化能力正从科幻概念步入增量工程进步的现实阶段,为智能家居向 AI 协调系统转型增添了重要砝码。