
1903 年,莱特兄弟的第一次飞行,只持续了 12 秒。它证明了人可以飞,但离飞行变得安全、变成日常,还差着几十年。
这段话不是我写的,是一份机器人技术报告的开头。报告接着说,机器人行业正在批量生产自己的 12 秒,一个个 demo 让新能力被看见,让整个领域敢想,但没人回答那个更难的问题,条件变了,性能还立得住吗。
写下这段话的是 Sunday Robotics 创始人 Tony Zhao 和 Cheng Chi,就是 ALOHA 和 UMI 的作者,这两个名字在具身圈几乎无人不知,我之前专门写过一篇文章介绍Sunday Robotics:4 个月估值 11.5 亿美元,下一站深圳 。今年 3 月融 B 轮的时候,他们官方博客的标题就很狂,No More Demos(不再做 demo)。几天前,他们交出了把话说满之后的第一份大作业,ACT-2 Preview。
比报告先击中我的,是随它放出的视频。25 个画面同屏,25 台一样的机器人,在 25 个陌生的卧室里,干着你每个周末都在干的事,叠衣服。花床单、暗光、堆成小山的衣物筐,每个房间它们都是第一次进。字幕只有一句,fully autonomous in unseen homes,全自主,陌生家庭。

我把报告从头到尾读完了,来说说我的感受。
叠衣服有多难,大家自己最清楚。这活不费脑子,但费时间。而对机器人来说,它难上加难。一件皱成一团的 T 恤,每次摊开都是新的形状,会变形,会把自己盖住,几乎不会两次出现在同一个状态。你靠手感就解决了,机器人没有手感,每一件都是一道新题。
Sunday 的做法是直接把考场搬进真实世界。31 个机器人从没进过的家,785 次全自主测试,失手 7 次,成功率 99.1%。平均一百多件才叠错一件。

而且怎么算叠好,不是机器人自己说了算。规则在测试前写死,测完不许改,标注员先培训再上岗,一人打分另一人独立复核,所有测试视频公开。质量平均 4.72 星,接近四分之三拿满分,速度中位数两分多钟。报告还把机器人和人叠同款衣服的画面并排放在一起,我的观感,比我叠得整齐。这话有点丢人,但是是真的。希望以后都能把我的家务活给接过去就好了~
细节里还有两处我觉得值得注意的地方。最差的女式衬衫 94.7%,报告推测是因为又轻又软,能抓的形状线索太少,短板和原因都摆在明面上。再看图里的 n 值,无袖上衣 100% 但只测了 7 件,这种对自己不利的小样本,他们原样印出来,没有藏。
床单深浅、机器人站床哪边、衣服在床上还是地上,各种情形都一一验证实战过,没有一项拖后腿。同一个模型,进新家不采数据、不微调就能达到这种泛化效果。
怎么说呢,只能说确实很强~
不过你如果只记住 99.1%,这份报告就读浅了。
你可能疑惑过一件事。机器人 demo 一个比一个效果炸裂,可说好帮你干活的机器人,为什么到现在还停在发布会里,进不了你家门?一个重要原因是,几乎所有 demo 都是在自家实验室里炼出来的,模型在采过数据的环境里越调越好,搬进你家,立刻现原形。行业管这个叫泛化差距,熟悉环境和陌生环境的成功率之差。
Sunday 做了个实验,把预训练数据从零一路加到全量,看这个差距怎么变。

从八成多,一路砸到接近零。
没有预训练的模型,换个环境成绩直接塌方。预训练加满之后,熟悉的家和陌生的家,几乎没有区别。这张图说的事很朴素,泛化不再是玄学,是可以花钱买到的性质。而买它的货币,是预训练数据。
顺着这条线还有更值钱的一层。

数据每翻一倍,陌生环境的成绩往上走一格。训练时的验证 loss 和真实世界的成功率对得非常齐,等于说不用把机器人搬进陌生家庭,看一眼训练曲线,就知道它到你家的表现。绿色那条高质量数据线全程压着蓝色的均匀采样线,八分之一的好数据打赢一半的普通数据。
这套体验的分量,做语言模型的人最懂。当年大家敢把训练预算一轮一轮往上加,不是赌博,是曲线告诉他们,砸多少数据,换回多少能力,提前可算,这就是 scaling law。现在,机器人第一次拿到了同款曲线。
还有个实验我来回看了三遍。四个模型副本,每个只喂一条人类演示,各教一种不同的叠法,再拿没见过的衣服考,四个全学会了,而且都能举一反三。你教小孩叠被子还得示范好几遍,它看一遍就会。报告脚注里排了条时间线,GPT-1 还要逐任务微调,GPT-3 几个例子就能干活,机器人这边,π0 证明预训练加微调可行,GEN-1 把新任务压到一小时数据,现在是一条。
这是让我这个干数据的人最坐不住的地方。
ACT-2 的预训练数据全部来自人。人穿着 Sunday 自研的传感硬件去干活,数据再过一整套筛选处理的流水线。机器人自己的数据只在后训练阶段出现,量级很小。上一代 ACT-1 的报告标题干脆就叫 Zero Robot Data,零机器人数据。
真机数据有多贵,行内人都有数。机器人、场地、操作员,三样都是钱,国内不少头部公司眼下正按百万小时的量级规划真机采集。如果人类数据加单条演示这条路真走通了,拼的就不再是谁的真机小时数多,是谁的人类数据质量高、管线硬。谁对谁错现在下结论还早,但这条路已经跑出了这个任务上最好的成绩。说到底,教机器人干活的老师,本来就该是干活的人。
报告里我反复看的,反而是一些边角画面。
衣服掉地上,它捡起来接着叠。小孩跑过来把它手里的衣服抽走,它重新规划接着干。有人故意把叠好的堆推乱,它一件件重新码。灯从亮调到暗,都行。这些没人显式教过,是大规模预训练自己长出来的。报告把这类混乱定义为可恢复的中间状态,而不是直接宕机,不是只会处理见过的场景。
你想想自己家。沙发上永远有昨天没有的东西,猫会踩过刚叠好的衣服,孩子的玩具没有固定位置。家从来不是一个受控环境,这恰恰是机器人几十年进不了家门的原因,也是 Sunday 偏要选家庭当考场的原因。研究要的和市场要的,头一回是同一个东西。
体型跨度也一样。婴儿服、8XL 衬衫、大浴巾,尺寸差出一个量级,它会自己挪位置、调高度、俯身探进工作区。按 Tony Zhao 的说法,以上全部跑在机器人本体的算力上,不联网。
报告里有段话,我建议你抄下来。
在未见过的家庭中、零适配达成 99.1% 成功率,与在同一件衣物、同一个预先布置的台面、同一个熟悉的房间中测得 99.1%,是两个截然不同的命题,尽管两个百分比完全相同。
为什么 demo 量不了进度?因为每个 demo 的环境、道具、干预规则都是自己定的,没法比较,也没法累积。Sunday 提出用一个叫 Solve 的标准替代它,一个能力要算数,得同时讲清楚三件事。做到了多好。在多大范围内做到的。换个地方还要再花多少功夫。
他们自己先按这个标准交了卷,诚实到连不做什么都写清楚了。袜子、文胸、内衣、配饰不在范围内,因为它们通常的处理方式是配对、归类或悬挂,而不是折叠。适配成本那一栏只有四个字,每个家庭为零。
下次再刷到机器人发布会,你就拿这三问过一遍。做到多好,范围多大,搬到我家还要花多少功夫。我猜大部分 demo 撑不过第一问。对投资人来说,这就是一份现成的尽调清单。
该说的我还是得说。这是 preview,考卷自己出,成绩自己判,第三方复现还没有。叠衣服之外,同一个模型正在学的冲咖啡、吸尘、整理玩具,没有一项过了 Solve 的门槛。卖多少钱、用半年之后还灵不灵、安不安全,全是空白。
但报告里有句反直觉的话我很认同,一个每项任务都只有 60% 可靠性的机器人,可能不如一个能可靠完成少数高价值任务的机器人有用。样样都会但样样掉链子的帮手,你家里大概也有过,用两次就吃灰了。先把一件事做到可靠,数据和方法沉淀下来,下一件才更容易,飞轮才转得起来。
回到开头那 12 秒。1914 年,第一家航空公司在坦帕湾开出定期航线,一天两班,离首飞隔了 11 年。航空业真正的起点不是飞起来的那 12 秒,是可靠到能定期载客的那一天。
Sunday 说自己在做的,就是把 12 秒变成一条航线。今年秋天,搭载 ACT-2 的 Memo 会通过 Beta 计划进入真实的美国家庭,第一项能力就是叠衣服。感觉和自变量的 58 同城进入家庭计划有异曲同工之妙啊。
也许不远的某个周末,床上那堆衣服,就不归你管了。
从技术上看,这份报告解决的是具身智能最老的一块心病,模型出了实验室就不可靠。ACT-2 把它变成了一条可以计算的曲线,机器人第一次从演示道具,往可交付的产品迈了实实在在的一步。这一步是不是真的,下半年看第二个 Solve 出不出现,就知道了。
但合上报告,我想的是另一件事。等机器人真的能接手家务,我们和家的关系,会变成什么样?
人做家务,从来不是因为热爱。叠衣服、洗碗、吸尘,这些安静的重复吃掉了我们大量的时间,晚饭后的散步、想读没读完的书、陪孩子拼到一半的积木,都在给它们让路。
也许这就是 Sunday 们真正在做的事。机器人接手的不是家的温度,是那些重复了一万次、谁做都一样的动作。让机器负责重复,让人负责生活。
真正让一个房子变成家的,从来都是人,是那个会赖床、会走神、衣服叠得歪歪扭扭还理直气壮的你。
把时间还给人,才是机器人这门生意的终点。
看清方向,比跑得快更重要。我是向光,下次见。