跳转至

详读 · Sunday Robotics「ACT-2 Preview」

追踪卡见 追踪-Sunday-Memo。本页是全文精读:主张 → 方法 → 实验全表数字 → 口径注意 → 对我们。 来源:ACT-2 Preview: Generalizing Reliability,Sunday Team,2026-07-17(原文标 "25 min read")· 前作 ACT-1 (2025-11-19) 引用格式(原文自附):Sunday Robotics, "ACT-2 Preview: Generalizing Reliability", Sunday Robotics Blog, Jul 2026.

⚠️ 这不是论文。 无架构、无参数量、无数据规模(小时/episode 数)、无代码权重、无外部基线、无第三方复现。它是一篇带图表的厂商发布文,而且自称 "Preview",另有一篇 post-training 技术文"将另行发布"。 → 全文证据档 D(待验证)。库内任何引用必须带限定语「Sunday 自报」。

0. 省流

家用移动操作机器人 Memo 上的新模型 ACT-2,在没见过的真实家庭里叠衣服,785 次自主尝试成功 778 次(99.1%),且每个新家零适配(不采数据、不微调、不给专家演示、全程同一个 checkpoint)。

它自称的真正突破不是这个数字,而是背后的配方:预训练规模一大,"在自家实验室调好的收益"就能原样搬到没见过的家里——因此可以"在自家 Memo 上快速迭代刷性能",而不必担心只是过拟合。其极端体现是:一条演示就能教会一种新折法,并泛化到没见过的衣物

1. 它的三段论(原文自述的论证链)

  1. 泛化差距(generalization gap) = 后训练之后,in-domain 成功率 − out-of-domain 成功率。
  2. 预训练规模上去,这个差距塌到 0 → 于是"在自家环境上爬坡"变成"在真实世界爬坡"的可靠预测器。
  3. 差距一没,每条后训练样本的杠杆就变大 → 单条演示学新行为 → 后训练闭环可以快速堵真实世界暴露出的失败案例 → 最终 99.1%。

原文的自我定位:"the first robotics model to achieve reliability by unifying broad generalization with high performance",以及 "To our knowledge, we are the first to demonstrate that an end-to-end model can learn new behaviors from a single demonstration and generalize those behaviors to unseen environments."(两处都带 "to our knowledge" 对冲)

2. 方法(能读出来的部分)

2.1 预训练数据 = 手套采的人类数据

原文只给一句:预训练在 "high-quality, high-diversity, sensorized human dataset collected through Sunday's proprietary data collection hardware, data curation system, and data processing pipeline"

没有披露:小时数、episode 数、家庭数、模型架构、参数量、动作表示、控制频率。

结合前作 ACT-1 可以补上这条数据链(✅ ACT-1 原文):

  • Skill Capture Glove:手套与 Memo 的手共用同一套几何与传感器布局,"人戴手套能做的,机器人也能做",目的是消除 embodiment mismatch。
  • Skill Transform:把手套原始观测(运动学 + 视觉)对齐成"像机器人自己采的",转换成功率 90%
  • ACT-1 的招牌口号是 "Trained on Zero Robot Data"——不用一条遥操作轨迹。ACT-2 沿用同一条数据线(文中说法从 "zero robot data" 换成了 "sensorized human dataset",没有说明是否已混入机器人自采数据——🟡 待验证)。

→ 这是本库 概念-机器人数据与标注 里"低成本人体采集"路线(对照 卡片-UMI 的手持夹爪、卡片-MobileALOHA 的遥操作)跑到工业规模的样子。

2.2 预训练规模 vs 泛化差距(Figure 1)

同一套后训练流程,套在不同预训练规模的模型上,分别在 in-domain(后训练见过的环境)和 out-of-domain(留出的环境/物体/构型)上评。每个成功率背后 50 次评测

预训练数据量 In-domain Out-of-domain 差距
0% 96% 14% 82
12% 100% 90% 10
25% 100% 92% 8
50% 100% 96% 4
100% 100% 100% 0

这是全文信息量最大的一张表。 0% 预训练那一行(96% → 14%)是"纯后训练即过拟合"的干净反例;100% 那一行差距为 0。

2.3 数据质量 vs 数据数量(Figures 2–4)

同等数据量与算力下,比"高质量子采样"和"均匀子采样":

采样方式 12.5% 25% 50% 100%
高质量子采样 75.6% 87.9% 92.3% 99.1%(旗舰)
均匀子采样 43.8% 53.6% 64.1%

对应验证损失:高质量 0.0700 / 0.0682 / 0.0668,均匀 0.0738 / 0.0713 / 0.0682,旗舰 0.0653。

两条可直接借用的结论(📄 原文,但仅其内部数据): 1. 同等数据量下,数据质量的差距能到 30 个百分点(12.5% 档:75.6% vs 43.8%)——"数据策展"不是玄学。 2. 验证损失与真机成功率强相关 → 他们用它当"跑昂贵真机评测之前的廉价代理信号"来调数据配比。这条对任何做数据配比的团队都有工程价值。

2.4 单条演示学新行为(全文最响的主张)

做法:拿同一个预训练模型复制四份,各自用简单 SFT 后训练,每份只喂一条演示,每条演示是一种不同的折法;然后在四次 SFT 都没见过的衣物上评估。

结果原文只有一句话:"All four models successfully executed their newly learned techniques."

⚠️ 没有成功率、没有 n、没有对照组、没有失败案例。这是全文主张最强、证据最薄的一节(详见 §5)。

原文自己把它对标语言模型史:GPT-1 需任务微调 → GPT-3 few-shot;并点名 π0卡片-π0)证明广泛预训练可支持快速习得新技能,GEN-0 / GEN-1 报告"每个新任务约需 1 小时机器人数据",而 Sunday 声称自己是一条演示

2.5 后训练闭环(几乎没写)

原文承认一次性演示不足以到部署级可靠性,剩下的差距来自"反复真机跑才会冒出来的边缘案例";他们的后训练循环专打这些,靠"机器人/模型/机队基础设施/数据运营全自有"来快速闭环。"更多细节将另发一篇技术文"——即本次发布没有给出这部分方法。

3. 实验(全表数字)

3.1 先声明边界(Scope + Adaptation cost)

  • 衣物:常规可折叠且质量可一致评判的家居衣物——T恤、长袖上衣(厚/薄)、Polo、无袖上衣、衬衫、长裤、打底裤、短裤;尺码 XXS–8XL,颜色/材质/厚度/纹理各异。
  • 明确排除:袜子、胸衣、内衣、配饰——理由是"这些的常规处理是配对/分类/悬挂,而非折叠"。
  • 场景:没见过的房间、不同的床与折叠面、不同光照、从床侧或床尾作业。
  • 初始构型:衣物起始于篮中、堆中、床上或地上,任意朝向、自然褶皱。
  • 适配成本每个家庭为零——无家庭/衣物特定数据,无目标家中的专家演示,无后训练;所有评测用同一 checkpoint 与同一系统配置。脚注 3 进一步声明:评测家庭及其实体衣物的数据未用于任务特定后训练或模型选择,权重全程冻结。

原文据此下断言:"the largest-scope, lowest-adaptation-cost result reported for a real home manipulation capability"(带 "to our knowledge")。

3.2 成功率(785 次自主尝试)

成功定义:衣物被自主折叠并码放成摞

类别 成功率 ±1SE 次数
总计 99.1% 98.8–99.4% 785
短裤 100% 98
长袖上衣(厚) 100% 85
长袖上衣(薄) 100% 79
Polo 100% 46
无袖上衣 100% 7
T恤 99.0% 98.5–99.6% 312
长裤 98.8% 97.7–100% 85
打底裤 96.3% 93.7–98.9% 54
衬衫 94.7% 89.6–99.9% 19

按环境拆(同 785 次):

维度 分组 成功率 次数
起始构型 床上成堆 98.8% 514
床上篮中 100% 73
地上篮中 99.5% 198
机器人位置 床左 98.7% 315
床右 100% 271
床尾 98.5% 199
床单颜色* 浅色 99.2% 527
深色 98.0% 149
彩色 99.6% 273

* 原文注明床单颜色分组互相重叠(合计超 785)。

3.3 折叠质量(五星 rubric)

评分方式:每次尝试由标注团队用专用打分工具评判;先一人初评、再一人独立复核,分歧由复核负责人裁定;标注员事先在参考样例上受训;rubric 在评测前固定、事后未改

rubric(满分 5★,每命中一类缺陷扣 1★): - 过折:向内折入的多余材料 > 2 英寸 - 错位:对应边缘偏差 > 2 英寸 - 未折部件:袖/裤腿/帽兜伸出折边 > 2 英寸 - 码放错误:超出摞宽 1/3,或把已折的弄乱

结果(778 次完成的折叠):均值 4.72/55★ 占 73.8%、4★ 占 24.6%、3★ 占 1.67%;98.3% 达到 4★ 及以上。分品类均值从 Polo 的 4.63 到打底裤的 4.88(无袖上衣 5.00,但 n=7)。

原文另附 ACT-2 与人类折同款衣物的并排视频,称"在对齐、紧实度、码放稳定性上接近"。

3.4 速度

计时口径:从开始抓取衣物到把折好的衣物放上摞,含自主重试与恢复。778 次成功里中位 2 分 13 秒、均值 2 分 19 秒。最快短裤(中位 1.23 分),最慢薄长袖(中位 2.73 分)。

3.5 涌现行为(视频,无量化)

  • 边缘案例恢复:从地上捡回衣物、重新摆正、状态变了继续折、自发做细微调整。
  • 扰动鲁棒:小孩干扰、对抗性扰动、明暗变化下能重规划而非死执行固定序列。
  • 超出固定台面工作区:婴儿衣(16″×8″)、8XL 大衫(38″×42″)、大浴巾(53″×28″)——靠 Memo 移动底盘可挪位、调高度、探身。

4. 「Solve」标准(本文的另一半野心)

原文提出一个衡量机器人进展的标准,叫 Solve"reliable performance across a declared scope, at a stated adaptation cost." 三要素缺一不可:

  1. Performance:在声明边界内做得多好——成功率、质量、速度。
  2. Scope:这个性能被声称成立的环境/物体/构型分布。
  3. Adaptation cost:每个新部署额外需要的数据、演示、微调、人工介入或系统改造。

它的论证很干净:"99.1% 在没见过的家里零适配"和"99.1% 在一件衣服、一张准备好的台面、一个熟悉房间上"是根本不同的两个断言,尽管百分数一样——所以 demo 是糟糕的进展度量,因为每个 demo 各有各的环境、物体、起始状态、准备工作和干预规则,没有统一描述方式就无法比较、无法累积。

⚖️ 这套框架本身是好东西,尤其 Adaptation cost 这一轴——它把"换个场地要重采多少数据"从隐藏成本变成必报字段,正是当前一堆机器人 demo 最爱藏的东西。值得被抄进任何人的评测口径。

5. 口径注意(读这篇文章时必须自己补的限定)

以下每条都是从原文自身数据得出的,不是外部指控:

  1. 样本严重不均衡,总分被大类主导。785 次里 T恤占 312(40%)、短裤 98、长袖 164,而衬衫只有 19 次、无袖只有 7 次。恰恰是成功率最低的衬衫(94.7%)样本最少,其 95% 区间宽到 89.6–99.9%。99.1% 是加权后的数,不是"九类衣物各自都 99%"。
  2. "单条演示"是全文主张最强、证据最薄的一节。四个模型、每个一条演示、留出衣物——原文未给成功率、未给评测次数、未给对照,只有一句"四个都成功执行了"。而这恰是被写进开篇的"breakthrough"。
  3. 零外部基线。全文没有与 π0 / π0.5(卡片-π0.5)/ GEN-1 或任何公开模型的同任务对比,所有对照都是自家消融(0%/12%/25%/50% 预训练、高质量 vs 均匀采样)。"first / largest-scope / lowest-adaptation-cost" 全部带 "to our knowledge" 且无横向数据支撑。
  4. 标准由发布方提出,且首个按该标准自评的也是发布方。Solve 的三要素、评测边界、rubric、打分员全部来自 Sunday;"第一个 Solve"的裁判与选手是同一方。框架本身有价值不等于这次评级是独立的。
  5. 只比质量,不比速度。原文给了人机并排的折叠质量对比,却没有给人机速度对比——而中位 2 分 13 秒/件是全文最容易被外部比较的数字(人类折一件 T 恤通常在十几秒量级,🔶 推断)。能比的比了,不利的没比。
  6. "成功"口径包含自主重试。计时说明里明写"含自主重试与恢复",即一次尝试内部允许失败重来而仍记成功。这对"家用是否好用"是合理口径(用户只关心最后折没折好),但与论文里 per-step 或 one-shot 成功率不可直接比
  7. 边界排除项与前作存在张力(🔶)。ACT-1(2025-11)把 叠袜子当作"推进灵巧性前沿"的招牌任务之一大写特写;ACT-2 的洗衣 Solve 则明确把袜子排除在外,理由是"袜子的常规处理是配对而非折叠"。理由本身站得住(成团 ≠ 折叠),但这正说明"scope 由发布方声明"这件事本身可以调节难度——Solve 框架的力度取决于声明的诚实度,而它没有外部约束机制。
  8. 打分是自家人做的。两轮 + 复核负责人 + 事前固定 rubric + 事前训练标注员,流程规范度明显高于行业平均(这点该给分),但仍是内部标注,非盲评、非第三方

6. 作者自陈的局限

  • 衬衫最难,归因于"轻薄高变形、可供抓取与对齐的稳定几何线索少"(脚注 4,明标 hypothesize),并说"这不代表能力天花板,正在用后训练闭环改进"。
  • 其余能力——吸尘、玩具归位、拉拉链、裤子翻面、做咖啡——"尚未按 Solve 标准检验",只有视频。
  • 明确承认"各能力进展可能不均衡",并主张"一个所有任务都 60% 的机器人,不如少数几件事做得极可靠"。
  • 后训练方法细节留待另文。

7. 对我们

  • 可直接借鉴的两条工程结论:① 验证损失 ↔ 真机成功率强相关,可当跑真机前的廉价代理信号调数据配比;② 同等数据量下质量差 30pp——数据策展的收益是可量化的。两条都不需要有 Memo 才能用。
  • "泛化差距"这个指标值得抄。定义干净(in-domain SR − OOD SR)、可测、直指"实验室涨点是不是自欺"。比单报成功率有信息量得多。
  • Adaptation cost 应进我们自己的评测口径:任何"换个场地/换个本体要重采多少"的成本,默认必报。
  • ⚠️ 对触觉主线是一个需要正视的反例信号:全文零次提及触觉/力觉。衣物折叠是高度可变形、强自遮挡、状态几乎不重复的接触密集任务,却被"视觉 + 大规模人类动作先验 + 移动本体"推到了 99%。→ 结论不是"触觉没用",而是"触觉必要性"的论证必须更精准地指向它真正不可替代的地方(视觉观测不到的状态、需要闭环力控的插装/拧紧、滑移检测),而不是笼统的"接触密集任务"。折叠衣物已经被划出去了。
  • 注意 ACT-1 原文提过 "force sensitivity"(单手拿两只红酒杯不碎),但未说明来自何种传感——🟡 待验证,不能当作"它有触觉"的依据。
  • 形态对照:Memo 是轮式移动 + 双臂 + 与手套同构的手,非人形;本文明确把"能挪位、调高度、探身"当作超越固定台面工作区的关键——移动底盘在家务任务里是能力项而不只是形态选择

8. 待验证 / 盯更

  • 🟡 预训练数据规模(小时/episode/家庭数)、模型架构与参数量——全未披露
  • 🟡 ACT-2 的预训练是否仍严格"零机器人数据"(措辞已从 ACT-1 的 "zero robot data" 换成 "sensorized human dataset")。
  • 🟡 单条演示实验的定量结果——需等承诺的 post-training 技术文
  • 🟡 其余五项能力(吸尘/玩具/拉链/翻裤/咖啡)是否会按 Solve 标准出数。
  • 🗓 复查时点:2026 年秋——原文承诺 "This fall" 通过 Beta Program 把 Memo 投放到家庭。届时会出现第一批非 Sunday 自己产生的证据(用户实拍、媒体实测),是这批断言从"自评估"转为"可外部证伪"的时点。

来源

📄 ACT-2 Preview: Generalizing Reliability(Sunday Robotics Blog, 2026-07-17,全文抓取阅读 2026-07-26)· 📄 ACT-1: A Robot Foundation Model Trained on Zero Robot Data(2025-11-19)

相关:追踪-Sunday-Memo · 卡片-π0 · 卡片-π0.5 · 卡片-UMI · 卡片-MobileALOHA · 概念-机器人数据与标注


🔗 相关卡片
卡片-π0 · 卡片-π0.5 · 卡片-UMI · 卡片-MobileALOHA