跳转至

type: 论文卡片 domain: 大脑与模型 title: FuSe — Beyond Sight:用语言做粘合剂,把异构传感器微调进通才策略 paper: Beyond Sight: Finetuning Generalist Robot Policies with Heterogeneous Sensors via Language Grounding authors: Joshua Jones, Oier Mees, Carmelo Sferrazza, Kyle Stachowicz, Pieter Abbeel, Sergey Levine(共同一作) affil: Berkeley AI Research (BAIR), UC Berkeley venue: ICRA 2025(已接收,非预印本) arxiv: "2501.04693" date: 2026-07-19 证据等级: A links: arxiv: https://arxiv.org/abs/2501.04693 html: https://arxiv.org/html/2501.04693v3 project: https://fuse-model.github.io/ code: https://github.com/fuse-model/FuSe weights: https://huggingface.co/oier-mees/FuSe data: https://huggingface.co/datasets/oier-mees/FuSe 判断来源: 📄论文全文(v3 逐节精读)+ 🤖整理 tags: [触觉, 听觉, 多模态, 通才策略, Octo, PaliGemma, 语言接地, DIGIT, VLA, ICRA2025]


卡片 · FuSe(Beyond Sight)

📌 一句话省流:通才策略只吃视觉+本体,触觉/听觉没有大数据集可训。FuSe 的解法是——不改基座、只微调,用自然语言当所有模态的公共接地锚点:加两个辅助损失(多模态对比 + 语言生成),把新传感器挂到基座已有的语义知识上。在视觉被遮挡的场景里,靠摸和听把任务补全。 🎬 演示/资源:项目页 · 代码 · 权重 · 数据 361GB —— 四件套齐全,链接实测均可访问

🧰 对我们(可用性速判)

  • 这是"触觉进 VLA"这条线的时间原点之一(ICRA 2025 / 2025-01),卡片-Tactile-VLA卡片-ForceVLA 都晚于它并引用它。做这条线的坐标系,缺它不完整。
  • 可直接借的设计:作者明说只加 MSE 微调会让策略"过度依赖预训练模态、忽略新传感器"——两个辅助语义损失就是为了逼模型真的去用触觉/听觉。这个"新模态加了却不被用"的失败模式,我们自己做融合时一定会撞上。
  • 但要清楚它不解决什么:FuSe 不做力控、触觉只作为输入观测,动作空间仍是 Octo 原本的 delta EE 位置。要力闭环看 卡片-Tactile-VLA(力写进动作空间)/ 卡片-ForceVLA;要跨传感器泛化看 卡片-FTP-1
  • 复现门槛在数据不在算力:硬件是 WidowX + 2×DIGIT 这类便宜配置,但训练用 v5e-128 TPU pod。

亮点定位

"语言当粘合剂"具体是什么(§III):L = L_BC + β·L_gen + λ·L_contrast,β=λ=1 - L_contrast:CLIP 式对比损失,把各模态组合的观测嵌入与语言指令对齐 - L_gen:共享 Transformer 生成头,对每种模态组合做交叉熵,从观测生成语言描述 - 两个都是语义辅助损失,动作仍由 MSE 行为克隆出

配置:模态 = 第三人称 RGB + 腕部 RGB + 2× DIGIT 触觉 + 麦克风 + 9-DoF IMU + 本体感受。基座 = Octo(主实验)+ PaliGemma-3B VLA(验证 recipe 通用性)。触觉编码器用预训练 TVL encoder,音频转频谱图走 ResNet26。数据 = 26,866 条 WidowX 轨迹,Quest 2 VR 遥操作,模板化语言标注 + ChatGPT 改写扩增。

⚠️ 不是 π0 系。论文全文未引用、未对比 π0;VLA 分支是自建 PaliGemma-3B(基于 PaliVLA)。

关键数字(带来源)

⚠️⚠️ 重要口径警告论文唯一的数值表格是 Table I(多模态提示消歧)。主结果 Figure 5/6/7/8 全是没有印数值的柱状图,正文只作定性描述("considerably inferior"、"large gap")。下表数值为 🔶 读 Figure 5 柱状图估值,误差 ±0.02,非论文印刷数字——引用时必须注明。

Figure 5 主结果(🔶读图,深色柱=完整成功;斜杠前/后 = 训练物/测试物)

任务 Octo FuSe Octo Vision FT(最强基线) Octo Scratch ResNet Scratch
Tabletop Grasping 0.72 / 0.68 0.68 / 0.56 0.20 / 0.16 0.31 / 0.28
Shopping Bag(遮挡) 0.44 / 0.44 0.12 / 0.16 0.04 / 0.04 0.24 / 0.20
Button Pressing 1.00 / 0.93 0.73 / 0.64 0.13 / 0.24 0.33 / 0.31
平均 0.72 / 0.69 0.51 / 0.45 0.13 / 0.15 0.31 / 0.26

⭐ 关于流传的"高 20% 以上"(✅已核,全文 grep "20%" 命中 1 次): - 原文仅出现在 Abstract:"FuSe is able to increase success rates by over 20% compared to all considered baselines." - 它是三任务平均、对全部基线、绝对百分点(0.72 vs 0.51 ≈ 21 pp),不是遮挡场景的单项数字。 - 遮挡任务的差距其实更大:Shopping Bag 0.44 vs 纯视觉基线 0.12/0.16 ≈ 28–32 个百分点。 - ✅ 正确写法:"三任务平均比最强基线高约 20 个百分点;遮挡的购物袋任务上差距扩大到约 30 个百分点。"

Table I(唯一数值表,✅原文精确值) — 多模态提示消歧,FuSe 自身不同 prompt 对比: - (a) 视觉模糊物体:Reach 0.37→0.53、Grasp 0.34→0.37(Visual → Visual+Tactile,平均行) - (b) 触觉模糊物体:Reach 0.38→0.45、Grasp 0.35→0.35(Tactile → Visual+Tactile)

消融 Figure 7(购物袋,🔶读图):完整 FuSe 0.44/0.44 · 去生成损失 0.24/0.32 · 去 CLIP 损失 0.28/0.32 · 去全部辅助损失 0.32/0.20(测试物掉得最狠 → 泛化受损)。两个损失都要才最好。

VLA 版 Figure 8(🔶读图):PaliGemma-FuSe 在 Shopping Bag 上 0.52/0.56 反超 Octo-FuSe 的 0.44/0.44 —— 遮挡任务上 VLA 基座更强。

证据可信度

  • 证据等级:A — ICRA 2025 已接收(非预印本)+ 代码/权重/数据四件套全开源且实测可访问 + 消融充分。
  • ⚠️ 但有两处明显扣分:① 主结果无数值表,全靠柱状图,可复现核对性差;② 每场景仅 5 次 rollout(§IV-A),论文未报告任何方差/误差棒——Table I 里 0.43 这类数字分母极小,置信区间必然很宽。
  • 基线偏弱:四个基线全是 Octo Vision-only FT / Octo scratch / ResNet+FiLM scratch,没有和任何其他触觉或多模态工作横向比

复现成本

  • 硬件:WidowX 250 6-DoF(5Hz delta EE)+ 2× DIGIT + 第三人称/腕部 RGB + 麦克风(44.1kHz) + 9-DoF IMU + Quest 2(采集)。是本库里门槛最低的触觉配置之一(DIGIT 开源便宜)。
  • 算力:v5e-128 TPU pod,batch 1024,50k steps。🟡 论文未给 GPU 等价折算,也未给训练墙钟时间。
  • 数据:361 GB 下载。
  • 开源:代码 MIT(PaliVLA 部分 Apache 2.0)/ 权重 2 个 checkpoint / 数据 MIT —— 实测全部 200

局限

论文自陈(§V,只有一条):多模态训练开销大,观测历史被限制在 0.4 s;更长上下文可能改善对触觉这类稀疏信号的推理。

我们读出的(论文未说): - 单一本体:全部实验只在 WidowX 250 上做,无跨本体验证——对一个自称"通才策略微调 recipe"的工作是硬伤。 - 任务数极少:3 个任务 + 2 个组合任务,都是抓取/按按钮的短时程任务,无接触密集/力控任务。 - 音频覆盖不全:只有按钮任务有声音,抓取任务无音频 → "视触听三模态"实际从未在同一个任务里全部用上。 - 触觉编码器绑定 TVL 预训练,即绑定 DIGIT 式光学触觉图像。

🖊 批注

⭐ 论文回避的一点:Table I 里加模态主要改善的是 Reach(够向正确物体),而 Grasp 成功率几乎没涨——(a) 组 0.34→0.37,(b) 组 0.35→0.35 完全持平。正文只说 "improves over ambiguous descriptions",没讨论 Grasp 一列没动这件事

这个细节其实很有意思:多模态提示帮的是"找对东西"(语义消歧),不是"抓稳东西"(接触控制)。这恰好印证了 FuSe 的定位——它是语义接地工作,不是接触控制工作。要跨"最后一厘米",光把触觉当输入观测挂上去是不够的,这也正是 卡片-Tactile-VLA(力进动作空间)和 卡片-FTP-1(独立触觉专家)后续要解的。

卡片-FTP-1 的关系:同一问题的两代解法。FuSe 解"给单一本体的单一套传感器做语义接地微调";FTP-1 解"跨 21 种异构传感器预训练 + 迁移到未见传感器"。🟡 未核实 FTP-1 是否引用 FuSe。

来源

[1] arXiv:2501.04693v3 全文(✅ 逐节精读;v1/v3 正文实测 diff:仅致谢段不同,实验与数字完全一致) [2] ICRA 2025 接收 — 项目页 BibTeX 为 @inproceedings{... booktitle={Proceedings of the IEEE ICRA}, year={2025}};IEEE Xplore 有对应条目 [3] 资源链接实测(2026-07-19):代码 · 权重 · 数据

相关:卡片-Tactile-VLA · 卡片-ForceVLA · 卡片-FTP-1 · 综述-力与触觉基础模型


🔗 相关卡片
卡片-Tactile-VLA · 卡片-FTP-1 · 详读-Tactile-VLA · 卡片-ForceVLA