TACO:让带触觉的世界模型"脑补"出机器人该怎么从接触失败里爬出来,再回灌去训 VLA¶
📅 2026-07 · 🏛 北京大学 + AI2 Robotics + 中山大学 + 北航 · 🏷 触觉世界模型 / VLA 自纠正后训练 📌 一句话省流:VLA 干接触活会失败,教它"从失败恢复"通常得靠人盯着一遍遍纠(贵)。TACO 换招——用一个带触觉的世界模型去"想象"出局部纠错片段并自动打上可执行动作标签,回灌进 VLA 后训练,不用人工干预就规模化教会"接触失败恢复"。 ≈ 打比方:不请老师傅手把手纠错,而是让 AI 在脑内排练出错后怎么补救、还自己写下补救动作,拿这些排练当教材。 🎬 演示:https://taco-wm.github.io/
🧰 对我们(可用性速判)¶
- 对我们的用处:给"触觉世界模型"提供了第三种用法——不是当动作预测器(TouchWorld/VT-WAM)、也不是当硬件替身(TacImag),而是当数据引擎/自纠正器。对我们思考"世界模型怎么低成本喂策略"这条,是很实的一招。
- 真实性(前期):真机 6 任务 + 多组消融,Base 0.38→0.82 提升明确;数字经全文两轮核证。
- 训练/微调资源:基座 = π0.5(PaliGemma 22B + 300M action expert);每任务仅 50 条遥操作 warm-start,靠想象数据放大(真实:想象≈1:4~1:5)。
- 能借多少(开源):项目页在,但代码/数据是否已发布未明说 🟡——勿当"已开源"写。
- 可用性结论:思路借鉴为主(自纠正范式可迁移;能否复现看开源)。
- 📖 详读(按需):暂无。
亮点¶
- Recognize–Imagine–Label 闭环:① 统一"进度-动作模型"吃 RGB+力/触觉,输出动作和任务进度 p∈[0,1],用"进度停滞/下降"处定位失败邻近状态;② 视触觉生成模型联合去噪未来视频+力序列(Temporal RoPE 把力 token 对齐到视频时间轴)想象纠错片段;③ 同一模型给想象片段打可执行动作标签。
- 触觉在两处都不可少:既约束"想象"(纯视觉世界模型会生成视觉合理但接触不一致的轨迹),又用于"标记"纠错动作。消融证实——去触觉生成掉到 28%、去触觉标记掉到 65%(满血 82%)。
- 不损伤 VL 先验的隔离式适应:Knowledge-insulated tactile adaptation——阻断触觉-动作梯度更新预训练 VLM 主干,触觉只经 adaRMSNorm 注入 action expert;配 advantage-conditioned training(CFG,推理时用正优势条件鼓励高进度恢复行为)。
🧬 与其他工作的关系¶
- 基线:Base(warm-start 的 π0.5)、Filtered BC(筛成功 rollout 做 SFT)、TACO w/o KI(想象纠错但全量微调、无知识隔离)。
- 对照的旧路线:DAgger/IntervenGen/ARMADA 等靠人工干预采纠错数据——TACO 卖点正是用世界模型想象替代人工干预。
- 同期同族:论文相关工作点名 卡片-OmniVTA、卡片-OmniVTLA 等触觉世界模型/触觉增强 VLA;与 卡片-TouchWorld 卡片-VT-WAM 卡片-TTP 同属 2026 H1 触觉世界模型簇。
关键数字(每条带来源 [n])¶
- [1] 真机 6 任务(Insert Flower/Wipe Whiteboard/Twist Bottle Cap/Play Xylophone/Toast Bread/Move Hanoi Rings)均值:Base 0.38 → TACO 第2轮迭代 0.82(+44% 绝对);比无知识隔离版 0.50 → +32%。
- [1] 消融:去触觉生成→28%、去触觉标记→65%(满血 82%);想象数据规模 真实:想象 1:2→70% / 1:4→93% / 1:8→97%;失败邻近锚点换均匀采样 Wipe 65%→25%(选"进度停滞处"极关键)。
- [1] 本体/传感器:单臂 Franka FR3 + 平行夹爪 + Xense 触觉传感器(6D 力/力矩) + RealSense D455。
- [1] 基座:π0.5(PaliGemma 22B + 300M action expert)。
🔎 证据与可信度(源头决定权重)¶
- 论文:arXiv:2607.02840(2026-07-03)— 📄 全文两轮核证。
- 代码/数据:项目页在,发布状态未明 🟡(勿写"已开源")。
- 第三方评阅/复现:无。
- 证据等级:B → 权重:中。
🧪 复现条件与成本(暂不亲做,只估)¶
- 硬件:Franka FR3 + Xense 触觉传感器(十万级)。
- 数据:每任务 50 条遥操作 warm-start(作者自采,规模小是优点),想象数据自生成。
- 算力:π0.5(22B) 后训练 + 视触觉生成模型,估 8×A100 级。
- 时间估计:若代码开放,数据量小、有望较快复现单任务。
- 侧证判价值:小样本 + 想象放大是加分;开源未坐实是待核项。
💡 我的批注 / 判断¶
- ⭐ 对我们最有用的一点:TACO 把"触觉世界模型"当廉价纠错数据发生器——每任务 50 条真示教就能靠想象放大到高成功率。这对我们(数据/算力受限、正评双隐空间世界模型)是比 TouchWorld 更接地气的用法:不追求端到端大架构,而是拿世界模型当数据飞轮的一环。
- 一条硬佐证:TACO 真机用的是 Xense(千觉)触觉传感器 → 与 卡片-VT-WAM 一样,坐实 追踪-千觉-Xense "器件已在多篇触觉×VLA 实验台上"的判断,且采用面在扩大。
- 诚实短板:作者自陈想象纠错是离线生成、非在线;且相关工作节的具体引用条目我方标🟡(小模型抓取可能串名),写"撞车"前需回原文 references 核。
- 盯更点:代码是否真开放;在线纠错生成后续能否做出来。
来源编号¶
- [1] Liu, Jia, Yan, 等(北京大学 / AI2 Robotics / 中山大学 / 北航), TACO: TActile World Model as a Self-COrrector for Scalable VLA Post-Training, arXiv:2607.02840(Table 1 及方法/消融节,全文核证), 2026-07-03。
相关:卡片-TouchWorld · 卡片-VT-WAM · 卡片-TTP · 卡片-OmniVTA · 卡片-OmniVTLA · 卡片-π0 · 追踪-千觉-Xense
🔗 相关卡片
卡片-π0 · 卡片-OmniVTLA · 卡片-OmniVTA · 卡片-VT-WAM · 卡片-TTP · 卡片-TouchWorld · 卡片-TacImag