跳转至

VT-WAM:把"预测未来视觉、预测触觉怎么变形、出什么动作"塞进同一个模型,接触时强制看触觉

📅 2026-07 · 🏛 中科院自动化所 + 国科大 + TARS + NUS + 复旦 · 🏷 视触觉世界动作模型 📌 一句话省流:在一个统一的 flow-matching 框架里同时学三样——预测未来视觉、预测触觉形变的演化、预测动作;再用"接触门控"逼着策略在接触阶段依赖触觉证据而不是视觉,去做擦、削、插等接触密集活。 ≈ 打比方:一个模型同时当"眼睛的预言家 + 指尖的预言家 + 手的规划师",而且规定"一旦碰上了,就多信指头少信眼睛"。 🎬 演示:https://vt-wam.github.io/

🧰 对我们(可用性速判)

  • 对我们的用处主线正中,且是"触觉世界模型"里触觉表征最'硬'的一篇——用 3D 形变场(不是触觉 RGB 图、不是标量力)。对我们判断"触觉进世界模型隐空间该用什么表征",是关键一票。
  • 真实性(前期):真机 6 任务 + 5 基线 + 消融表,均值 71.67%,数字逐格核证。
  • 训练/微调资源:每任务 100 条人类动觉示教、6 任务共 600 条;触觉经一个预训练 tactile VAE 编码。单任务专精,未做多任务
  • 能借多少(开源):项目页 "Code (Coming Soon)",现不可下载;无权重/数据。
  • 可用性结论思路借鉴(表征选择与注意力设计很值得学;东西暂拿不到)。
  • 📖 详读(按需):暂无。

亮点

  • 统一 flow-matching 三专家:视觉专家 f^v、触觉专家 f^t、动作专家 f^a 各预测各模态速度场,总损失 λ_v·L_v+λ_t·L_t+λ_a·L_a——"世界动作模型(WAM)"= 预测世界(视觉+触觉) + 预测动作 合一
  • 触觉表征 = 3D 形变场:每传感器 30Hz 输出 35×20 的三维形变场,经预训练 tactile VAE 编码进 latent——比 TouchWorld 的"触觉渲染成图像"、TTP 的"351 维触觉向量"更贴近力学。
  • Asymmetric MoT Attention(非对称注意力):动作只看首帧视觉锚点+完整触觉序列;触觉/动作不许改写视觉表征(保护视觉预测),触觉只锚在首帧视觉。好处:部署时省掉未来视觉预测、降算力。
  • contact-gated AVTAG(接触门控):只对"由明显触觉形变判定的接触相动作 token"施加 hinge 损失,惩罚接触阶段的'视觉主导'注意力,逼动作在接触时靠触觉。

🧬 与其他工作的关系

  • 基线(5 个,逐格对比):DP+Tactile、RDP(Reactive Diffusion Policy)、卡片-π0(π0.5)、卡片-OmniVTLA(触觉增强 VLA,把触觉直接喂动作)、Fast-WAM(只建视觉动态、无触觉的 world-action-model)。
  • 相关工作(非基线,论文明确点到)卡片-OmniVTA(预测视触觉演化 + 反射控制)、卡片-VT-WM(潜在循环状态空间联合建模视触觉做规划)。
  • 同期同族卡片-TouchWorld 卡片-TACO 卡片-TTP。⚠️ 论文原文未出现 TacForeSight,勿脑补关联。

关键数字(每条带来源 [n])

  • [1] 真机 6 任务成功率(逐格核证,总均值):VT-WAM 71.67%;基线 Fast-WAM 45.00、OmniVTLA 35.83、π0.5 32.50、RDP 34.17、DP+Tactile 21.67 → 比 Fast-WAM +26.67、比 OmniVTLA +35.84。任务:擦板/擦花瓶/削黄瓜(表面类) + 插头/刷卡/插管(约束插入类)。
  • [1] 消融(Table III,Wipe Vase/Insert Tube):去 AVTAG 85%→70% / 55%→50%;触觉只用首帧 vs 完整序列 40%/30%→70%/50%(触觉时序演化很重要);非对称略优于对称且省算力。
  • [1] 触觉:35×20 3D 形变场 @30Hz,预训练 tactile VAE 编码。
  • [1] 本体/传感器:7-DoF xArm7 + Robotiq 2F-85 + 2× Xense 触觉传感器;数据 = 人类动觉示教 600 条。

🔎 证据与可信度(源头决定权重)

  • 论文arXiv:2607.02503(2026-07-02,CC BY 4.0)— 📄 全文核证。
  • 代码/权重/数据Coming Soon,现均不可得。
  • 第三方评阅/复现:无。
  • 证据等级:B → 权重:中

🧪 复现条件与成本(暂不亲做,只估)

  • 硬件:xArm7 + 2× Xense 触觉传感器(约十万级)。
  • 数据:每任务 100 条动觉示教(作者未放)。
  • 算力:flow-matching 三专家 + tactile VAE,估 4–8×A100 级。
  • 时间估计:开源前不可复现;量小,开源后单任务较快。
  • 侧证判价值:3D 形变场表征 + 接触门控是加分;单任务专精 + 未开源是减分。

💡 我的批注 / 判断

  • ⭐ 表征之争的一票:TouchWorld 把触觉当图像、TTP 当 351 维向量、TacImag 生成力场/图、VT-WAM 用 3D 形变场 + VAE latent。这正是我们评"触觉进世界模型隐空间"要先想清的岔口——VT-WAM 押注"形变场最能表达接触力学",且消融证明"触觉时序演化"比"首帧触觉"重要得多,支持"世界模型该预测触觉的动态而非快照"。
  • 接触门控的价值:AVTAG 明确惩罚"接触时还靠视觉"——这在方法层面呼应老板判断(视觉管去哪、触觉管接触时发生什么),是难得把这个分工写进 loss 的做法。
  • 一条硬佐证:又一篇真机用 Xense(千觉)——与 卡片-TACO 一起,追踪-千觉-Xense 的"器件被真实采用"面在扩大。
  • 短板:单任务专精、每任务仅 100 条、未开源。多任务/scaling 是明显缺口。

来源编号

  • [1] Tian, Y. Zheng, Y. Zheng, 等(中科院自动化所 / 国科大 / TARS / NUS / 复旦), VT-WAM: Visual-Tactile World Action Model for Contact-Rich Manipulation, arXiv:2607.02503(主表 + Table III,全文核证), 2026-07-02。

相关:卡片-TouchWorld · 卡片-TACO · 卡片-TTP · 卡片-OmniVTA · 卡片-VT-WM · 卡片-OmniVTLA · 卡片-π0 · 追踪-千觉-Xense


🔗 相关卡片
卡片-π0 · 卡片-OmniVTLA · 卡片-OmniVTA · 卡片-VT-WM · 卡片-TTP · 卡片-TACO · 卡片-TouchWorld · 卡片-TacImag