TouchWorld:让机器人"预判接触怎么演化"+"出错当场快速纠",分四个时间尺度做¶
📅 2026-07 · 🏛 哈工大(深圳)+ PHANES AI · 🏷 触觉世界模型 / 分层策略 📌 一句话省流:接触密集活既要预判接触该怎么走、又要当场反应纠正打滑/没对准/力不对。TouchWorld 把这拆成四层不同频率——慢层用视觉语言规划出"触觉子目标",中层用视频扩散世界模型预测未来 17 帧视触觉,动作层照着目标出动作块,最快层用高频触觉残差在线修正。 ≈ 打比方:像人拧螺丝——脑子先想"该拧到什么手感"(规划+预测),手照着拧(动作),一旦感觉滑了/卡了指尖立刻微调(反射)。四个环各跑各的频率。 🎬 演示:https://phanes-lab.github.io/TouchWorld-website/
🧰 对我们(可用性速判)¶
- 对我们的用处:主线正中。它是"触觉世界模型"这个新子领域里架构最完整的一篇——把"预测触觉"和"触觉反射修正"合进一个可跑的操作策略。对我们评估"双隐空间/世界模型+触觉"这条 idea,是最直接的结构参照。
- 真实性(前期):真机 6 任务 + 完整基线/消融,数字经全文逐格核证;但零开源、绑定特定手+触觉手套,可复现性差。
- 训练/微调资源:世界模型基座 = Wan2.2-TI2V-5B(视频扩散);规划器 = Qwen3-VL-4B + LoRA。预训练用大规模 EgoTouch 人类交互视频,微调 10h 真机≈108 万帧@30fps。
- 能借多少(开源):啥都没放——无 GitHub、无权重、无数据集,展示页也没写"待发布"。只能借思路。
- 可用性结论:仅思路借鉴(架构范式很值得学,但拿不到东西)。
- 📖 详读(按需):暂无。
亮点¶
- 四层按时间尺度解耦(论文自己的命名,不是"System 0/1/2"):① Subtask Planner(Qwen3-VL-4B,语义速率,出触觉子目标)→② Tactile World Model(Wan2.2-TI2V-5B 视频扩散,预测 17 帧视触觉@384×224)→③ 视触觉目标条件扩散策略(H=32 动作块)→④ Tactile-Conditioned Refinement(触觉残差 Transformer,前瞻窗 W=16、每次提交 C=4,高频反射修正)。
- 触觉世界模型是"视频扩散"路子:把触觉渲染成图像,和视觉一起当视频帧去预测未来——这与 卡片-TTP(预测触觉向量)、卡片-VT-WAM(预测 3D 形变场)是三种不同的"预测触觉"表征。
- 消融铁结论:去掉触觉输入掉得最狠("Removing tactile input causes the largest degradation")——接触观测是必需的,不是锦上添花。
🧬 与其他工作的关系¶
- 基线只有三个(论文实际对比,其余我方 agent 已核证原文无 OmniVTA/TacForeSight/VT-WM):π0.5、卡片-FTP-1(被定位为"此前单体式触觉策略")、GR00T N1.7。→ 它拿 FTP-1 当基线并超过(干净设置 65.0 vs 49.3),可回填进 FTP-1 卡的"后续对照"。
- 同期同族:卡片-TTP、卡片-VT-WAM、卡片-TACO、卡片-OmniVTA 共同构成 2026 H1 成形的"触觉世界模型"簇。
关键数字(每条带来源 [n])¶
- [1] 真机 6 任务成功率(Table 1,逐格核证):TouchWorld 65.0%(clean) / 53.7%(人为扰动);基线 π0.5 40.7/27.7、FTP-1 49.3/35.2、GR00T N1.7 39.3/26.0 → 比最强基线(FTP-1) +15.7 / +18.5pp。任务:浇花/清桌/放杯/插电源/擦锅/抽纸巾。
- [1] 世界模型:Wan2.2-TI2V-5B,预测 17 帧视触觉、384×224;LoRA rank 64。
- [1] 数据:EgoTouch 人类交互视频预训练(规模未量化)+ 10h 真机≈1.08M 帧微调。
- [1] 🟡 动作/规划细节(单轮未复验):动作空间 120 维、Planner 训练 128,866 条监督、每任务≈200 遥操作轨迹、各消融具体降幅 → 引用前回原文 Fig.5/消融表核。
- [1] 本体/传感器:Wuji 灵巧手 + JQ-Industries 触觉手套。
🔎 证据与可信度(源头决定权重)¶
- 论文:arXiv:2607.07287(2026-07-09 v2)— 📄 全文经子 agent 二/三轮 verbatim 核证。
- 代码/权重/数据:全无(连"coming soon"都没有)。
- 第三方评阅/复现:无。
- 证据等级:B → 权重:中(数字可信,但零开源 + 硬件专用压住复现价值)。
🧪 复现条件与成本(暂不亲做,只估)¶
- 硬件:Wuji 灵巧手 + JQ 触觉手套 + 人形平台(数十万级),且强绑定该感知布局。
- 数据:需 EgoTouch 级人类视频 + 10h 真机遥操作,作者均未放。
- 算力:视频扩散世界模型(5B)+VLM(4B)微调,估 8×A100 级以上。
- 时间估计:无开源,短期不可复现。
- 侧证判价值:架构完整、消融支持"触觉必需"是加分;零开源是硬减分。
💡 我的批注 / 判断¶
- ⭐ 最该记的(我的类比,非论文原话):TouchWorld 的四层——"VL 规划 / 世界模型预测 / 高频触觉反射残差"——在结构上恰好对应 追踪-千觉-Xense 通稿里 X-TouchMind 的"System 0/1/2"分层(System 0=接触后高频反馈)。区别是:TouchWorld 有真机数字、有论文;千觉那套目前只有通稿。 也就是说,千觉宣称的架构范式在学界已有可查的对应物,它的差异化更不在架构本身。(论文自己从未用 System 0/1/2 措辞,也未提千觉,这条是我方对照。)
- 对 idea 的意义:它证明"预测触觉 + 触觉反射"能装进一个策略并涨点,但代价是四层调度超参 + 特定硬件 + 零开源。对我们评双隐空间世界模型,正面价值是范式参照,反面提醒是分层世界模型的工程复杂度不低。
- 盯更点:是否补开源;长程预测(论文自陈只做短程视触觉子目标)后续怎么解。
来源编号¶
- [1] Zhou, Hong, Li, 等(哈工大深圳 / PHANES AI), TouchWorld: A Predictive and Reactive Tactile Foundation Model for Dexterous Manipulation, arXiv:2607.07287v2(Table 1 及方法节,全文核证), 2026-07-09。
相关:卡片-TTP · 卡片-VT-WAM · 卡片-TACO · 卡片-FTP-1 · 卡片-OmniVTA · 追踪-千觉-Xense
🔗 相关卡片
卡片-FTP-1 · 卡片-OmniVTA · 卡片-VT-WAM · 卡片-TTP · 卡片-TACO · 卡片-TacImag