跳转至

TTP:让机器人先看人类视频「学会摸」,再迁移到真手上

📅 2026-07 · 🏛 北京大学 + BeingBeyond(卢宗青组) · 🏷 触觉预训练 / VLA 📌 一句话省流:把 160 小时人类第一视角操作视频里的"手碰到没碰到东西"抠出来当触觉信号,先在这上面预训练一个带"触觉专家"的 VLA,再迁移到真机灵巧手/夹爪上——接触密集任务成功率大幅超过不带触觉的 SOTA。 ≈ 打比方:不给机器人真装一堆触觉传感器去攒数据(贵、慢),而是让它先看海量人做事的录像,从"手和物体贴合的几何"里推算出触觉去打底,再上真机补课。 🎬 演示:项目页 https://beingbeyond.github.io/TTP/(2026-07-25 实测 404,待上线)

🧰 对我们(可用性速判)

  • 对我们的用处直接命中主线。它是继 卡片-EgoSteer(人类视频预训练 VLA,作者自陈"全程缺触觉"是硬伤)之后,把"缺触觉"这个缺口用一种具体做法补上的工作——但补的是粗粒度的"接触发生/未发生",不是 卡片-OmniTacTune 讲的"接触时到底发生了什么"。老板的判断(视觉管去哪、触觉管接触时发生什么)在这里只被满足了一半
  • 真实性(前期):论文实验扎实(9 个真机任务 + LIBERO/RoboCasa 仿真 + 完整消融),数字均抄自全文;但"触觉"多为合成/代理信号,不是实测力/纹理(见局限),成色要打折。
  • 训练/微调资源:基座 = BeingH-0.5(VLA),扩为三专家(理解/动作/触觉);数据 160h/135k episodes。具体 GPU×时长论文未给。
  • 能借多少(开源):论文声称 H-Tac 数据集 open-source;BeingBeyond 的 GitHub org 公开(JALA、Being-H0.5 有码有权重),但本作专属代码/数据/项目页 2026-07-25 均未见可下载链接 🟡。
  • 可用性结论思路借鉴 + 阵营证据为主;待开源坐实后可评估复现。
  • 📖 详读(按需):暂无,全文要点已并入本卡关键数字节。

亮点

  • 触觉当"未来预测目标",不是当输入:训练时模型同时预测未来动作 A_t 和未来触觉 O_t⁺(flow matching 双头),把接触动力学建进预训练,而不是推理期硬塞一路触觉输入。
  • 统一空间做人→机迁移:统一动作空间 200 维(含末端位姿/夹爪/灵巧手/人手 MANO 参数)+ 统一触觉空间 351 维UniTacHand,基于 MANO 网格的虚拟 taxel 表示,保持形态一致性)——让"人手数据"和"机器手数据"落在同一坐标系。
  • 触觉标签是"算"出来的HOI-Tac 子集把手部 MANO 网格与物体网格的距离阈值转成二值接触标签,投影到 351-taxel UV 空间——所以能白嫖 11 个公开手-物交互数据集(ARCTIC/DexYCB/H2O…)当触觉预训练料。
  • 触觉-动作流形门控(MPG):用 Sliced-Wasserstein 距离算观测-动作/触觉的分布差,生成"可靠性门"调制残差增强,稳住训练。

🧬 与其他工作的关系

  • 承接谁:基座是本组 BeingH-0.5(人类视频 → 跨本体 VLA 那条线);把 卡片-EgoSteer 明说的"缺触觉"缺口接了过来。
  • 区别/推进 vs 卡片-FTP-1:FTP-1 用真实、异构触觉传感器数据(21 种传感器)做可迁移预训练;TTP 用人类视频 + 合成/虚拟触觉。两者都在证一件事——"异构/非原生的触觉预训练也能 scale 且可迁移",因此同属一个阵营,共同构成对千觉通稿"触觉必须原生自闭环"的反证据(见 追踪-千觉-Xense §6 的路线分叉)。
  • 同期撞车:UniTacVLA(arXiv:2606.31723,统一触觉潜空间 + 触觉预测)思路高度重叠,可并列观察;均把"预测未来触觉"作为核心机制。

关键数字(每条带来源 [n])

  • [1] H-Tac 数据集:160h 第一视角人类视频、300+ 任务、135k episodes。三块拼成:HOI-Tac ≈106h/11.5M 帧/124.8K 序列(从 11 个公开手-物交互集合成触觉标签);DeskTask-Tac 37.2h/947 ep/≈4M 帧(自采双手桌面,3× RealSense);InternData-Tac 17.8h/9,563 ep/≈1.9M 帧(增强 InternData,含 Genie1/Lift2/Split-ALOHA)。
  • [1] 真机 9 任务成功率(TTP vs π0.5 / π0.5+tactile / BeingH-0.5 / TTP-无预训练):PaperFolding 84% vs 0/4/12/57;PickPlaceChips 80% vs 10/20/10/60;VaseWiping 单手 100% vs 30/50/50/70;双手 90% vs 50/40/70/60;SoftHard 80%
  • [1] 插入类仍很低(诚实项):PlugIn(夹爪)20%、PlugIn(DexBotic 灵巧手)10%,其余基线多为 0%。
  • [1] 仿真:LIBERO 平均 98.1%(与 BeingH-0.5 98.0% 持平);LIBERO-plus 零样本 65.3%;RoboCasa 55.1%
  • [1] 消融:完整 TTP MPJPE 23.57,去掉 MPG 或去掉触觉预测均变差(→24.55/24.76/25.59);数据 10%→100%,MPJPE 33.19→23.57(可 scale)。
  • [1] 真机平台:Franka(7-DoF)/Realman(6-DoF) 臂;Inspire 手(6-DoF+压阻触觉)、DexBotic 手(12-DoF+3D触觉)、DM-Tac 夹爪(视触觉)。

🔎 证据与可信度(源头决定权重)

  • 论文arXiv:2607.01067(2026-07-01,CC BY 4.0)— 📄 全文已读。
  • 代码:BeingBeyond org 公开,本作专仓未确认 → 部分/待发布。
  • 数据:论文称 H-Tac open-source,下载链接未见 🟡 ← 最看重,待核。
  • 第三方评阅/复现:无(arXiv 预印本,未见复现帖)。
  • 证据等级:B → 权重:中(论文数字可信度高;但触觉信号合成成色 + 开源未坐实,压住上限)。

🧪 复现条件与成本(暂不亲做,只估)

  • 硬件:Franka/Realman + Inspire/DexBotic 手 + DM-Tac 夹爪,触觉传感器需自备(数万~十万级)。
  • 数据:作者称已放 H-Tac(待核);否则需自采人类视频 + MANO 拟合管线。
  • 算力:VLA 全量预训练(BeingH-0.5 规模),估 8×A100 级以上,论文未给具体 step。
  • 时间估计:开源坐实前不可估;数据/代码齐全后约数周起。
  • 侧证判价值:数字实、消融支持 scale 是加分;触觉合成 + 开源未落地是减分

💡 我的批注 / 判断

  • 最该记的一点:TTP 证明了"从人类视频里合成触觉来预训练"这条路走得通且能 scale——但它的"触觉"在 HOI-Tac 部分本质是手-物几何贴合的二值接触,是"碰到没碰到",不是力/滑移/纹理。这正好卡在老板判断的分界线上:它把"接触发生"这半边做好了,"接触时发生什么"那半边(OmniTacTune / FTP-1 的真触觉信号)仍是空的。对我们,它是"用视觉几何近似触觉"的上限参照,不是触觉本身的替代。
  • 对路线分叉的意义:和 卡片-FTP-1 一起,TTP 让"异构/非原生触觉可迁移"这一侧的证据又厚了一层。千觉通稿主张的"原生自闭环否则污染能力",到目前为止缺少能压过这两篇的公开证据。这条分叉仍是本主线最值得继续盯的判断题。
  • 盯更点:H-Tac 数据集与本作代码何时真上线(项目页现 404);插入类任务 10-20% 的低成功率是否在后续版本改善——那是"合成触觉"粗粒度的直接体现。

来源编号

  • [1] Zhang, Cai, Xi, Yuan, Luo, W. Zhang, Zheng, Xu, Lu(北京大学 / BeingBeyond), Human-Centric Transferable Tactile Pre-Training for Dexterous Robotic Manipulation, arXiv:2607.01067 / HTML 全文(表 2/5/7/8 及方法节), 2026-07-01。

相关:卡片-EgoSteer · 卡片-FTP-1 · 卡片-OmniTacTune · 追踪-千觉-Xense


🔗 相关卡片
卡片-OmniTacTune · 卡片-FTP-1 · 卡片-VT-WAM · 卡片-TACO · 卡片-EgoSteer · 卡片-TouchWorld · 卡片-TacImag