TTP:让机器人先看人类视频「学会摸」,再迁移到真手上¶
📅 2026-07 · 🏛 北京大学 + BeingBeyond(卢宗青组) · 🏷 触觉预训练 / VLA 📌 一句话省流:把 160 小时人类第一视角操作视频里的"手碰到没碰到东西"抠出来当触觉信号,先在这上面预训练一个带"触觉专家"的 VLA,再迁移到真机灵巧手/夹爪上——接触密集任务成功率大幅超过不带触觉的 SOTA。 ≈ 打比方:不给机器人真装一堆触觉传感器去攒数据(贵、慢),而是让它先看海量人做事的录像,从"手和物体贴合的几何"里推算出触觉去打底,再上真机补课。 🎬 演示:项目页 https://beingbeyond.github.io/TTP/(2026-07-25 实测 404,待上线)
🧰 对我们(可用性速判)¶
- 对我们的用处:直接命中主线。它是继 卡片-EgoSteer(人类视频预训练 VLA,作者自陈"全程缺触觉"是硬伤)之后,把"缺触觉"这个缺口用一种具体做法补上的工作——但补的是粗粒度的"接触发生/未发生",不是 卡片-OmniTacTune 讲的"接触时到底发生了什么"。老板的判断(视觉管去哪、触觉管接触时发生什么)在这里只被满足了一半。
- 真实性(前期):论文实验扎实(9 个真机任务 + LIBERO/RoboCasa 仿真 + 完整消融),数字均抄自全文;但"触觉"多为合成/代理信号,不是实测力/纹理(见局限),成色要打折。
- 训练/微调资源:基座 = BeingH-0.5(VLA),扩为三专家(理解/动作/触觉);数据 160h/135k episodes。具体 GPU×时长论文未给。
- 能借多少(开源):论文声称 H-Tac 数据集 open-source;BeingBeyond 的 GitHub org 公开(JALA、Being-H0.5 有码有权重),但本作专属代码/数据/项目页 2026-07-25 均未见可下载链接 🟡。
- 可用性结论:思路借鉴 + 阵营证据为主;待开源坐实后可评估复现。
- 📖 详读(按需):暂无,全文要点已并入本卡关键数字节。
亮点¶
- 触觉当"未来预测目标",不是当输入:训练时模型同时预测未来动作
A_t和未来触觉O_t⁺(flow matching 双头),把接触动力学建进预训练,而不是推理期硬塞一路触觉输入。 - 统一空间做人→机迁移:统一动作空间 200 维(含末端位姿/夹爪/灵巧手/人手 MANO 参数)+ 统一触觉空间 351 维(
UniTacHand,基于 MANO 网格的虚拟 taxel 表示,保持形态一致性)——让"人手数据"和"机器手数据"落在同一坐标系。 - 触觉标签是"算"出来的:
HOI-Tac子集把手部 MANO 网格与物体网格的距离阈值转成二值接触标签,投影到 351-taxel UV 空间——所以能白嫖 11 个公开手-物交互数据集(ARCTIC/DexYCB/H2O…)当触觉预训练料。 - 触觉-动作流形门控(MPG):用 Sliced-Wasserstein 距离算观测-动作/触觉的分布差,生成"可靠性门"调制残差增强,稳住训练。
🧬 与其他工作的关系¶
- 承接谁:基座是本组 BeingH-0.5(人类视频 → 跨本体 VLA 那条线);把 卡片-EgoSteer 明说的"缺触觉"缺口接了过来。
- 区别/推进 vs 卡片-FTP-1:FTP-1 用真实、异构触觉传感器数据(21 种传感器)做可迁移预训练;TTP 用人类视频 + 合成/虚拟触觉。两者都在证一件事——"异构/非原生的触觉预训练也能 scale 且可迁移",因此同属一个阵营,共同构成对千觉通稿"触觉必须原生自闭环"的反证据(见 追踪-千觉-Xense §6 的路线分叉)。
- 同期撞车:UniTacVLA(arXiv:2606.31723,统一触觉潜空间 + 触觉预测)思路高度重叠,可并列观察;均把"预测未来触觉"作为核心机制。
关键数字(每条带来源 [n])¶
- [1] H-Tac 数据集:160h 第一视角人类视频、300+ 任务、135k episodes。三块拼成:HOI-Tac ≈106h/11.5M 帧/124.8K 序列(从 11 个公开手-物交互集合成触觉标签);DeskTask-Tac 37.2h/947 ep/≈4M 帧(自采双手桌面,3× RealSense);InternData-Tac 17.8h/9,563 ep/≈1.9M 帧(增强 InternData,含 Genie1/Lift2/Split-ALOHA)。
- [1] 真机 9 任务成功率(TTP vs π0.5 / π0.5+tactile / BeingH-0.5 / TTP-无预训练):PaperFolding 84% vs 0/4/12/57;PickPlaceChips 80% vs 10/20/10/60;VaseWiping 单手 100% vs 30/50/50/70;双手 90% vs 50/40/70/60;SoftHard 80%。
- [1] 插入类仍很低(诚实项):PlugIn(夹爪)20%、PlugIn(DexBotic 灵巧手)10%,其余基线多为 0%。
- [1] 仿真:LIBERO 平均 98.1%(与 BeingH-0.5 98.0% 持平);LIBERO-plus 零样本 65.3%;RoboCasa 55.1%。
- [1] 消融:完整 TTP MPJPE 23.57,去掉 MPG 或去掉触觉预测均变差(→24.55/24.76/25.59);数据 10%→100%,MPJPE 33.19→23.57(可 scale)。
- [1] 真机平台:Franka(7-DoF)/Realman(6-DoF) 臂;Inspire 手(6-DoF+压阻触觉)、DexBotic 手(12-DoF+3D触觉)、DM-Tac 夹爪(视触觉)。
🔎 证据与可信度(源头决定权重)¶
- 论文:arXiv:2607.01067(2026-07-01,CC BY 4.0)— 📄 全文已读。
- 代码:BeingBeyond org 公开,本作专仓未确认 → 部分/待发布。
- 数据:论文称 H-Tac open-source,下载链接未见 🟡 ← 最看重,待核。
- 第三方评阅/复现:无(arXiv 预印本,未见复现帖)。
- 证据等级:B → 权重:中(论文数字可信度高;但触觉信号合成成色 + 开源未坐实,压住上限)。
🧪 复现条件与成本(暂不亲做,只估)¶
- 硬件:Franka/Realman + Inspire/DexBotic 手 + DM-Tac 夹爪,触觉传感器需自备(数万~十万级)。
- 数据:作者称已放 H-Tac(待核);否则需自采人类视频 + MANO 拟合管线。
- 算力:VLA 全量预训练(BeingH-0.5 规模),估 8×A100 级以上,论文未给具体 step。
- 时间估计:开源坐实前不可估;数据/代码齐全后约数周起。
- 侧证判价值:数字实、消融支持 scale 是加分;触觉合成 + 开源未落地是减分。
💡 我的批注 / 判断¶
- 最该记的一点:TTP 证明了"从人类视频里合成触觉来预训练"这条路走得通且能 scale——但它的"触觉"在 HOI-Tac 部分本质是手-物几何贴合的二值接触,是"碰到没碰到",不是力/滑移/纹理。这正好卡在老板判断的分界线上:它把"接触发生"这半边做好了,"接触时发生什么"那半边(OmniTacTune / FTP-1 的真触觉信号)仍是空的。对我们,它是"用视觉几何近似触觉"的上限参照,不是触觉本身的替代。
- 对路线分叉的意义:和 卡片-FTP-1 一起,TTP 让"异构/非原生触觉可迁移"这一侧的证据又厚了一层。千觉通稿主张的"原生自闭环否则污染能力",到目前为止缺少能压过这两篇的公开证据。这条分叉仍是本主线最值得继续盯的判断题。
- 盯更点:H-Tac 数据集与本作代码何时真上线(项目页现 404);插入类任务 10-20% 的低成功率是否在后续版本改善——那是"合成触觉"粗粒度的直接体现。
来源编号¶
- [1] Zhang, Cai, Xi, Yuan, Luo, W. Zhang, Zheng, Xu, Lu(北京大学 / BeingBeyond), Human-Centric Transferable Tactile Pre-Training for Dexterous Robotic Manipulation, arXiv:2607.01067 / HTML 全文(表 2/5/7/8 及方法节), 2026-07-01。
相关:卡片-EgoSteer · 卡片-FTP-1 · 卡片-OmniTacTune · 追踪-千觉-Xense
🔗 相关卡片
卡片-OmniTacTune · 卡片-FTP-1 · 卡片-VT-WAM · 卡片-TACO · 卡片-EgoSteer · 卡片-TouchWorld · 卡片-TacImag