FreeTacMan:不要机器人也不要摇杆,把触觉传感器直接绑到人的指尖上¶
📅 2025-06(v4 2026-03) · 🏛 上海创智学院 + 港大 + 上交 + 复旦 · 🏷 采集系统 + 数据集 📌 一句话省流:采接触密集的操作数据,以前要么遥操机器人(慢、贵)、要么手持一个"带夹爪的杆"(UMI 那种)。FreeTacMan 干脆把视触觉传感器做成能绑在人手指尖上的小夹爪——你用自己的手指去捏、去插、去写字,手感一点不隔,同时录下视觉+触觉+位姿。用它采了 50 个任务、1 万+条轨迹、300 万+对视触觉图像。 ≈ 打比方:别人是"隔着一根钳子摸东西",它是"戴了个薄手套直接摸"——中间的机械传动从 4 段减到 1 段。 🎬 项目页 · 代码 · 数据(HF·MIT)
🧰 对我们(可用性速判)¶
- 对我们的用处:高,且是少见的"硬件+数据+方法"三件齐全。
- ① 数据可直接取用:300 万+视触觉图像对、MIT 协议、已实测匿名免登录可取字节(
gated=False,24,915 个文件,主体是 18,484 个 mp4 + 6,428 个 csv,按任务分目录如ArrangeFruit/ArrangeFruit_100_camera1.mp4)。⚠️ 不做"规模最大"之类的排序断言(未做横向查新);就体量而言,卡片-FTP-1 以小时计更大但是聚合 26 个来源,本数据集是单一系统自采、协议宽松,两者不同性质。 - ② 硬件开源、且用的是现货臂:Piper(6-DOF·轻载)/ Franka(7-DOF·高精度),传感器基于 McTac——正是我们 卡片-ReactiveDiffusionPolicy 那条线用的传感器之一。
- ③ 它的"跨传感器"结论直接接我们的主线:见下 Table IV,不做预训练时换一批传感器成功率从 75% 崩到 10%,做了预训练则 80%→80% 纹丝不动。这是"触觉表征必须跨传感器"这件事迄今最直观的一个代价量化。
- 真实性(前期):论文 + 开源代码 + 开源数据(已实测可下) + 12 人用户研究 + 每条轨迹回放验证 → 证据 A。
- 训练/微调资源:策略是 ACT(不是大模型),预训练是 ResNet backbone + CLIP 式对比学习。门槛低,论文未报 GPU 型号/时长(🟡 未给)。
- 能借多少(开源):代码 ✅、数据 ✅(MIT)、硬件图纸 ✅(项目页给 3D 模型和各臂适配件)、传感器 ✅(McTac 系,可自制)。
- 可用性结论:直接可用——数据可取、硬件可复刻。但复现整套采集需要一台光学动捕(见局限),这是真门槛。
亮点到底在哪(读核心后定位)¶
- 亮点是一个机械洞见,不是算法:手持式采集(UMI/FastUMI/ViTaMIn)为了做出夹爪,人手到物体之间要经过4 段机械传动,每一段的间隙都会把触觉信号"糊"掉。FreeTacMan 把传感器做成贴在指尖的模块,人手→传感器→物体只有 1 段,作者称之为 in-situ(原位)。Table I 里他们干脆把"传动段数"当成一个可量化指标来比。
- 配套的两个机械设计:线性传动(镀铬钢轴+直线轴承,把手指运动约束成高精度直线,轴向偏差 0.02 mm 量级)+ 倒置曲柄滑块,传动效率 >90%。整机 157.5 g / 145×85×106 mm。
- 算法侧的关键一招是"时序感知"的对比预训练:CLIP 式对齐视觉和触觉,但除了同时刻的正样本,还加了"下一时刻"作为第二正样本。作者的理由很实在——只用同时刻对齐会让触觉嵌入跳变,抓不住接触是怎么演化的。
- 消融告诉我们钱花在哪:平均成功率 21%(纯视觉)→ 55%(加触觉)→ 71%(再加预训练)。加触觉那一步贡献最大(+34pp),预训练再补 +16pp。
关键数字(逐条核过原表 [1])¶
- [✅已核 §IV-A] 数据集:50 个任务 / 10,000+ 条轨迹 / 3,000,000+ 对视触觉图像。每帧含:腕部相机 RGB + 2 张视触觉图 + 末端位姿 + 夹爪开度,30 Hz 同步、本体无关。每条轨迹都回放验证过。
- [✅已核 §III-B] 位姿用 NOKOV 光学动捕,240 Hz,亚毫米;5 个反光 marker(3 个在顶板测位姿、2 个在夹爪测相对位移);用 IKPY 解逆运动学映射到目标本体。
- [✅已核 Table II·每任务 20 次试验] 策略成功率(%):
| 方法 | 易碎杯 | 书法 | 纹理分类 | 盖章 | USB插入 | 平均 |
|---|---|---|---|---|---|---|
| ACT(纯视觉) | 35 | 20 | 20 | 30 | 0 | 21 |
| +触觉(无预训练) | 75 | 70 | 55 | 65 | 10 | 55 |
| +触觉+预训练 | 80 | 90 | 85 | 80 | 20 | 71 |
- [✅已核 Table IV] 跨传感器泛化(本卡最该记的一组)——换用 marker 角度 0°→45°、打光侧面→底部的另一批传感器:
- 易碎杯整任务:无预训练 75% → 10%(崩掉);有预训练 80% → 80%(完全不掉)。
- 纹理分类整任务:无预训练 55% → 40%;有预训练 85% → 75%。
- [✅已核 Table III] 未见过的物体(纹理分类换成分布外的红色):纯视觉 20%→15%;加触觉 55%→55%(不掉);加预训练 85%→70%。
- [✅已核 Fig.8] 数据效率:只给 50 条任务演示,预训练版就有 易碎杯 55% / 书法 50% / 纹理 60%,而纯视觉基线是 35% / 20% / 20%。
- [✅已核 §IV-C·12 名志愿者] 采集效率对比(CPUT = 完成率×效率):比遥操作(ALOHA) 高 5.05×,比 UMI 高 1.52×;完成时间比 ALOHA 快 2.65×、比 UMI 快 1.22×。⚠️ 原文只给柱状图,未给数值表,此处只引用正文明写的倍数。
🧬 与其他工作的关系¶
- 明确对标三类采集范式(Table I):遥操 VR/AR(卡片-ARCap、卡片-DexCap、TactAR)· 主从遥操(卡片-ALOHA、卡片-GELLO)· 手持式(卡片-UMI、FastUMI、ViTaMIn)。它给自己新开了一档叫 in-situ。
- 同门血脉:传感器基于 McTac,而 McTac 正是 卡片-ReactiveDiffusionPolicy(RDP/TactAR)用的传感器之一;Jieji Ren、Guoying Gu 是两篇的共同作者(上交软体机器人线)。→ 这是同一条上交视触觉硬件谱系上长出来的两个产物:RDP 解决"怎么用触觉做快慢两级控制",FreeTacMan 解决"触觉数据怎么采得多、采得准"。
- 区别于既有触觉数据集:作者指出现有视触觉数据集多服务于感知任务(位姿跟踪/跨模态生成/表征学习/触觉描述),覆盖不了完整操作过程;且多用压阻/霍尔式阵列传感器(空间分辨率低、串扰、易受环境干扰)。
🔎 证据与可信度¶
- 论文:arXiv 2506.01941v4(v1 2025-06-02,v4 2026-03-09,cs.RO)。作者 Longyan Wu*、Checheng Yu*、Jieji Ren*、Li Chen、Yufei Jiang、Ran Huang、Guoying Gu、Hongyang Li(上海创智学院 / 港大 / 上交 / 复旦 / 上大)。
- ⚠️ 会议信息:🔶 项目方在其 HF README 自述 "ICRA 2026",但 arXiv 元数据无 comment / journal_ref 字段,正文也未标注。属作者第一方自述、未见独立确认——比第三方聚合站的转述可信,但仍不当已核事实用。
- 代码/数据:均已开放。数据 MIT,我们已实测 HF 仓库免登录可读(24,915 文件)。
- 第三方复现/评阅:暂无。
- 证据等级:A。
⚠️ 局限¶
⚠️ 论文没有独立的局限章节,只在正文顺带提了 USB 任务的改进方向。以下第 1、3 条是我们的观察,非作者自陈。 - [🧑观察·最重要] "免机器人"不等于"免场地"——它把对机器人的依赖换成了对光学动捕的依赖。NOKOV 那套动捕在文中全程只作为优点出现("避免 IMU 漂移和 SLAM 误差"),但代价没被讨论:UMI 那类手持式最大的卖点恰恰是能拎着去任意现场采,而 FreeTacMan 必须在动捕覆盖的空间里采。对"数据规模化"这个初衷来说,这是个实打实的反向约束。 - [作者自陈] 高精度任务仍然很差:USB 插入即使全套上也只有 20%。作者归因于逆运动学精度不足 + 插入动力学建模不够,说未来要上更高精度的臂和强化学习。 - [🧑观察] 任务集偏"桌面小件":50 个任务虽多,但都是捏/插/写/盖/擦这类小尺度接触,没有重载、没有双臂协同、没有移动。 - [数据核过] 触觉带来的增益随任务类型差别极大:书法 +70pp、纹理分类 +65pp,但 USB 只有 +20pp。"接触密集"不是一个均质的类别。
💡 我的批注 / 判断(判断来源:🤖Claude,待🧑复核)¶
- 最该带走的是 Table IV 那组跨传感器数字:不预训练时换一批传感器(只是 marker 角度和打光变了)就从 75% 崩到 10%,预训练后 80%→80% 纹丝不动。 这给"触觉表征必须跨传感器"提供了一个代价量化——不是"泛化差一点",是归零。这和 卡片-T3 / 卡片-AnyTouch / 卡片-FTP-1 那条跨传感器主线是同一个问题的两端:他们证明"能对齐",这篇证明"不对齐会死"。
- 和 卡片-LESS-触觉成像 拼起来看有意思:LESS 说的是"触觉表征要带空间结构",FreeTacMan 说的是"触觉表征要跨传感器硬件"。两篇都在说同一件事的不同侧面——把触觉压成一个跟具体硬件、具体位置绑死的全局向量,是当前触觉表征最脆的地方。
- 一条给我们自己采数据的实用启发:它的时序感知预训练(除同时刻外再加"下一时刻"当正样本)动机很朴素——只对齐同时刻会让嵌入跳变、抓不住接触演化。这个技巧很便宜,值得在我们自己的触觉编码上试。
- 一个诚实的提醒:论文摘要说"平均成功率比纯视觉高 50%",实际是 21%→71%,即 +50 个百分点(相对 3.4 倍)。这个表述容易被二次传播成"提升 50%",引用时务必写成百分点。
来源编号¶
- [1] arXiv 2506.01941v4 · 项目页 · 代码 · 数据 · 本地全文
papers/FreeTacMan-RobotFreeVisuoTactile-2506.01941.txt(pdftotext)。硬件参数/数据规模/Table I–IV 全部逐条核实(2026-07-27);用户研究只有柱状图,仅引正文明写的倍数;HF 仓库文件构成为我们直接调 API 实测。
🔗 相关卡片
卡片-AnyTouch · 卡片-T3 · 卡片-FTP-1 · 卡片-ReactiveDiffusionPolicy · 卡片-UMI · 卡片-LESS-触觉成像 · 卡片-ALOHA · 卡片-DexCap