跳转至

LESS:触觉本来就是"局部"的——把表征按空间拆开,泛化就自己出来了

📅 2026-06 · 🏛 Technion(+ Rambam 医院) · 🏷 论文·触觉成像/表征 📌 一句话省流:拿一个触觉传感器反复戳一块软体,就把它内部藏着什么、在哪、多大给"摸"出来(目标场景是乳腺肿块触诊)。关键做法是:别用一个大向量表示整块物体,而是在空间上铺一张网格,每个格点只管自己附近那一小片的触感。结果是——只在"单个肿块"的数据上训练,测试时直接能处理多个肿块、和 4 倍大的物体。 ≈ 打比方:以前是让一个人闭眼摸完整块再凭整体印象画一张图(换个没见过的构型就懵);LESS 是铺一张网格、每个格子各自记住自己脚下的手感,最后把小图拼起来——所以物体变大、肿块变多,只是多用几个格子而已。 🎬 项目页(含手持设备实时演示视频):zoharri.github.io/LESS · 代码 · 数据

🧰 对我们(可用性速判)

  • 对我们的用处中高,但要说清楚是"哪一层"有用
  • ⚠️ 先划清边界:它不是操作、不是 VLA、不做抓取——是医疗触觉成像。不在主线上,是主线相邻。
  • ✅ 但它的核心论点冲着"触觉表征该长什么样"这个共性问题:LESS 用一组很硬的数字说明,全局向量表征在物体构型变化时会崩,而按空间拆成局部表征几乎不掉点(见下 F1 1.1% → 71.3%)。
    • [✅论文明确点名] 它归为"只表征单次触觉测量"的一类:卡片-Sparsh(单帧自监督)、卡片-AnyTouch(3 帧短视频)、T-DEX(单次 taxel 阵列)。
    • [🔶 我们的外推·论文未讨论·待核] 这个批评是否同样适用于 卡片-T3 / 卡片-FTP-1 这类跨传感器表征,论文没说,我们也还没核过它们的表征是否带空间结构——引用前须单独确认,别直接套。
  • 数据可直接取用:~800 小时真机触觉交互,CC-BY-4.0,已实测可下载(见下)。传感器是能买到的 Xela uSkin,不是自制件。
  • 真实性(前期):论文 + 开源代码 + 开源数据(我们已实际下载并解包验证) + 附录给了完整复现步骤 → 证据 A
  • 训练/微调资源:论文未报 GPU 型号/时长(🟡 未给)。规模上属小模型(GRU + MLP + 转置卷积,非大模型),门槛远低于 VLA。数据侧 78 GB。
  • 能借多少(开源):代码 ✅、数据 ✅(5 个 Zenodo 记录全开放)、硬件 ✅(Xela uSkin + Franka Panda + 3D 打印仿体模具,附录给了制作方法)。
  • 可用性结论思路借鉴为主 + 数据可取用。不建议整体复现(要做硅胶仿体 + 3T MRI,我们没条件),但"局部感受野表征"这个架构点值得在我们自己的触觉编码上试

亮点到底在哪(用消融定位)

  • 亮点不在传感器、不在损失函数,在"表征的空间结构"。作者的洞见一句话:触觉是局部的——某个位置的受力,几乎不受远处内部结构影响。所以全局向量在浪费容量去学"所有材料 × 所有位置"的组合(指数爆炸),而局部表征天然自带组合泛化
  • 架构:N 个 GRU"粒子"铺在 x-y 网格上,每个粒子只吃落在自己感受野(半径 β)内的 (位姿, 力) 序列,权重共享;每个粒子经转置卷积出一小块图像 patch,所有 patch logits 相加后 softmax 拼成整图(2D 或 3D 体素)。
  • 消融最能说明问题的一处:感受野 β 是个明确的权衡旋钮——β 调大 → 单肿块(分布内)越准、越接近全局基线,但组合泛化越差;β ≈ 10mm 是两者最佳折中。这等于把"全局 vs 局部"做成了一个连续谱,并测出了拐点
  • 意外收获训 3D 体素反而让 2D 切片指标变好(F1 79.9% → 85.2%)——作者归因于 3D 提供了跨切片一致性的几何先验。
  • 副产物:局部结构让不确定度也变成局部的——没摸过的区域老实显示"我不知道",而全局基线会在没摸过的地方给出高置信度(图 7)。这对手持设备引导操作者"该往哪再摸两下"是刚需。

关键数字(每条带来源 [1],均已逐条核过原表)

  • [✅已核 §IV-B] 数据规模:3 台电动剪式升降台 + Franka Panda,近乎 24/7 连续采集 ~30 天,得 ~800 小时触觉数据,是前作 data-v1 的 7 倍。附录 H:共 3372 次扫描,覆盖 8 个外壳 / 54 个插件 / 3 个 Xela 传感器
  • [✅已核 §IV-B] 传感器:现货 Xela uSkin,100 Hz;作者明确"方法不依赖特定传感器"。仿体 = 3D 打印模具浇注硅胶外皮 + 水凝胶填充 + 硅胶肿块(可旋转 8 个角度)。
  • [✅已核 §IV-C] 真值:3T Siemens Prisma MRI + 64 通道线圈,取完整 3D 体积(前作只取一张 2D 水平切片)。图像分 3 类:自由空间 / 水凝胶 / 硅胶肿块。
  • [✅已核 Table II] 零样本组合泛化(本卡最硬的一组数)——只在单肿块数据上训练
  • 分布内·单肿块:全局基线 F1 85.2% vs LESS 83.5%LESS 略输(作者解释:每个 patch 能用的信息更少)。
  • OOD·多肿块:全局 F1 44.6% → LESS 71.1%;质心误差 7.4mm → 4.0mm
  • OOD·4 倍大仿体:全局 F1 1.1%(≈完全失效)→ LESS 71.3%;质心误差 26.8mm → 2.3mm
  • [✅已核 Table I] 3D 训练 > 2D 训练(评 2D 指标):F1 79.9% → 85.2%,直径误差 2.7mm → 1.8mm。
  • [✅已核 Table III] 训练数据配比(测 data-primitive):只用 poke F1 45.8% / 只用 primitive 74.7% / 两者合并 80.9%。→ "像人手的运动数据"是刚需,机器直上直下的戳法不够
  • [✅已核 Table IV + §V-E] 手持式(真人手持、fiducial 追踪位姿):F1 仅 41.3%,质心误差 8.4mm,对比机器臂设置的 1.6mm手持仍明显更差,作者自己定性为"proof-of-concept + 正向趋势"。
  • [✅已核 §V-E] 位姿鲁棒性:i.i.d. 高斯噪声下,位置 ~1mm、姿态 ~0.1 rad 以内方法稳定;其自研 fiducial 追踪实测优于该阈值(<1mm、0.02 rad)。

🧬 与其他工作的关系

  • 直接承接同组前作 Rimon et al.(本文的 GLOBAL 基线 + data-v1 数据集即出自该作)。LESS 相对它的三处推进:全局→局部表征、2D→3D 成像、机器臂专用→手持式(🟡 原文措辞是"首个基于自监督(SSL)的手持式触觉成像设备"——属作者自称,我们未做独立查新,勿简化成"首个手持式触觉成像"对外引用)。
  • 区别于触觉表征主流卡片-Sparsh(单帧自监督)、卡片-AnyTouch(3 帧短视频)、T-DEX(单次 taxel 阵列)——论文明确指出这些都在表征"单次触觉测量",而本文表征的是"触觉场景"
  • 区别于视触觉三维重建:NeuralFeels(神经场)、Tactile-Informed 3DGS、VTacO——它们都只做刚体表面,而本文做软体内部
  • 可延伸方向:作者自陈该架构或可用于其他"复杂时空信号"任务(视频学 affordance、软体操作)。

🔎 证据与可信度

  • 论文arXiv 2606.14344v1(2026-06-12,cs.LG)。作者 Zohar Rimon / Elisei Shafer / Tal Tepper / Daniel Kozin / Alon Malka / Roy Holland / Aviv Tamar*(Technion;Holland 兼 Rambam Health Care Campus)。欧盟资助。
  • ⚠️ 会议信息更正:聚合站 datasets.bot 标其为 "RSS 2026",本卡不采信——arXiv 元数据无 comment / journal_ref 字段,全文中 "Robotics: Science and Systems" 只出现在参考文献 [20] 里。目前只能认定为 arXiv 预印本,投稿去向未知。(🟡 若日后确认中稿再补。)
  • 代码/数据:均已开放且经我们实测(见下)。
  • 第三方复现/评阅:暂无。
  • 证据等级:A(论文 + 开源代码 + 开源数据 + 附录复现步骤)。

🧪 取用条件(数据链路已实测,2026-07-27)

结论:完全开放,无需任何账号登录。以下为我们直接实测所得,非转述其页面说明。 - 实际有 5 个 Zenodo 记录、合计 78.21 GB(⚠️ datasets.bot 写的"3 个记录、约 66 GB"不准确、漏了 2 个): - dataset_poke.zip 40.31 GB | dataset_primitive.zip 19.35 GB | palpation_dataset_0.zip 9.87 GB - OOD 包(3 文件):dataset_poke_multi.zip 5.61 GB + dataset_poke_big.zip 0.82 GB + dataset_handheld.zip 0.01 GB - 仿真包:sim_palpation_dataset_0.h5 2.22 GB + 样例 0.02 GB - 许可:5 个记录全部 CC-BY-4.0,各有独立 DOI(如 poke = 10.5281/zenodo.20367204)。 - 实测下载:完整拉取 dataset_handheld.zip(14.0 MB)成功,解开为 175 个条目、内容是按操作者分目录的 .hdf5(如 dataset_handheld/operator1_2/S1_St14C13_0.hdf5)→ 格式即 HDF5,可直接读。 - 实测带宽与续传:Zenodo 稳定 ~2.5 MB/s,且支持 Range 请求(HTTP 206)→ 40 GB 大包可断点续传。按此速率全量 78 GB 约需 8–9 小时,建议只取所需子集。 - 硬件复现门槛(若要自采):Franka Panda + Xela uSkin(现货)+ 3D 打印仿体模具(附录 A 给了方法)+ 3T MRI(← 真正的卡点,需医院协作)。

⚠️ 局限(作者自陈 + 我们的观察)

  • [作者自陈·最重要] 全部训练与评测都在人造硅胶仿体上,没有任何真人数据。作者在讨论中直接点出"临床相关性是个 pressing question…必须由未来工作在人体数据上验证"。→ 医疗价值目前是零验证的。
  • [数据核过] 手持式仍是 demo 级:F1 41.3% vs 同配置机器臂设置的 80.9%(Table III 的 Pri+Poke 行,即论文自己拿来对照的那组:质心误差 8.4mm vs 1.6mm,差 5 倍)。它的卖点之一在数字上还很弱。
  • [数据核过] 局部化不是白拿的:分布内单肿块上 LESS 反而略输给全局基线(83.5 vs 85.2)——局部表征是拿一点分布内精度换大量 OOD 泛化。用它的时候要清楚自己买的是哪一边。
  • [观察] 感受野基于 2D 平面欧氏距离、粒子铺在 2D 网格上,作者明说这是因为其物体主要在平面上变化;更一般的场景需要 3D 网格并考虑姿态——即当前形态对"任意形状物体"还没做到。
  • [观察] 场景是固定朝向、准静态戳压,与操作中的滑移/剪切/动态接触完全不同,别直接外推。

💡 我的批注 / 判断(判断来源:🤖Claude,待🧑复核)

  • 最该带走的一条,与医疗无关"F1 1.1% → 71.3%"这个数,是对"全局触觉嵌入"最狠的一次证伪。我们线上做触觉表征的几条主流工作都在学全局向量,而这篇给出了一个干净的对照实验说明:当物体的空间构型换了,全局表征不是掉点,是归零。触觉要塞进 VLA、要跨任务跨物体用,"表征要不要带空间结构"这个问题值得单独立一个观察点
  • 一个诚实的折扣:它的实验场景(准静态戳压硅胶块、传感器姿态固定、成像目标是静态内部结构)离操作太远,上面那条结论是"强启发"不是"已验证适用于操作"。要真正支撑,得看到有人在抓取/装配这类任务上做同样的局部 vs 全局对照。目前没有。
  • 数据本身的价值可能高于方法:~800 小时、CC-BY-4.0、现货传感器、带 MRI 体积真值——"触觉序列配内部结构真值"这个监督信号组合看起来很罕见(一般触觉数据的标签只有材质/成败/力)。🟡 但"罕见"目前只有论文自陈支撑(其相关工作称此前触觉场景表征"几乎只做刚体"),我们未做独立查新,别当"空白"用。若我们要做触觉表征的预训练或探针实验,这是一份门槛低、可直接下载的现成素材。
  • 对聚合站的一条校准:本卡有两处直接更正 datasets.bot(会议 "RSS 2026" 无据、数据"3 记录 66GB"实为 5 记录 78.21GB)。→ 印证 卡片-datasets-bot 里的判断:当线索源用,别当权威用;每条数字仍须回一手源核。

来源编号

  • [1] arXiv 2606.14344v1(2026-06-12)· 项目页 · 代码 · 数据 Zenodo 社区 · 本地全文 papers/LESS-TactilePalpation-MRI-2606.14344.txt(pdftotext)。架构/数据规模/Table I–IV 全部主表逐条核实(2026-07-27);附录 B/C/E 未逐条核。数据集记录数/体积/许可/格式/带宽为我们直接调 Zenodo API + 实际下载解包实测,非引用页面说明。

🔗 相关卡片
卡片-AnyTouch · 卡片-T3 · 卡片-FTP-1 · 卡片-Sparsh · 卡片-datasets-bot · 卡片-FreeTacMan