Fourier Features Let Agents Learn High Precision Policies with Imitation Learning

TL;DR

Fourier特征将点云映射至多频空间,使模仿策略更精确;真实任务归一化得分由14.8%升至40.2%。

cs.LG 🟡 进阶级 2026-06-11 23 次浏览
Balázs Gyenes Emiliyan Gospodinov Jan Frieling Enrico Krohmer Nicolas Schreiber Xiaogang Jia Niklas Freymuth Gerhard Neumann
机器人操作 模仿学习 Fourier特征 点云 扩散策略

核心发现

方法论

论文在基于EDM的扩散模仿学习中,将每个三维点p=(x,y,z)编码为多频正弦余弦特征。采用L=16个对数间隔波长,范围λmax=4.0 m至λmin=2 cm,形成96维坐标特征,并接入PointPatch、PointPatch-attn、PCM、DP3和PointTransformer等点云编码器。动作由DDIM反向去噪生成,VariableJitter增强提升稳健性。

关键结果

  • 在RoboCasa中,PointPatch在CloseDrawer任务上由34%升至72%,TurnOffSinkFaucet由28%升至63%;所有任务平均成功率由13%升至34%,最高提升约20个百分点。
  • 在ManiSkill3四项任务上,Fourier特征最高带来7个百分点成功率提升;真实机器人四项长时序任务的归一化得分由14.8%提高到40.2%,且动作更平滑、定位更精确。
  • 收益跨多种编码器、数据集和超参数设置保持稳定。特征尤其适合含丰富几何细节的点云,即使几何细节有限,也可能通过改善学习动力学带来提升。

研究意义

研究指出,点云策略表现不稳定不只源于数据或架构,也可能源于MLP的频谱偏置:网络优先学习缓慢变化的低频函数,却难以表达插孔、对齐和接触等锐利决策边界。该方法以极小改动增强三维几何辨识能力,为低数据、高精度机器人学习提供了简洁且可迁移的工具。

技术贡献

技术核心是把NeRF式Fourier positional encoding从场景重建系统化引入点云扩散模仿学习。论文统一比较不同消息传递和聚合机制,并保持相同decoder-only Transformer与EDM骨干,从而隔离输入表示的影响。其工程方案还结合固定频率、坐标边界约束和VariableJitter,避免逐任务精细调参。

新颖性

相较于PointNet、PointPatch和DP3直接处理笛卡尔坐标,本文系统研究Fourier映射在多种点云编码器、仿真基准和真实机器人上的普适收益。已有工作如Adapt3R曾使用Fourier特征,但主要面向未见视角;本文聚焦扩散模仿学习中的高精度操作。

局限性

  • 实验主要使用深度生成的点云,仿真中刻意不提供颜色;因此对真实遮挡、深度噪声、材质反光和语义目标识别的泛化仍有限。
  • Fourier映射要求合理的空间边界与波长范围;过短波长可能过拟合,过长波长又无法消除频谱偏置,周期性还可能造成坐标混淆。
  • 真实实验仅覆盖四项任务,数据量为每项75至102条人工示范,尚不足以证明大规模、多机器人部署的成本优势。

未来方向

未来可研究可学习或自适应频率、旋转与尺度不变编码,以及与RGB基础模型、点图和触觉的融合。还应在更大规模真实数据、动态物体、强遮挡和跨机器人迁移中验证,并系统分析Fourier特征对样本效率、推理成本与安全性的影响。

AI 总览摘要

高精度机器人操作往往败在毫米级差异:插销是否对准、抽屉是否已经进入轨道,视觉上只相差一点点。RGB策略需要从二维图像猜测深度,容易受视角、光照和尺度影响;点云虽直接表达三维结构,却常在不同任务上表现不稳定。

Gyenes等人提出Fourier Features for Point Cloud Imitation Learning:先把点云坐标映射成96维、多尺度正弦余弦表示,再交给PointPatch、PCM、DP3或PointTransformer编码,并由EDM扩散策略通过DDIM逐步生成动作序列。其理论直觉是,MLP倾向先学习低频、平滑函数,而精细操作需要锐利的几何决策边界;Fourier映射相当于提前提供“高频刻度”。

结果显示,该改动具有跨架构和跨场景的稳定收益。RoboCasa平均成功率从13%升至34%,CloseDrawer由34%升至72%;ManiSkill3最高提升7个百分点;真实机器人四项任务的归一化得分从14.8%升至40.2%。论文的价值不在复杂新网络,而在证明输入表示本身即可显著释放点云几何信息。限制包括频率和空间边界选择、有限真实任务及对深度质量的依赖,但该方法适合作为点云模仿学习的通用插件。

深度分析

研究背景

扩散模仿学习,如Diffusion Policy和EDM,能表达人类示范中的多模态动作;PointNet、PointPatch及PointTransformer则为机器人提供显式三维几何。RGB具有语义优势,却存在深度歧义和视角敏感性。现有点云策略常依赖MLP编码XYZ坐标,精细接触任务仍可能出现模糊或不稳定控制。

核心问题

插入、对齐、抓取重定位等任务要求在相邻几何状态之间作出截然不同的动作。笛卡尔坐标在局部空间变化缓慢,而MLP具有频谱偏置,低频函数先被学习,高频决策边界收敛慢。因此,策略可能看见点云,却无法有效利用毫米级结构。

核心创新

论文提出把每个点映射到多频Fourier空间,而非直接输入XYZ。与只为特定架构设计的已有方案不同,它将同一表示应用于PointPatch、PointPatch-attn、PCM、DP3和PointTransformer,并在RoboCasa、ManiSkill3及真实机器人上统一评估。固定频率加VariableJitter使方法无需逐任务正则化调参。

方法详解

  • �� 深度反投影:使用X_i=D_iK^{-1}(i,j,1)^T,并通过外参变换至世界坐标,拼接多相机点云。
  • �� Fourier编码:对每个轴使用γ_k(x)=[sin(2πx/λ_k),cos(2πx/λ_k)],L=16,λ从4 m到2 cm,共96维。
  • �� 点云编码:构造KNN邻域和FPS采样的patch,由PointPatch系列或DP3等聚合成观察token。
  • �� 动作生成:decoder-only Transformer接收CLIP RN-50目标token、噪声token、观察token和动作块;EDM score matching训练,DDIM采样。
  • �� 增强:VariableJitter随机采样σ∈U(0,σmax),模拟最多5 mm、2 mm或1 mm的位置扰动。

实验设计

RoboCasa选16项任务,每项50条人工示范;ManiSkill3选四项任务,每项500条专家示范;真实实验含Drawer、Cup-Stacking、Arranging、Folding四项任务,每项75至102条人工示范。训练采用多任务文本目标、5个随机种子和3个检查点;RoboCasa测试50次、ManiSkill3测试100次,并报告bootstrap置信区间。点云下采样至32768点,再以1 cm体素降采样。

结果分析

Fourier特征普遍提升成功率。RoboCasa中PointPatch的CloseDrawer从34%到72%,TurnOffSinkFaucet从28%到63%,总体从13%到34%。ManiSkill3最高提升7个百分点。真实四任务归一化得分从14.8%到40.2%。收益在不同聚合方式和编码器中均出现,说明关键因素是频谱表示而非某个特定网络。

应用场景

该方法适用于深度相机驱动的插入、装配、抽屉操作、堆叠和工具使用。部署者只需在现有点云编码器前加入Fourier映射,并完成坐标标定、裁剪和体素化。它尤其适合示范有限、需要精确接触且RGB深度不可靠的工业或服务机器人。

局限与展望

性能依赖深度点云质量、坐标范围和波长设计;周期性编码在未约束空间可能产生别名。论文没有系统报告计算开销、不同点数的缩放规律,也未覆盖动态场景、触觉反馈和大规模跨平台迁移。后续应探索可学习频率、几何不变性、RGB/触觉融合及更严格的真实世界安全评测。

通俗解读 非专业人士也能看懂

把机器人想成一名装配工。普通点云坐标像一把只有厘米刻度的尺子:两个零件已经很接近时,尺子告诉工人“差不多”,却说不清到底偏左一毫米还是偏右一毫米。机器人于是容易把本应继续调整的零件直接插进去,或者反过来犹豫不前。

Fourier特征像给这把尺子换上许多套刻度:一套看房间大小,一套看桌面范围,还有一套专门看毫米级差异。每个位置都会留下独特的组合信号,附近的两个点也不再容易混在一起。机器人先用这些刻度观察零件,再用扩散策略从许多可能动作中逐步选出平滑动作。

论文在厨房模拟、操作模拟和真实机器人上测试。RoboCasa平均成功率从13%到34%,抽屉任务从34%到72%;真实任务得分从14.8%到40.2%。这说明问题有时不是机器人没有看到三维信息,而是表达三维信息的方式太粗。

简单解释 像给14岁少年讲一样

想象你在玩一个需要把钥匙插进锁孔的游戏。画面告诉你钥匙和锁都在哪里,但如果视角有变化,你可能看不准它们相差多少。机器人也一样:普通照片像二维截图,深度不明确;三维点云虽然告诉它距离,却可能把两个非常接近的位置看成“差不多”。

这篇论文给机器人加了一种特殊地图,叫Fourier特征。它不是只写“这个点在这里”,而是用很多不同节奏的波纹给位置做标记:大波纹看整体,小波纹看细节。就像地图同时有城市、街道和门牌号三种比例尺。这样,机器人能分辨那些只差一点点的形状。

研究者把这张地图交给几种点云网络,再让扩散策略学习示范动作。它会从一个有噪声的动作开始,像擦掉涂鸦一样逐渐得到正确动作。RoboCasa平均成功率由13%升到34%,CloseDrawer由34%升到72%。

不过它不是魔法。深度相机坏了、物体被挡住,或者地图范围和波纹设置不合适,效果仍会下降。未来如果它能结合照片、触觉和更大的真实数据,机器人就可能更可靠地完成装配、叠杯和整理物品。

术语表

Fourier Features(傅里叶特征)

用不同频率的正弦和余弦把坐标转换为高维表示。它能放大邻近位置之间的细微差异。

本文将XYZ点坐标编码为96维输入。

Spectral Bias(频谱偏置)

神经网络通常先学习变化缓慢的低频函数,再学习快速变化的高频函数。高精度决策边界因此较难拟合。

论文用它解释点云策略的性能瓶颈。

EDM(Elucidated Diffusion Models)

一种通过加噪和反向去噪学习数据分布的扩散模型。这里它生成动作序列而非图像。

作为模仿策略的训练框架。

PointPatch

将点云按局部邻域分成patch并编码成token的架构。它利用KNN和FPS组织无序点集。

论文重点测试的点云编码器家族。

DDIM

一种减少扩散采样步数的确定性去噪求解器。它能更快地产生动作。

用于策略执行阶段的反向采样。

VariableJitter

为每个点云随机采样噪声幅度,而不是固定扰动强度。这样可减少过拟合并覆盖不同噪声水平。

论文用于Fourier输入的数据增强。

开放问题 这项研究留下的未解疑问

  • 1 尚不清楚Fourier特征在严重遮挡、动态物体和低质量深度下是否仍稳定;需要带真实传感器噪声与触觉反馈的大规模基准。
  • 2 固定波长虽稳健,却缺少任务自适应机制;可学习频率是否能提高样本效率,同时避免周期别名和过拟合,仍待验证。

应用场景

近期应用

精密装配

工业机器人可在插销、插槽、连接器和小型零件装配中,把现有点云编码器替换为Fourier版本。前提是有标定深度相机和示范数据,预期减少错位与重复调整。

服务机器人整理

在抽屉关闭、杯子堆叠和物品摆放中,Fourier点云策略可增强接触判断。系统需要裁剪背景、体素化点云并提供语言目标,适合快速改造现有扩散策略。

远期愿景

通用三维操作基础模型

Fourier表示可能成为大规模点云机器人模型的通用输入层,连接视觉、深度和触觉。主要障碍是跨传感器坐标一致性、计算规模、动态环境和安全验证。

原文摘要

High-precision robotic manipulation requires fine-grained spatial reasoning that is often difficult to achieve with RGB-only policies due to depth ambiguity and perspective scale issues. Policies that leverage 3D information directly, such as those based on point clouds, offer a stronger geometric prior over purely image-based ones, yet their performance remains highly task-dependent. We hypothesize that this discrepancy may be due to the spectral bias of neural networks towards learning low frequency functions, which especially affects architectures conditioned on slow-moving Cartesian features. We thus propose to map point clouds from Cartesian space into high-dimensional Fourier space, effectively equipping the point cloud encoder with direct access to high-frequency features. We experimentally validate the use of Fourier features on challenging manipulation tasks from the RoboCasa and ManiSkill3 benchmarks and on a real robot setup. Despite their simplicity, we find that Fourier features provide significant benefits across diverse encoder architectures and benchmarks and are robust across hyperparameters. Our results indicate that Fourier features let policies leverage geometric details more effectively than Cartesian features, showing their potential as a general-purpose tool for point cloud-based imitation learning. We provide source code and videos on our project page: https://fourier-il.github.io/fourier-il

cs.LG cs.RO