核心发现
方法论
论文针对多任务机器人数据中动作原语严重不均衡的问题,按任务数据量定义采样概率:p_i(τ)=|D_i|^(1/τ)/Σ_j|D_j|^(1/τ)。τ=1等同随机采样,τ>1提高低资源任务概率。默认采用余弦升温,从τ=1逐步升至5,使模型先学习稳定共享表征,再强化稀缺技能。
关键结果
- 在不均衡Libero上微调UniVLA,Random、固定Upsample与Temperature的Overall成功率分别为0.76、0.77和0.85;Temperature在Spatial、Goal、Object、10四套任务上为0.96、0.86、0.84、0.73。
- 真实Franka Panda实验覆盖Egg in Carton、Pen in Mug、Fold Towel和Slide Cube;余弦升温整体优于随机采样与余弦降温,尤其改善三个低资源任务,同时保持高资源任务表现。
- RoboCasa消融显示方法适用于3.1M、19M和56.7M模型;在300:50、1000:50和3000:50不均衡比下,失衡越严重,温度采样相对随机采样的优势越明显。
研究意义
研究指出,机器人数据规模增长并不自动带来技能均衡。若pick-and-place等常见动作主导梯度,模型容量会被高资源任务占用,稀缺但关键的折叠、滑动和开关技能则难以学习。温度采样仅需少量代码,不依赖额外生成数据或预训练评估模型,为大规模机器人预训练和基础模型微调提供了低成本、可扩展的修正方案。
技术贡献
核心技术贡献是将类似多语言学习中的温度采样重新表述为动作原语层面的机器人策略训练问题,并引入τ=1→5的余弦升温。相比ReMix基于损失和参考模型动态估权,本方法只需任务样本量即可计算概率,避免训练两个额外模型及复杂超参数。作者还系统比较固定温度、线性/指数调度和升温/降温方向。
新颖性
新颖性不在于首次提出温度采样,而在于将其用于机器人动作原语不平衡,并通过稀疏奇偶、RoboCasa、Libero、真实Franka Panda四层证据验证。与按任务复杂度或人工启发式加权的方法不同,论文直接针对行为分布失衡,并证明调度时机本身影响最终控制性能。
局限性
- 实验假设任务已清晰分段,且可用任务标签或语言条件识别动作原语;真实数据中的混合技能、连续技能边界和错误标签尚未充分处理。
- 温度终值与调度形状仍需经验选择。论文发现余弦升温优于其他方案,但尚未给出适用于任意数据分布的理论最优规则。
未来方向
未来可研究自动估计动作原语、在线调整温度、跨任务迁移以及连续技能分解。还应在更大规模真实数据、更多机器人形态和长时序任务上检验温度策略,并建立数据比例、模型容量、温度曲线与泛化之间的理论联系。
AI 总览摘要
机器人学习正在复制大模型的发展路径:收集更多示范、训练更大的网络。然而,任务名称不同并不意味着动作不同。“拿苹果”和“拿橙子”可能共享同一套抓取轨迹,导致数据集中pick-and-place极度过量,而折叠、滑动或旋钮操作样本稀少。随机抽样因此让常见动作持续主导梯度,模型看似强大,却在低资源技能上失灵。数据增强成本高昂;ReMix等方法则需要额外模型估计任务难度。
Patil等人提出Temperature Sampling,以任务样本量为依据改变抽样概率:p_i(τ)=|D_i|^(1/τ)/Σ|D_j|^(1/τ)。τ=1是普通随机抽样,τ升高则相对增加小任务采样。实践中,温度按余弦曲线从1升至5,让模型先利用高资源数据建立稳健表征,再在训练后期集中学习稀缺技能。该方法无需生成数据,也无需训练参考模型,能够直接嵌入行为克隆或基础模型微调流程。
结果覆盖稀疏奇偶任务、RoboCasa、Libero和真实Franka Panda。Libero上UniVLA整体成功率从Random的0.76、固定上采样的0.77提升至0.85,四个套件分别达到0.96、0.86、0.84和0.73。RoboCasa消融表明方法在3.1M至56.7M模型及多种失衡比例下均有效;真实机器人中,余弦升温尤其改善低资源任务。研究的启示是,机器人数据规模之外,训练时“谁被看见、何时被看见”同样决定策略能否泛化。
深度分析
研究背景
大规模机器人数据集如Open-X Embodiment推动了行为策略扩展,但数据通常按任务收集,造成动作原语失衡。RoboCasa含25个原子任务、1200条人工和72000条合成示范;常见抓取任务可能远多于其他技能。视觉或语言差异可借助基础模型缓解,动作分布失衡却直接改变策略的行为覆盖范围。
核心问题
给定任务数据集D=∪D_i,且|D_1|≫|D_2|⋯,行为克隆损失L(θ)=−(1/N)Σlogπθ(a_i|x_i,z_i)会被大任务主导。问题不是单纯分类偏差,而是SGD更新长期缺少稀缺动作梯度,导致共享模型容量集中于高资源任务,并损害平均多任务成功率。
核心创新
论文提出三点创新:第一,以动作原语相关任务的数据量而非任务复杂度定义采样;第二,用Boltzmann式温度概率平滑长尾分布;第三,采用τ=1到5的余弦升温,将表征学习与稀缺技能专门化分阶段结合。它比ReMix更轻量,也比固定上采样更能避免早期过拟合和容量浪费。
方法详解
- �� 输入:任务数据量|D_i|、训练步数t及任务条件z。
- �� 采样:计算p_i(τ)=|D_i|^(1/τ)/Σ|D_j|^(1/τ),按任务抽取示范并组成minibatch。
- �� 调度:τ(t)=τ_start+(τ_end−τ_start)(1−cos(πt/T))/2,默认1→5。
- �� 优化:使用行为克隆SGD更新策略参数;RoboCasa采用512维、6层、8头BC-Transformer,训练40k步。
- �� 对照:随机采样、固定温度上采样和ReMix;后者需参考模型与代理模型估计权重。
实验设计
实验分三层。Toy实验使用长度n=50、每项取k=4位的五个稀疏奇偶任务。模拟实验使用RoboCasa和四套Libero;RoboCasa以七个任务各3000条、其他任务各50条构造失衡,Libero使用50、15或20条示范。UniVLA在Libero上微调40k步。真实实验使用Franka Panda、8任务588条示范,训练ResNet-50视觉编码器和UNet扩散策略。
结果分析
Libero中Temperature的Overall为0.85,超过Random的0.76和Upsample的0.77,且Spatial高资源任务保持0.96。RoboCasa上,温度升温在小、中、大模型均保持优势;失衡从300:50扩大到1000:50和3000:50时,低资源收益进一步扩大。调度消融显示低资源成功率:余弦升温0.31、指数升温0.28、线性升温0.24;余弦降温仅0.24。
应用场景
该方法适合机器人预训练、少样本任务微调、跨场景操作和多任务模仿学习。使用者只需获得任务分组和样本计数,即可在PyTorch数据加载器中实现。它尤其适用于抓取数据远多于开门、折叠、推动或按钮操作的仓储、家庭服务和实验室机器人系统。
局限与展望
方法依赖可靠任务划分,难以直接处理一个轨迹包含多个原语、任务标签噪声或技能连续变化的情况。温度范围1到5虽经搜索选定,却缺乏普适理论。论文还未充分评估更大真实数据、不同控制频率、长期任务和多机器人迁移;额外采样也可能增加低资源示范的重复曝光。
通俗解读 非专业人士也能看懂
把机器人训练想成一所学校。学校里有很多学生代表不同技能:抓取课有三千份练习,折叠课只有五十份。若每天随机点名,老师几乎总叫抓取课学生回答,于是班级看起来很会抓东西,却不会折叠或推动。
温度采样像一个聪明的点名规则。开始时仍让大课多出现,因为它们能帮助全班建立基本动作;随着课程推进,规则逐渐增加小课的出场机会。公式中的温度越高,小课相对越容易被抽到。作者使用余弦升温,让规则从普通随机逐渐变成更公平的点名。
这不是凭空制造练习,也不是重新训练几个老师来判断难度,而只是改变数据加载顺序和频率。结果显示,UniVLA在Libero上的总体成功率从0.76提高到0.85;在真实Franka Panda上,稀缺任务也得到更好表现。换句话说,同样的教材和同样的机器人,只要安排练习的方式更合理,能力覆盖就会更广。
简单解释 像给14岁少年讲一样
想象你在玩一个有很多关卡的游戏。抓取物品这一关有3000个攻略视频,折叠毛巾这一关只有50个。如果游戏系统随机给你看视频,你会反复看到抓取关,最后变成“抓东西超强、其他关卡不会”的玩家。
Temperature Sampling就是一个聪明的推荐系统。训练刚开始,它让热门关卡多出现,帮助机器人先学会基本操作;训练后面,它逐渐推荐冷门关卡。这里的“温度”不是机器人发烧,而是控制冷门任务被抽到的机会:温度从1升到5,冷门关卡就更常出现。
研究者在RoboCasa、Libero和真实Franka Panda上测试。Libero中,普通方法总体成功率是0.76,固定增加冷门任务是0.77,而温度采样达到0.85。它还测试了3.1M、19M和56.7M大小的模型,发现大模型和小模型都能受益。
关键不只是“多练冷门题”,还要注意什么时候练。太早大量重复冷门样本可能让模型学得不稳;先打好基础,再逐渐增加冷门技能,效果更好。就像备考:先掌握共同基础,最后专门补弱科,才能让总成绩更均衡!
术语表
Temperature Sampling(温度采样)
根据任务数据量重新分配抽样概率的方法。温度越高,小数据任务相对越容易被采样。
论文用它平衡机器人动作原语的训练分布。
Behavior Cloning(行为克隆)
让策略最大化专家示范动作概率的模仿学习方法。其目标是最小化专家动作的负对数似然。
BC-Transformer和扩散策略均以示范学习为基础。
Low-Resource Task(低资源任务)
训练示范数量较少的任务。它们通常在随机抽样中获得较少梯度更新。
折叠、滑动等任务被用于评估温度采样收益。
ReMix
一种基于群体分布鲁棒优化的数据重加权方法。它利用参考模型和代理模型的相对损失估计任务权重。
论文将其作为更复杂的对照基线。
Cosine Warming(余弦升温)
按余弦曲线逐步提高温度的调度策略。它使低资源任务在训练后期获得更高采样概率。
默认从τ=1升至5,表现优于降温方案。
Action Primitive(动作原语)
构成复杂机器人任务的基本行为,如抓取、按压、转动和折叠。原语分布决定策略实际覆盖的运动能力。
论文将不平衡重点放在动作原语而非语言描述。
开放问题 这项研究留下的未解疑问
- 1 如何在没有人工任务标签时自动发现动作原语,并稳定估计其数据量,仍是关键问题;潜在方案包括轨迹分段、潜变量表示和在线聚类。
- 2 温度终值是否应由模型容量、任务相似度和失衡比例共同决定尚不清楚;需要理论分析或无验证集的自动调度方法。
- 3 当一个轨迹同时包含多个技能时,按单一任务采样可能失效;未来需研究片段级或层级策略级的温度控制。
应用场景
近期应用
机器人多任务预训练
机器人公司可按任务统计示范数量,在数据加载器中加入τ=1→5的余弦升温。无需生成新轨迹或训练额外评估模型,适合处理抓取数据远多于开门、推动和折叠数据的现有数据集。
基础策略微调
使用UniVLA等基础模型进行新任务微调时,可将低资源任务按温度概率重复采样。预期能提高少样本任务成功率,同时避免牺牲已有高资源能力,适合仓储、家庭和实验室机器人。
远期愿景
均衡的通用机器人策略
若温度调度与自动技能发现结合,未来可训练覆盖抓取、操控、折叠、推动等多种原语的通用策略,减少模型因数据长尾而出现的“会做常见动作、不会做关键动作”问题。
原文摘要
Increasingly large datasets of robot actions and sensory observations are being collected to train ever-larger neural networks. These datasets are collected based on tasks and while these tasks may be distinct in their descriptions, many involve very similar physical action sequences (e.g., 'pick up an apple' versus 'pick up an orange'). As a result, many datasets of robotic tasks are substantially imbalanced in terms of the physical robotic actions they represent. In this work, we propose a simple sampling strategy for policy training that mitigates this imbalance. Our method requires only a few lines of code to integrate into existing codebases and improves generalization. We evaluate our method in both pre-training small models and fine-tuning large foundational models. Our results show substantial improvements on low-resource tasks compared to prior state-of-the-art methods, without degrading performance on high-resource tasks. This enables more effective use of model capacity for multi-task policies. We also further validate our approach in a real-world setup on a Franka Panda robot arm across a diverse set of tasks.