核心发现
方法论
ContextFlow将机器人上下文模仿学习建模为条件流匹配。Context Expert编码当前图像、文本和示范;Image、State、Action三个Perceiver压缩器把长序列压缩为固定数量潜变量。Action Expert接收本体状态与高斯噪声动作块,通过跨注意力和10步Euler积分,将噪声连续动作输送至目标分布,避免离散动作词元和逐词生成。
关键结果
- 在LIBERO未见配置上,ContextFlow平均成功率为73.5%,ContextAR为53.5%,ICRT为38.5%,相对ICRT提升35个百分点;其表现也略高于仅在已见任务训练的π0(44.5%)及π0一示范微调(72.5%)。
- 分任务看,ContextFlow在LIBERO-Spatial两项配置上成功率为86%和42%,平均64%;在LIBERO-Object两项配置上为76%和90%,平均83%,显示对空间关系与物体变化均有一定泛化能力。
- ContextFlow-Plain平均64.0%,加入多模态Perceiver压缩器后提升至73.5%;真实ALOHA实验覆盖21种配置、1,064条训练轨迹,并在新的双手解笔配置上达到40%成功率。
研究意义
该研究把上下文学习从离散序列预测推进到连续控制分布建模,针对机器人长期滚动中的误差累积和动作量化误差提供了统一解决思路。它表明机器人可以仅依赖少量示范适应新物体、空间布局和左右手配置,而无需更新参数。对学术界而言,工作连接了VLA、流匹配和Perceiver压缩;对工业界而言,它降低了为每种新配置重新采集数据和微调模型的成本。
技术贡献
核心技术包括条件流匹配目标、上下文与动作双专家架构,以及面向视觉、本体状态和动作序列的独立Perceiver压缩器。训练路径为as=(1-s)ε+sat,速度场目标为at-ε,损失为E||uθ(as,ot,d,s)-(at-ε)||²;推理从高斯噪声出发,以K=10步前向Euler积分生成连续动作块。块状因果注意力允许缓存上下文,减少重复计算。
新颖性
相较ICRT、LipVQ-VAE和RICL等自回归上下文模仿方法,ContextFlow不把连续动作离散化,也不逐动作词元预测,而是并行生成动作块。论文的主要新意是首次系统地将多模态示范上下文压缩与条件流匹配结合,用于数百步低层机器人操作,并在真实双臂任务中验证。
局限性
- 实验主要考察相关任务原语内的未见配置,而非完全陌生任务;因此尚不能证明模型具备开放世界任务迁移能力。
- 模型仍依赖视觉、本体和示范数据,ALOHA任务训练规模为1,064条轨迹;长序列压缩虽降低成本,但可能丢失精细时序信息。
- 真实新解笔配置成功率仅40%,说明双手高频闭环控制、遮挡和误差恢复仍较脆弱。
未来方向
后续可扩大真实机器人任务和平台规模,研究跨机器人形态、跨任务原语及更少示范条件下的迁移。还应探索自适应压缩、扩散或高阶ODE求解器、在线失败恢复与不确定性估计,并系统分析示范数量、动作块长度H和流匹配步数K对性能及延迟的影响。
AI 总览摘要
机器人若能像人一样看几次示范就学会新摆放方式,将大幅降低编程和数据采集成本。但现有上下文模仿方法如ICRT通常采用自回归架构,把连续动作离散成词元并逐步预测;早期错误会在长轨迹中累积,分布转移到未见物体或空间布局时尤其明显。连续控制虽可使用流匹配,却很少与上下文示范学习结合。
ContextFlow提出条件流匹配框架。Context Expert融合当前观察、任务文本和示范,三个Perceiver式压缩器分别提炼图像、本体状态及动作序列;Action Expert从高斯噪声动作块开始,通过条件速度场和10步Euler更新并行生成连续动作。训练目标是匹配线性噪声路径的速度at-ε,从而避免量化误差。块状因果注意力还能缓存上下文,提高推理效率。
在LIBERO未见配置上,ContextFlow平均成功率73.5%,比ICRT的38.5%高35个百分点,也超过ContextAR的53.5%和ContextFlow-Plain的64.0%,并匹配甚至略超π0一示范微调的72.5%。在真实ALOHA平台,它使用1,064条训练轨迹覆盖单臂和双臂任务,在新解笔配置达到40%。不过,实验仍局限于相关原语内的配置变化,完全新任务、跨平台迁移和复杂失败恢复仍待解决。
深度分析
研究背景
VLA模型如RT-1、RT-2、OpenVLA和π0推动了视觉到动作的学习;ICRT、RICL等进一步尝试用示范作为上下文。问题在于多数方法沿用语言模型的自回归离散词元机制。流匹配和动作分块能够直接处理连续控制,但此前尚未充分解决多模态长示范如何高效进入流模型的问题。
核心问题
目标是学习π(at|ot,d),其中at=at:t+H−1为未来动作块,ot包含图像和本体状态,d是示范。难点包括连续动作离散化误差、逐步预测造成的复合误差、数百步示范的二次注意力成本,以及未见物体、布局和左右手配置带来的分布偏移。
核心创新
- �� 用条件Flow Matching替代动作词元自回归预测,直接学习连续动作分布。
- �� 用Context Expert与Action Expert分工:前者建模任务上下文,后者迭代去噪动作。
- �� 用三个Perceiver压缩器处理图像、状态和动作,生成固定大小上下文。
- �� 用块状因果注意力缓存上下文,避免每个流步骤重复编码。
方法详解
- �� 示范输入:RGB序列、本体状态、动作及文本指令;采样N1=8帧、N2=128状态、N3=128动作。
- �� 压缩:每种模态使用32个可学习查询;图像压缩器4层,状态和动作压缩器各2层,输出拼接为Tcontext。
- �� 流匹配:采样ε~N(0,I),构造as=(1−s)ε+sat,训练uθ逼近at−ε;s~Beta(1.5,1.4)。
- �� 推理:a0~N(0,I),以δ=1/10进行10次Euler更新,输出长度H的连续动作块。
- �� 训练:SigLIP 224×224;π0初始化视觉和动作专家,LoRA秩32,20K步,批量32。
实验设计
LIBERO包含Spatial和Object两套评测,每套10个任务、500条专家示范,8个已见、2个未见配置,每项50次试验;训练另加入Goal和LIBERO-10。比较对象包括ICRT、ContextAR、ContextFlow-Plain、π0和OpenVLA-OFT。真实实验使用ALOHA,三类任务共21种配置、1,064条训练轨迹,另有254条双臂训练数据。
结果分析
LIBERO平均结果为:ICRT 38.5%、ContextAR 53.5%、ContextFlow-Plain 64.0%、ContextFlow 73.5%;π0为44.5%,一示范微调π0为72.5%。ContextFlow在Spatial平均64%、Object平均83%。压缩器带来9.5个百分点增益,说明固定大小多模态上下文既提升效率,也改善任务相关信息提取。ALOHA新解笔配置成功率为40%。
应用场景
适合仓储分拣、桌面整理、物体放置、工具操作和双臂协作等任务。部署前需有覆盖任务原语的示范库、RGB相机、本体状态和兼容动作接口;推理时可通过少量新配置示范调整行为,减少重新训练。工业收益主要是降低换物体、换位置和换手臂策略时的数据与维护成本。
局限与展望
当前验证集中于相关原语的未见配置,不能等同于开放任务学习。ALOHA数据规模和平台单一,跨机器人、跨相机和跨控制频率的鲁棒性尚未证明。Perceiver压缩可能损失关键时序,10步Euler虽简单但存在速度与精度权衡;40%的新解笔成功率也显示遮挡、接触动力学及双手错误恢复仍需增强。
通俗解读 非专业人士也能看懂
把机器人想成一名新员工,把示范视频、手部动作和身体姿势看成培训录像。传统方法像把整段操作拆成一个个小口令:先说第一步,再根据刚才说的话决定第二步。只要第一步稍微偏了,后面就会越来越离谱;而且连续动作必须先被四舍五入成有限的口令。
ContextFlow换了一种方式。它先让“培训老师”快速浏览示范,提炼出真正重要的内容,例如物体在哪里、应该用哪只手、动作大致顺序是什么。随后“执行员”不是一次只做一个小动作,而是先拿到一整段带有随机扰动的动作计划,再逐步把它修正成平滑、可执行的连续动作。
这就像厨师参考一道新菜的几次演示:不必死记每一秒的手腕角度,而是理解锅、食材和步骤之间的关系。实验中,这种方法在模拟机器人上达到73.5%的平均成功率,明显高于ICRT的38.5%;真实双臂机器人在新的解笔方式上成功率为40%。它仍可能在陌生任务、遮挡或复杂接触中失误,但证明了“看示范即可调整”可以更适合连续机器人控制。
简单解释 像给14岁少年讲一样
想象你在玩一个机器人游戏:任务是把不同颜色的东西放到不同位置。你不想每换一个位置就重新训练机器人,于是给它看几段高手录像。传统机器人像一个只会背台词的玩家,把动作拆成很多小代码,一个接一个地猜。如果开头把手伸偏一点,后面就会像连锁反应一样全错!
ContextFlow更像会观察高手习惯的队友。它同时看画面、机器人的关节姿势和高手怎么移动,然后把很长的录像浓缩成“这个任务应该怎么做”的小提示。真正行动时,它先随机生成一段粗糙计划,再连续修正十次,最后一次做出一小段完整动作,而不是每次只猜一个动作。
结果很酷:在LIBERO模拟环境中,ContextFlow平均成功率73.5%,ICRT只有38.5%。它还在真实ALOHA机器人上测试了单手和双手任务,在一种没见过的解笔配置上成功了40%。这说明机器人可以通过示范理解新物体或新位置,而不用重新改脑子。
当然,它不是无敌的。完全没见过的任务、手被挡住、两个手需要精确配合时仍可能失败。未来如果它能看懂更多种类的示范,并学会发现错误后自己重来,就会更像真正会学习的机器人!
术语表
Flow Matching(流匹配)
一种把简单噪声分布连续变换为目标动作分布的生成方法。模型学习随时间变化的速度场,而不是离散化动作。
ContextFlow用它从高斯噪声生成连续动作块。
In-Context Learning(上下文学习)
模型在推理时读取少量示范并改变行为,但不更新参数。示范本身充当任务提示。
论文用多模态机器人轨迹作为上下文。
Action Chunk(动作块)
连续控制中一次预测的一段未来动作序列。它可减少逐步决策的频率和误差传播。
ContextFlow并行预测长度H的动作块。
Perceiver Compressor(Perceiver压缩器)
用少量可学习查询从长输入中提取固定数量潜变量的注意力结构。它降低长序列计算量。
论文分别压缩图像、状态和动作。
Compounding Error(复合误差)
早期控制偏差改变后续状态,导致后续预测继续偏离的连锁误差。分布变化时通常更严重。
论文以此解释自回归方法在未见配置上的失败。
开放问题 这项研究留下的未解疑问
- 1 模型在相关任务原语内有效,但能否从极少示范学习完全陌生任务仍未知;这需要更广泛任务、语言目标和操作技能的测试。
- 2 压缩器可能删除短暂接触或双手协调信号。未来需要可解释的时序保真评估,以及根据任务难度动态决定采样和潜变量数量。
- 3 40%的新解笔成功率显示安全恢复不足;如何结合不确定性、触觉反馈和在线重规划仍是开放问题。
应用场景
近期应用
仓储与桌面分拣
操作员可提供少量不同物体或位置的示范,ContextFlow据此执行新的摆放配置。系统需要RGB相机、本体状态和标准动作接口,预期减少每次换SKU后的重新训练。
双臂工具操作
在解笔、装盒、递交和擦拭等任务中,示范可表达左右手分工与闭环动作。ALOHA结果表明该方向可行,但实际部署仍需碰撞安全、失败检测和人工接管机制。
远期愿景
示范驱动的通用机器人
未来机器人可从家庭成员或工人演示中快速适应新布局,形成跨物体、跨空间和跨手臂配置的技能库。关键障碍是跨平台泛化、开放任务理解与可靠失败恢复。
原文摘要
Although highly effective in vision and language domains, applying in-context learning to robotics remains challenging. Existing autoregressive in-context imitation methods discretize continuous actions and exacerbate the accumulation of early prediction errors through next-token prediction, limiting their generalization on unseen task configurations. Meanwhile, flow-matching policies have been explored for continuous robot control and can help mitigate compounding errors; however, in-context imitation learning within a flow-matching framework remains underexplored. To address these limitations, we introduce ContextFlow, a conditional flow-matching model that learns continuous action distributions for in-context imitation learning. ContextFlow conditions flow-based action prediction on demonstrations and observations, enabling robust generation from noisy action distributions. To better encode multimodal in-context demonstrations, we adapt perceiver-style multimodal context compressors that distill visual, proprioceptive, and action sequences into compact, task-relevant latent representations. On LIBERO, ContextFlow outperforms ICRT by 35 percentage points in average success rate on unseen task configurations, while matching the performance of the task-specific fine-tuned VLA model $π_0$ without any fine-tuning on unseen tasks. On real robots, it generalizes to unseen configurations of both single-arm and bimanual tasks, achieving 40% success on a new pen-uncapping configuration. Project Page: https://dingjiansw101.github.io/contextflow-page/.