PANDO: Efficient Multimodal AI Agents via Online Skill Distillation

TL;DR

PANDO通过在线技能蒸馏提高多模态AI代理效率,成功率达58.3%。

cs.AI 🔴 高级 2026-05-24 5 次浏览
Yubo Li Yidi Miao Yuntian Shen Yuxin Liu
多模态 AI代理 技能蒸馏 效率 视觉网络竞技场

核心发现

方法论

PANDO是一种在线技能蒸馏框架,包含结构化技能库、进度反思、基于信心的技能降级、层次化路由、视觉压缩和缓存感知提示。每个组件在减少重复动作、降低发现成本和提高提示缓存重用率方面发挥作用。

关键结果

  • PANDO在910个VisualWebArena任务中实现了58.3%的成功率,比SGV的54.0%和WALT的45.2%更高,同时使用的令牌比SGV少58%,比WALT少61%。
  • 在300个任务的消融实验中,规则和例程提供了大部分成功提升,而路由、压缩和缓存感知提示将更大的技能库转化为更低的边际令牌成本。
  • 引入了三个轨迹级效率指标——动作重复率、步骤开销比率和提示缓存利用率,以使效率在终端成功之外可见。

研究意义

这项研究解决了多模态网络代理在推理计算上的高成本问题,通过在线学习使代理随着经验积累而变得更高效。它为学术界和工业界提供了一种新的方法来提高AI代理的效率,减少计算资源的消耗。

技术贡献

PANDO在现有方法的基础上进行了创新,提供了一种在线技能蒸馏方法,能够在测试查询流期间进行技能归纳,而无需预评估发现预算。它展示了如何通过结构化技能库和缓存感知提示来降低推理成本。

新颖性

PANDO首次提出了一种在线技能蒸馏框架,与现有的技能发现方法相比,它不需要离线工具发现预算,并通过实时技能归纳提高效率。

局限性

  • PANDO在处理动态任务分布时可能表现不佳,因为它假设任务分布是固定的。
  • 技能降级机制可能导致有用技能被错误地移除。

未来方向

未来的研究可以探索如何在动态任务环境中优化PANDO的性能,并改进技能降级机制以减少误删有用技能的风险。

AI 总览摘要

近年来,多模态网络代理的进步主要依赖于推理时计算的增加,如回滚搜索、验证器通过、离线技能发现和专家模型堆栈。这导致了一个核心问题:代理能否随着经验的积累变得更高效,而不是更昂贵?

PANDO是一种在线技能蒸馏框架,旨在解决VisualWebArena中重复动作循环、隐藏发现成本和低提示缓存重用率等效率问题。它通过维护一个结构化技能库,结合进度反思、基于信心的技能降级、层次化路由、视觉压缩和缓存感知提示来提高效率。

在910个VisualWebArena任务中,PANDO实现了58.3%的成功率,超过了SGV的54.0%和WALT的45.2%,同时使用的令牌比SGV少58%,比WALT少61%。这表明PANDO在提高效率的同时保持了高成功率。

深度解读

原文摘要

Recent advances in multimodal web agents often rely on increased inference-time computation, including rollout search, verifier passes, offline skill discovery, and specialist model stacks. This raises a central question: can a web agent become more efficient as it accumulates experience, rather than more expensive? We first analyze trajectories from VisualWebArena and identify three recurring sources of inefficiency: repeat-action loops, hidden discovery costs, and low prompt-cache reuse. We then introduce PANDO, a single-rollout online skill-distillation framework that maintains a structured Skill Library and combines progress reflection, confidence-based skill demotion, hierarchical routing, visual compression, and cache-aware prompting. On the full set of 910 VisualWebArena tasks, PANDO achieves a 58.3% success rate, outperforming SGV (54.0%) and our WALT reproduction (45.2%), while using 58% fewer tokens than SGV and 61% fewer tokens than WALT, without any pre-evaluation discovery budget. A 300-task ablation further shows that rules and routines provide most of the success gains, while routing, compression, and cache-aware prompting convert the larger skill library into lower marginal token cost. Finally, we introduce three trajectory-level efficiency metrics -- Action Repetition Rate, Step Overhead Ratio, and Prompt Cache Utilization -- to make efficiency visible beyond terminal success.

cs.AI