CA-OPD: Confidence-Aware On-Policy Distillation for Structured Visual Prediction

TL;DR

CA-OPD以教师置信度修正学生轨迹,ScreenSpot-Pro提升9.50分,OCRBench-v2英文提升6.72分。

cs.CV 🔴 高级 2026-09-02 16 次浏览
Menghao Li Linjie Mu Yin Wang Haotian Hu Yannian Gu Lujiayi Xue Liujian Tang Yu Zhang Fanyi Wang
知识蒸馏 视觉语言模型 自回归预测 GUI定位 OCR

核心发现

方法论

CA-OPD在学生自身采样的rollout上工作。教师用候选词的负对数似然NLL=-logπT(ŷt|st)评估可靠性;低于置信度门槛的候选被教师argmax预测替换,并写回后续前缀。替换位置使用交叉熵,保留位置使用教师top-k分布的截断前向KL。门槛按cosine schedule从严格逐步放宽。

关键结果

  • 在Qwen3.5-0.8B学生、多教师Qwen3.5-9B设置下,退火CA-OPD在ScreenSpot-v2、ScreenSpot-Pro、OCRBench-v2 English/Chinese、CC-OCR和OmniDocBench均超过OPD;ScreenSpot-Pro为45.92,较OPD的40.82提升5.10分,OCRBench-v2英文为52.47,较50.79提升1.68分。
  • 相对未蒸馏Qwen3.5-0.8B,论文摘要报告ScreenSpot-Pro提升9.50分、OCRBench-v2 English提升6.72分;表1显示退火CA-OPD还保持RefCOCO 81.90和MMBench 80.16,未明显损害保留能力。
  • 消融证明频率不是关键:随机写回仅得40.20分ScreenSpot-Pro,置信度门控但不写回得40.92;完整方法为45.92。固定门槛44.58、反向schedule 44.36,均低于退火方案。

研究意义

论文处理了结构化视觉预测中的训练—推理状态错配。OCR字符、坐标和GUI动作均以序列生成,早期一个错误就可能污染全部后缀。CA-OPD同时修复访问状态和调整监督,使学生既接触自身错误,又避免最危险的错误扩散。对小型VLM部署而言,这有助于在较低推理成本下继承大模型的定位和识别能力。

技术贡献

核心贡献是把行为策略与监督目标通过同一替换指示器rt绑定:rt=1时使用教师确定性修正和CE,rt=0时保留学生token并使用教师分布KL。论文还提出基于绝对NLL而非相对排名的门控,以及严格到宽松的cosine阈值τnll。该设计把prefix repair、状态访问和知识传递统一为一个离散自回归过程。

新颖性

相较GKD的纯学生rollout、Offline KD的教师轨迹和SKD的排名式验收,CA-OPD使用教师对具体候选的绝对概率支持,并让干预结果决定监督形式。新颖点不只是“何时替换”,还包括“替换后如何教”和“随训练如何交还控制权”。

局限性

  • 实验集中于GUI grounding与OCR,教师是两个领域专用的Qwen3.5-9B模型;在开放式生成、复杂推理或教师质量较低的领域,NLL门槛是否可靠仍未知。
  • 完整词表KL被截断为top-k并做非负裁剪,可能丢失尾部知识;同时每步调用教师并执行离散写回,带来训练显存、延迟和工程复杂度。
  • 论文主要报告最终分数,尚未充分解释阈值、top-k和教师规模变化下的稳定性。

未来方向

未来可研究不确定性校准、token类型或任务类型自适应阈值,以及更便宜的教师缓存和批量验证。还应扩展到视频、工具调用、长链动作和多语言OCR,并比较不同教师架构、蒸馏温度及可微状态修复。

AI 总览摘要

自回归视觉语言模型把OCR、视觉定位和GUI操作统一成token序列,但这种统一也放大了错误:一个错误字符或坐标会进入下一步输入,造成连锁偏离。传统Offline KD依赖教师轨迹,标准OPD虽让学生在自己的状态上学习,却可能在训练早期被错误前缀拖垮;SKD则主要依据教师排名判断是否接受候选,无法表达教师对候选的绝对支持程度。

CA-OPD让教师在每一步检查学生候选。它用NLL=-logπT(ŷt|st)衡量置信度;不受支持的候选由教师argmax token替换并写回前缀,受支持的候选则保留。替换位置接受直接交叉熵,保留位置接受教师top-k分布的前向KL。训练初期阈值严格,随后用cosine schedule放宽,使控制权逐渐回到学生。

在Qwen3.5-0.8B学生和两个Qwen3.5-9B领域教师上,CA-OPD在六项GUI/OCR基准全面优于OPD;ScreenSpot-Pro达到45.92,OPD为40.82,OCRBench-v2 English达到52.47,OPD为50.79。随机干预、无前缀写回和反向schedule均明显较弱,说明收益来自干预位置、轨迹修复和监督对齐,而非单纯增加教师调用。方法仍需在更广任务和更低成本设置中验证。

深度分析

研究背景

Pix2Seq、Donut和Unified-IO证明视觉结果可以序列化为统一输出;现代VLM进一步用语言式坐标和动作token处理grounding与GUI任务。Hinton等人的KD传递教师分布,GKD让学生访问自身状态,SKD则交错教师和学生轨迹。但结构化输出对前缀极敏感,静态教师轨迹不代表推理状态,纯学生轨迹又容易错误累积。

核心问题

给定状态st=(x,y<t),学生从πS采样ŷt并继续生成。若候选错误,它不仅损失当前token,还改变之后所有状态。排名只能说明候选相对位置,不能说明教师概率是否足够高;而教师拒绝候选本身又包含明确的纠错信号。问题因此是同时决定哪些token进入前缀,以及每个位置应接受何种监督。

核心创新

第一,使用教师绝对NLL门控,而非SKD的相对排名。第二,拒绝候选时用教师argmax确定性写回,直接修复未来状态。第三,将门控结果映射为监督:替换位置用CE,保留位置用top-k forward KL。第四,采用τnll从τstart向τend递增的cosine schedule,早期保护轨迹,后期恢复on-policy暴露。

方法详解

  • �� 学生在当前混合前缀st采样ŷt∼πS。
  • �� 教师计算NLLT,t=-logπT(ŷt|st),若NLL>τnll,s则rt=1。
  • �� rt=1时提交ỹt=argmaxvπT(v|st),并写回后缀状态;否则提交学生候选。
  • �� 替换位置损失LRt=-logπS(yt|st),保留位置损失为top-k截断KL,并取max(·,0)。
  • �� 总损失为Σmt[λCErtLRt+λKL(1-rt)LK-topkt]/Σmt。
  • �� 阈值按τ=τstart+(τend-τstart)(1-cosπps)/2放宽,离散写回不反传梯度。

实验设计

学生为SFT初始化的Qwen3.5-0.8B,教师为分别微调的两个Qwen3.5-9B。目标集包括ScreenSpot-v2、ScreenSpot-Pro、OCRBench-v2 English/Chinese、CC-OCR和OmniDocBench;RefCOCO/+/g与MMBench用于能力保持。比较Offline KD、OPD、SKD、固定阈值CA-OPD和退火CA-OPD,所有控制方法共享数据、初始化和优化预算,结果为三次运行平均。

结果分析

退火方案六项目标指标均优于OPD:ScreenSpot-Pro 45.92对40.82,CC-OCR 67.32对63.93,OCRBench-v2 Chinese 53.22对52.45。固定阈值在ScreenSpot-Pro为44.58,反向schedule为44.36。随机写回仅40.20,说明位置选择重要;用KL替代替换位置CE后为45.26,证明监督对齐仍有独立贡献。

应用场景

可用于手机和桌面GUI代理,让小模型输出更可靠的点击坐标、滚动动作和控件定位;也适合文档OCR、票据解析和多语言屏幕读取。部署前需有领域教师、共享tokenizer和可验证的结构化输出格式;训练阶段的教师调用成本较高,但推理阶段仍只需学生模型。

局限与展望

方法依赖教师概率具有可比性和校准性;过度自信的教师会错误写回,低质量教师则可能把学生带偏。top-k KL降低了成本,却可能忽略长尾词。论文只覆盖图像GUI与OCR,并使用较大教师,尚未给出不同阈值、top-k、温度或教师架构的系统敏感性分析。未来应研究自适应校准、缓存验证和视频或工具调用任务。

通俗解读 非专业人士也能看懂

把训练想成教一名学徒抄写表格和操作电脑。学徒每一步先自己做决定;如果他写下的字符或点击位置明显不可靠,老师就把错误答案改掉,并让改正后的答案成为下一步的依据。这样,学徒不会因为第一步写错而把后面整张表抄乱。

但老师并不是永远接管。训练刚开始时,老师比较严格,因为学徒还不熟练;后来学徒变好,老师逐渐放宽,只在真正危险的地方纠正。被改过的地方,老师直接告诉学徒正确答案;没有被改的地方,老师展示几个可能答案及其可信程度,让学徒学习更细致的判断。

这就是CA-OPD。它不是简单增加老师检查次数,而是决定检查哪里、是否把修正写回后续步骤,以及两类位置分别怎么教。实验中,ScreenSpot-Pro从普通OPD的40.82升到45.92,说明“及时修正错误的步骤”比“随机多帮几次”更重要。

简单解释 像给14岁少年讲一样

想象你在玩一个需要连续输入指令的游戏:先找到按钮,再点击它,再输入文字。第一步坐标错了,后面可能全点偏。普通训练像是让你一直自己玩,哪怕开局就走错;另一种训练则让高手把整局路线写好,可这和你真正自己操作时不一样。

CA-OPD像一位聪明教练。你每一步先提出答案,教练看自己有多相信它。如果答案很离谱,教练直接换成自己的答案,并让下一步从正确位置继续;如果答案还不错,就让你保留,同时告诉你其他答案各有多可能。开始时教练严格,熟练后逐渐放手。

论文用OCR和屏幕定位测试这种方法。小模型Qwen3.5-0.8B经过训练后,ScreenSpot-Pro达到45.92,而普通OPD只有40.82;OCRBench-v2英文达到52.47。随机替换并没有同样效果,所以关键不是教练帮忙次数,而是能否在真正会出问题的地方出手。

当然,这位教练本身也可能判断错,而且每一步询问大模型会增加训练成本。现在方法主要在GUI和OCR上验证。以后如果它能处理视频、手机操作和复杂工具链,就可能让更小、更便宜的视觉助手变得可靠。

术语表

On-Policy Distillation(在策略蒸馏)

学生用自己的策略生成训练轨迹,再让教师在这些真实访问状态上提供监督。它减少训练轨迹与推理轨迹之间的差异。

CA-OPD保留学生rollout特征,但选择性修复危险token。

Negative Log-Likelihood, NLL(负对数似然)

NLL=-log p,用于表示教师给某个候选token的支持强度;数值越低,教师越认可。它是绝对置信度而非相对排名。

CA-OPD用NLL阈值决定是否替换学生候选。

Prefix Repair(前缀修复)

把教师纠正后的token写回自回归前缀,使后续生成基于较可靠的历史。它不只是修改损失标签,而是修改未来状态。

实验表明无写回时性能接近OPD。

Forward KL(前向KL散度)

DKL(πT||πS)要求学生覆盖教师分布中的概率质量。论文只使用教师top-k分布并进行非负裁剪。

用于保留学生候选的位置。

Strict-to-Relaxed Schedule(严格到宽松调度)

训练早期设置较低NLL门槛,只有高可信候选才能保留;训练后期提高门槛,逐渐交还学生控制权。

论文采用cosine阈值退火。

开放问题 这项研究留下的未解疑问

  • 1 教师NLL是否经过校准会直接影响门控;不同模型、温度和领域的概率不可比时,固定阈值可能失效。
  • 2 top-k截断如何在长文本、罕见字符和多语言OCR中影响尾部知识,论文尚未系统回答。
  • 3 教师调用成本、缓存策略与在线部署吞吐之间如何平衡,仍缺少规模化评估。

应用场景

近期应用

可靠GUI代理

手机、桌面或网页自动化团队可用领域教师监督小型Qwen学生,重点修正低置信度坐标和动作token。训练需要截图、指令、结构化动作标签及教师模型;推理时仍只运行学生。

文档与屏幕OCR

票据、表格和屏幕阅读系统可在字符或坐标序列出现异常时进行教师纠正,降低局部识别错误造成的整段偏移。适合已有Qwen类模型和领域教师的团队。

远期愿景

多模态代理的安全训练

未来可把置信度门控扩展到视频、工具调用和长链任务,在危险动作前保留教师控制、在稳定阶段放权给学生,从而兼顾可靠性、成本与自主性。

原文摘要

Autoregressive vision language models unify heterogeneous perception tasks but are highly susceptible to compounding errors. On-policy distillation (OPD) bridges the training-inference mismatch by training students on their own rollouts. However, unreliable student predictions, especially early in training, can derail the trajectory and degrade the quality of teacher supervision. While recent interleaved distillation methods allow the teacher to verify and replace student tokens, they primarily rely on rigid ranking metrics rather than exact teacher confidence, and they overlook how intervention decisions can inform token-level supervision. To address this, we introduce Confidence-Aware On-Policy Distillation (CA-OPD), a framework that couples reliable rollout construction with adaptive supervision. CA-OPD utilizes teacher confidence to selectively correct unreliable student transitions, gradually transferring rollout control to the student via a strict-to-relaxed schedule. Crucially, CA-OPD aligns knowledge transfer with these intervention decisions: corrected positions receive direct cross-entropy supervision from the teacher's prediction, while retained positions benefit from the teacher's full predictive distribution. Evaluated in a multi-teacher setting for GUI grounding and optical character recognition, CA-OPD substantially improves the Qwen3.5-0.8B baseline across all six target benchmarks, including gains of $9.50$ points on ScreenSpot-Pro and $6.72$ points on OCRBench-v2 English. Controlled studies further show that the gains depend on intervention placement, progressive rollout control, and intervention-aligned supervision, rather than intervention frequency alone.

cs.CV