核心发现
方法论
OS-Oracle框架整合数据合成、两阶段训练和跨平台评估。首先,使用自动化数据管道生成高质量的批评数据集。其次,采用监督微调和一致性保持的群体相对策略优化(CP-GRPO)进行训练。最后,通过OS-Critic Bench进行全面评估。
关键结果
- OS-Oracle-7B在OS-Critic Bench上表现出色,尤其在移动领域超越专有模型,显示出在移动、桌面和网页平台上的跨平台能力。
- 作为预批评器,OS-Oracle-7B提升了UI-TARS-1.5-7B在OSWorld和AndroidWorld环境中的性能。
- 实验结果表明,OS-Oracle-7B在多个在线基准中实现了性能提升,如OSWorld从29.2%提高到31.0%。
研究意义
OS-Oracle框架通过提供高质量的批评数据集和评估基准,解决了当前批评模型在多平台数据缺乏和评估困难的问题。它不仅在学术界推动了批评模型的发展,也为工业界提供了更可靠的GUI自动化解决方案。
技术贡献
OS-Oracle在批评模型的训练和评估中引入了创新的两阶段训练策略和跨平台评估基准,显著提高了模型的判断准确性和一致性。通过自动化数据管道,生成了大量高质量的批评数据,填补了多平台数据的空白。
新颖性
OS-Oracle首次实现了跨平台GUI批评模型的全面框架,结合了数据合成和创新训练策略,与现有的单平台或有限平台解决方案相比,具有显著的创新性。
局限性
- OS-Oracle在处理极端复杂的GUI任务时可能表现不佳,尤其是在数据集未涵盖的特殊场景中。
- 当前的批评模型在实时应用中的响应速度可能受到限制。
未来方向
未来的研究可以集中在扩展数据集的多样性和规模,以及提高批评模型在实时应用中的响应速度和准确性。此外,探索更多的应用场景和优化策略也是重要的研究方向。
AI 总览摘要
随着视觉语言模型(VLM)的快速发展,计算机使用代理(CUA)在图形用户界面(GUI)导航和操作方面的能力显著提升。然而,CUA在长时间工作流程中容易积累错误,导致不必要的后果。OS-Oracle框架通过提供一个可扩展的数据管道和两阶段训练方法,解决了批评模型在多平台数据缺乏和评估困难的问题。
OS-Oracle框架的核心是一个自动化的数据管道,能够生成高质量的批评数据集,并结合监督微调和一致性保持的群体相对策略优化(CP-GRPO)进行训练。通过OS-Critic Bench,OS-Oracle实现了在移动、桌面和网页平台上的全面评估,显著提高了批评模型的性能。
实验结果表明,OS-Oracle-7B在多个在线基准中实现了性能提升,如OSWorld从29.2%提高到31.0%。这一框架不仅在学术界推动了批评模型的发展,也为工业界提供了更可靠的GUI自动化解决方案。未来的研究可以集中在扩展数据集的多样性和规模,以及提高批评模型在实时应用中的响应速度和准确性。
深度分析
研究背景
近年来,视觉语言模型(VLM)在一般视觉语言任务中表现出色,并在理解、导航和操作图形用户界面(GUI)方面显示出潜力。计算机使用代理(CUA)通过与GUI环境(如桌面、移动、网页等)交互,能够自主完成用户指定的任务,为数字任务自动化奠定了坚实的基础。然而,当前的CUA在实践中仍然存在操作失败、错误状态恢复效率低、任务终止时机不当和元素定位不准确等问题。
核心问题
CUA在长时间工作流程中容易积累错误,导致不必要的后果。批评模型的有效性受到缺乏多样化、高质量的GUI反馈数据和用于计算机使用的步骤级评估的公共基准的限制。为了解决这些问题,OS-Oracle框架通过提供一个可扩展的数据管道和两阶段训练方法,旨在提高批评模型的性能。
核心创新
OS-Oracle的核心创新在于其自动化数据管道和两阶段训练策略。自动化数据管道能够生成高质量的批评数据集,填补了多平台数据的空白。两阶段训练策略结合了监督微调和一致性保持的群体相对策略优化(CP-GRPO),显著提高了模型的判断准确性和一致性。此外,OS-Critic Bench作为跨平台评估基准,提供了全面的评估标准。
方法详解
- �� 自动化数据管道:从现有轨迹数据集中提取正样本,并通过规则生成特定错误类型的负样本。
- �� 两阶段训练策略:首先进行监督微调,建立核心判别和推理能力;然后应用一致性保持的群体相对策略优化(CP-GRPO),通过一致性奖励提高模型的判别能力和推理-判断一致性。
- �� OS-Critic Bench:从现有计算机使用基准中采样轨迹,并由人类专家检查和分配二进制标签,以确保数据集的高质量。
实验设计
实验设计包括使用Qwen2.5-VL-7B-Instruct模型在OS-Oracle数据集上进行两阶段训练。首先进行监督微调,然后在CP-GRPO阶段进一步优化。评估基于OS-Critic Bench,涵盖移动、网页和桌面平台。实验结果显示,OS-Oracle-7B在多个在线基准中实现了性能提升,如OSWorld从29.2%提高到31.0%。
结果分析
OS-Oracle-7B在OS-Critic Bench上表现出色,尤其在移动领域超越专有模型,显示出在移动、桌面和网页平台上的跨平台能力。作为预批评器,OS-Oracle-7B提升了UI-TARS-1.5-7B在OSWorld和AndroidWorld环境中的性能。实验结果表明,OS-Oracle-7B在多个在线基准中实现了性能提升,如OSWorld从29.2%提高到31.0%。
应用场景
OS-Oracle框架在多平台GUI批评模型中具有广泛的应用前景。它可以提高现有GUI代理的性能,特别是在移动、桌面和网页平台上。此外,OS-Oracle还可以作为批评模型的基础,进一步推动批评模型在学术界和工业界的发展。
局限与展望
尽管OS-Oracle在多平台批评模型中表现出色,但在处理极端复杂的GUI任务时可能表现不佳,尤其是在数据集未涵盖的特殊场景中。此外,当前的批评模型在实时应用中的响应速度可能受到限制。未来的研究可以集中在扩展数据集的多样性和规模,以及提高批评模型在实时应用中的响应速度和准确性。
通俗解读 非专业人士也能看懂
想象你在厨房里做饭。OS-Oracle就像一个聪明的助手,帮助你在每一步之前检查你的动作是否正确。比如,你打算在锅里加盐,这个助手会提醒你先尝一尝汤的味道,确保不加太多盐。这个助手不仅能在厨房里帮你,也能在其他地方,比如在手机或电脑上帮你完成任务。它会在你做出决定之前,帮你检查每一个步骤,确保你不会犯错。就像一个无所不知的助手,OS-Oracle帮助你在各种平台上完成任务。
简单解释 像给14岁少年讲一样
嘿,小伙伴!想象一下你在玩一个超级复杂的游戏,你需要在不同的关卡中做出很多决定。OS-Oracle就像是一个超级聪明的游戏助手,它会在你每次做决定之前帮你检查一下,确保你不会犯错。比如,你要选择一个道具,这个助手会告诉你哪个道具最适合当前的关卡。它不仅能在游戏中帮你,也能在你用手机或电脑做其他事情时帮你。OS-Oracle就像一个无所不知的助手,帮助你在各种平台上完成任务。
术语表
批评模型 (Critic Model)
用于评估代理在GUI任务中每一步操作是否正确的模型。
在OS-Oracle框架中,批评模型用于评估代理的操作。
监督微调 (Supervised Fine-Tuning)
通过监督学习对模型进行微调,以提高其在特定任务上的性能。
OS-Oracle的训练策略之一,建立核心判别和推理能力。
一致性保持的群体相对策略优化 (Consistency-Preserving Group Relative Policy Optimization)
一种优化策略,通过一致性奖励提高模型的判别能力和推理-判断一致性。
OS-Oracle的训练策略之一,用于提高模型的判别能力。
OS-Critic Bench
用于评估批评模型性能的跨平台基准,涵盖移动、网页和桌面平台。
OS-Oracle框架中的评估基准。
视觉语言模型 (Vision-Language Model)
结合视觉和语言信息进行任务处理的模型。
OS-Oracle框架中使用的基础模型。
开放问题 这项研究留下的未解疑问
- 1 如何在实时应用中提高批评模型的响应速度和准确性?
- 2 在极端复杂的GUI任务中,如何提高批评模型的性能?
应用场景
近期应用
移动应用优化
通过OS-Oracle提升移动平台上GUI代理的性能,减少错误操作。
桌面应用优化
在桌面平台上应用OS-Oracle,提高任务完成的准确性和效率。
远期愿景
跨平台批评模型标准化
OS-Oracle有望成为跨平台批评模型的标准,推动学术界和工业界的发展。
原文摘要
With VLM-powered computer-using agents (CUAs) becoming increasingly capable at graphical user interface (GUI) navigation and manipulation, reliable step-level decision-making has emerged as a key bottleneck for real-world deployment. In long-horizon workflows, errors accumulate quickly and irreversible actions can cause unintended consequences, motivating critic models that assess each action before execution. While critic models offer a promising solution, their effectiveness is hindered by the lack of diverse, high-quality GUI feedback data and public critic benchmarks for step-level evaluation in computer use. To bridge these gaps, we introduce OS-Oracle that makes three core contributions: (1) a scalable data pipeline for synthesizing cross-platform GUI critic data; (2) a two-stage training paradigm combining supervised fine-tuning (SFT) and consistency-preserving group relative policy optimization (CP-GRPO); (3) OS-Critic Bench, a holistic benchmark for evaluating critic model performance across Mobile, Web, and Desktop platforms. Leveraging this framework, we curate a high-quality dataset containing 310k critic samples. The resulting critic model, OS-Oracle-7B, achieves state-of-the-art performance among open-source VLMs on OS-Critic Bench, and surpasses proprietary models on the mobile domain. Furthermore, when serving as a pre-critic, OS-Oracle-7B improves the performance of native GUI agents such as UI-TARS-1.5-7B in OSWorld and AndroidWorld environments. The code is open-sourced at https://github.com/numbmelon/OS-Oracle.