SibylSense: Adaptive Rubric Learning via Memory Tuning and Adversarial Probing

TL;DR

SibylSense通过记忆调优和对抗探测生成自适应评分标准,提升RL性能。

cs.CL 🔴 高级 2026-02-24 6 次浏览
Yifei Xu Guilherme Potje Shivam Shandilya Tiancheng Yuan Leonardo de Oliveira Nunes Rakshanda Agarwal Saeid Asgari Adam Atkinson Emre Kıcıman Songwu Lu Ranveer Chandra Tusher Chakraborty
强化学习 自适应学习 评分标准 记忆调优 对抗探测

核心发现

方法论

SibylSense通过一个可调的记忆库来适应冻结的评分标准生成器。记忆库通过验证器测量的项目奖励更新,交替进行记忆调优和对抗性策略更新,以生成满足评分标准的候选答案。

关键结果

  • 在两个开放性任务上,SibylSense生成的评分标准更具辨别力,并提高了下游RL性能。相比静态和非自适应基线,SibylSense在RaR-Medicine数据集上提高了6%的准确率。
  • 在GovReport数据集中,SibylSense的表现优于基于少量样本的评分标准,显示出更强的区分能力。
  • 对抗性候选刷新进一步提高了性能,尤其是在RaR-Medicine数据集上。

研究意义

该研究通过自适应评分标准生成,解决了开放性生成任务中奖励设计的挑战。SibylSense在学术界和工业界具有重要意义,因为它提高了RL模型在多维度任务中的性能,解决了传统评分标准难以扩展的问题。

技术贡献

SibylSense通过记忆调优和对抗探测,提供了一种新的自适应评分标准生成方法。与现有方法相比,它不依赖于固定的评分标准池,而是动态调整评分标准以适应策略变化。

新颖性

SibylSense首次将记忆调优与对抗探测结合,用于自适应评分标准生成。与传统方法相比,它能够动态调整评分标准,捕捉新的质量维度。

局限性

  • 该方法可能在处理非常复杂的任务时表现不佳,因为记忆库的更新可能不足以捕捉所有质量维度。
  • 对抗性候选刷新可能导致计算成本增加。

未来方向

未来的研究可以探索如何在更大规模的任务中应用SibylSense,并研究如何进一步优化记忆库的更新机制,以提高效率和准确性。

AI 总览摘要

在开放性生成任务中,设计对齐且稳健的奖励是强化学习后训练的关键障碍。传统的评分标准要么成本高昂,要么难以扩展,导致奖励黑客问题。SibylSense通过记忆调优和对抗探测提供了一种自适应的评分标准生成方法。其核心在于通过一个可调的记忆库来适应冻结的评分标准生成器,交替进行记忆调优和对抗性策略更新,以生成满足评分标准的候选答案。这种方法在两个开放性任务上表现出色,生成的评分标准更具辨别力,并提高了下游RL性能。SibylSense不仅在学术界和工业界具有重要意义,还为未来的研究提供了新的方向,特别是在如何处理复杂任务和优化记忆库更新机制方面。

深度分析

研究背景

近年来,随着大规模语言模型的兴起,开放性生成任务的需求不断增加。然而,这些任务的成功标准往往是任务依赖的,多维度的,传统的评分标准难以捕捉这些复杂的质量维度。

核心问题

核心问题在于如何设计对齐且稳健的奖励函数,以便在开放性生成任务中指导RL模型的优化。传统方法要么成本高昂,要么难以扩展,导致奖励黑客问题。

核心创新

SibylSense的核心创新在于通过记忆调优和对抗探测生成自适应评分标准。记忆调优通过验证器测量的项目奖励更新记忆库,对抗探测则通过生成满足评分标准的候选答案来缩小辨别差距。

方法详解

  • �� SibylSense通过一个可调的记忆库来适应冻结的评分标准生成器。

  • �� 记忆库通过验证器测量的项目奖励更新。

  • �� SibylSense交替进行记忆调优和对抗性策略更新,以生成满足评分标准的候选答案。

实验设计

实验在RaR-Medicine和GovReport数据集上进行,使用Qwen3-32B作为评分标准生成器,Qwen3-8B作为答案生成模型,GPT-4o作为验证器。实验结果显示,SibylSense在两个数据集上均表现优于基线。

结果分析

SibylSense在RaR-Medicine数据集上提高了6%的准确率,在GovReport数据集中表现优于基于少量样本的评分标准。对抗性候选刷新进一步提高了性能。

应用场景

SibylSense可用于需要自适应评分标准的开放性生成任务,如文档撰写、分析报告和问答系统。

局限与展望

该方法可能在处理非常复杂的任务时表现不佳,因为记忆库的更新可能不足以捕捉所有质量维度。对抗性候选刷新可能导致计算成本增加。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭,SibylSense就像一个智能助手,帮助你根据食材和口味调整食谱。它会记住哪些调味料搭配得好,并在下次做饭时给你建议。通过这种方式,它不断学习和改进,帮助你做出更美味的菜肴。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,SibylSense就像一个超级聪明的助手,帮助你在游戏中做出更好的选择。它会记住哪些策略有效,并在下次游戏时给你建议。这样,你就能在游戏中表现得更好,打败更多的对手!

术语表

强化学习 (Reinforcement Learning)

一种机器学习方法,通过奖励和惩罚来训练模型,使其在特定任务中表现更好。

在论文中用于优化开放性生成任务的模型。

评分标准 (Rubric)

用于评估生成任务质量的标准,通常由多个维度组成。

用于指导RL模型的优化。

记忆调优 (Memory Tuning)

通过更新记忆库中的信息来改进模型性能的方法。

用于自适应评分标准生成。

对抗探测 (Adversarial Probing)

通过生成具有挑战性的候选答案来测试和改进模型的方法。

用于缩小评分标准生成中的辨别差距。

RaR-Medicine

一个医疗推理问答数据集,用于评估开放性生成任务。

作为实验数据集之一。

开放问题 这项研究留下的未解疑问

  • 1 如何在更大规模的任务中应用SibylSense,并优化记忆库的更新机制。
  • 2 对抗性候选刷新在计算成本上的影响及其优化方法。

应用场景

近期应用

文档撰写

SibylSense可用于自动生成高质量的文档,帮助用户提高工作效率。

远期愿景

智能助手

SibylSense可发展为智能助手,帮助用户在各种任务中做出更好的决策。

原文摘要

Designing aligned and robust rewards for open-ended generation remains a key barrier to RL post-training. Rubrics provide structured, interpretable supervision, but scaling rubric construction is difficult: expert rubrics are costly, prompted rubrics are often superficial or inconsistent, and fixed-pool discriminative rubrics can saturate and drift, enabling reward hacking. We present SibylSense, an inference-time learning approach that adapts a frozen rubric generator through a tunable memory bank of validated rubric items. Memory is updated via verifier-based item rewards measured by reference-candidate answer discriminative gaps from a handful of examples. SibylSense alternates memory tuning with a rubric-adversarial policy update that produces rubric-satisfying candidate answers, shrinking discriminative gaps and driving the rubric generator to capture new quality dimensions. Experiments on two open-ended tasks show that SibylSense yields more discriminative rubrics and improves downstream RL performance over static and non-adaptive baselines.

cs.CL cs.AI cs.LG