Safety is Contextual, LLM-Judges Are Not: Navigating the Rigid Priors of Evaluators

TL;DR

研究发现LLM评估器难以适应不同上下文和安全定义,尽管它们能从新信息中学习。

cs.AI 🔴 高级 2026-06-06 33 次浏览
Anissa Alloula Federico Licini Ava Batchkala Seraphina Goldfarb-Tarrant
LLM 安全评估 上下文信息 模型适应性 人机交互

核心发现

方法论

本研究评估了13种LLM模型在不同上下文和安全定义下的表现。通过对比人类标注的安全数据,分析了模型的适应性和可引导性。使用了MultilingualPrompts和NovelPrompts数据集,分别测试模型对新信息和演示的反应。

关键结果

  • 结果1:在NovelPrompts数据集上,提供上下文信息使F1分数平均提高10%。
  • 结果2:演示对模型评估能力的提升有限,F1分数仅提高0.02。
  • 结果3:错误演示对大多数模型的表现无显著影响。

研究意义

研究揭示了LLM评估器在不同文化和语言背景下的局限性,强调了模型在快速变化的世界中保持准确性的挑战。这为未来的安全评估方法提供了新的视角。

技术贡献

提出了LLM评估器的可引导性和适应性的新概念,展示了模型在面对新信息时的反应机制,并提供了一个新的评估框架来测试这些属性。

新颖性

首次系统性地分析了LLM评估器在不同上下文和安全定义下的适应性,填补了现有研究的空白。

局限性

  • 局限1:模型在面对与其先验知识冲突的上下文时,难以调整其评估。
  • 局限2:演示对模型的影响不一致,难以预测。

未来方向

未来研究可探索如何增强模型对新信息的适应性,以及开发更具灵活性的安全评估器。

AI 总览摘要

在当今数字化时代,评估用户请求和模型响应的安全性变得至关重要。然而,现有的LLM评估器在不同的上下文和安全定义下表现不一,难以适应快速变化的世界。本文研究了13种LLM模型在不同上下文和安全定义下的表现,发现虽然模型可以从新信息中学习,但在面对与其先验知识冲突的上下文时,难以调整其评估。

研究使用了MultilingualPrompts和NovelPrompts数据集,测试模型对新信息和演示的反应。结果表明,提供上下文信息可以显著提高模型的评估能力,而演示对模型的影响有限。错误演示对大多数模型的表现无显著影响,这表明模型在面对与其先验知识冲突的信息时具有一定的鲁棒性。

这些发现揭示了LLM评估器在不同文化和语言背景下的局限性,并为未来的安全评估方法提供了新的视角。未来研究可探索如何增强模型对新信息的适应性,以及开发更具灵活性的安全评估器,以应对快速变化的世界。

深度分析

研究背景

近年来,随着大规模语言模型(LLM)的发展,它们在各种任务中的应用越来越广泛。然而,如何评估这些模型的安全性仍然是一个挑战。现有的评估方法主要依赖于人类标注的数据,但这种方法在大规模应用中并不现实。

核心问题

核心问题在于LLM评估器在不同上下文和安全定义下的适应性。由于没有单一的标准答案,评估安全性变得复杂且难以验证。

核心创新

本文的创新在于提出了LLM评估器的可引导性和适应性的新概念,并开发了一个新的评估框架来测试这些属性。

方法详解

  • �� 选择13种LLM模型进行测试。
  • �� 使用MultilingualPrompts和NovelPrompts数据集。
  • �� 比较模型在不同上下文和安全定义下的表现。
  • �� 分析模型对新信息和演示的反应。

实验设计

实验设计包括使用两个主要数据集:MultilingualPrompts和NovelPrompts。通过提供正确和错误的上下文信息,测试模型的适应性和鲁棒性。

结果分析

结果表明,提供上下文信息可以显著提高模型的评估能力,而演示对模型的影响有限。错误演示对大多数模型的表现无显著影响。

应用场景

研究结果可用于改进LLM在安全评估中的应用,特别是在需要快速适应新信息的场景中。

局限与展望

模型在面对与其先验知识冲突的上下文时,难以调整其评估。此外,演示对模型的影响不一致,难以预测。

通俗解读 非专业人士也能看懂

想象你在一个厨房里,厨师是LLM评估器。厨师需要根据不同的食材和食谱来判断菜肴是否安全食用。问题在于,厨师有时会过于依赖自己过去的经验,而忽略了新的食材或食谱的变化。研究发现,当厨师获得新的食材信息时,他的判断会更准确,但如果食材信息与他的经验冲突,他可能会坚持自己的判断。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,你是裁判,负责判断玩家的行为是否安全。问题是,有时候游戏规则会改变,而你却不知道。研究发现,当你得到新的规则信息时,你的判断会更准确。但如果新规则和你之前的经验冲突,你可能会坚持自己的判断。是不是很有趣?

术语表

LLM (大规模语言模型)

一种基于大量数据训练的模型,用于生成和理解自然语言。

用于评估用户请求和模型响应的安全性。

上下文信息

在评估过程中提供的额外信息,用于帮助模型更准确地判断。

用于测试模型在不同情境下的适应性。

可引导性

模型根据不同安全定义调整其评估的能力。

研究模型在不同安全政策下的表现。

适应性

模型学习和应用新信息的能力。

测试模型对新信息的反应。

鲁棒性

模型在面对错误或误导性信息时保持稳定表现的能力。

分析模型对错误演示的反应。

开放问题 这项研究留下的未解疑问

  • 1 如何增强模型对快速变化信息的适应性?
  • 2 如何开发更具灵活性的安全评估器?

应用场景

近期应用

在线内容审核

使用LLM评估器快速判断内容的安全性,适用于社交媒体平台。

远期愿景

智能助手

开发能够适应不同文化和语言背景的智能助手,提高用户体验。

原文摘要

LLMs-as-judges are the only way to evaluate safety at scale. Despite their importance, LLM-judges themselves are rarely evaluated beyond human agreement in simple, static benchmarks. We therefore investigate two under-explored but crucial properties of LLMs-as-judges: their susceptibility to relying on in context-information, and their steerability to differing safety definitions, which may not align with their internal safety priors. We evaluate the safety judging abilities of many generalist LLMs and safety-specific judges, and investigate the impact of task demonstrations, novel in-context information, and changing safety definitions. We find that while LLM-judges can learn from new information, they are broadly unlikely to adjust their evaluations if the context or safety definition contradicts their prior.

cs.AI