NoveltyBench: Evaluating Language Models for Humanlike Diversity

TL;DR

NoveltyBench评估模型多样性,20个模型中大多表现低于人类,模型越大越缺乏多样性。

cs.CL 🔴 高级 2025-04-08 61 引用 71 次浏览
Yiming Zhang Harshita Diddee Susan Holm Hanchen Liu Xinyue Liu Vinay Samuel Barry Wang Daphne Ippolito
自然语言生成 模型评估 多样性 生成对抗 深度学习

核心发现

方法论

本文提出NoveltyBench基准,利用精心设计的1100个多样性激发性提示(包括人工筛选的NB-CURATED和真实用户交互的NB-WILDCHAT),结合基于功能等价分类的多样性指标(distinctk)和质量-新颖性融合指标(utilityk),全面评估20个前沿模型的输出多样性。通过训练DeBERTa-v3-large分类器实现输出的功能等价判定,结合用户模型(p=0.8)模拟用户交互中的累积效用,采用RewardBench中的Gemma-2-27B奖励模型评分生成质量,确保评估的科学性和可比性。

关键结果

  • 在20个模型中,最大模型Llama-3.3-70B和GPT-4o的平均不同生成数(distinctk)仅为1.94和2.88(10次采样),远低于人类平均值(约5.5),显示出明显的模式崩溃现象。模型的累积效用(utility)也普遍偏低,最大值仅为3.27(GPT-4o),远低于理想的10分满分,表明模型在多样性和质量兼顾方面存在严重不足。
  • 研究发现,模型规模越大,输出多样性反而越差,尤其是在同一模型家族中,较大模型的多样性明显低于较小模型。这一趋势挑战了传统观点,即模型能力越强,生成越丰富多样。通过在不同提示策略(如重采样、改写、上下文再生成)上的实验,发现后者能在一定程度上提升多样性,但依赖于特定提示技巧,模型本身的分布性多样性仍然不足。
  • 评估结果强调了当前模型在多样性方面的根本缺陷,尤其是在面对用户对多样化回答的需求时表现不足。这不仅影响模型的实用性,也提示未来训练应结合多样性优化目标,设计新的训练和评估范式,以平衡生成质量与多样性,从而实现更具人性化和个性化的AI系统。

研究意义

该研究揭示了现有最先进语言模型在多样性方面的严重不足,挑战了以往只关注准确性和逻辑推理的评估体系。通过引入NoveltyBench,提供了一个科学、系统的多样性评估工具,促使模型开发者关注模型的多样性能力,推动生成模型从单一“最优”输出向多样化、多角度的输出转变。这对于提升AI的个性化、创造性和用户体验具有深远意义,尤其在内容创作、个性化推荐和人机交互等应用场景中具有重要价值。同时,研究结果也为未来模型训练提供了新的方向,即在保证输出质量的基础上,增强模型的分布性多样性,避免模式崩溃,推动AI生成技术的持续创新。

技术贡献

本文提出了NoveltyBench作为一种新颖的多样性评估框架,结合基于功能等价的分类器和用户模型,创新性地定义了distinctk和utilityk指标,突破了传统只关注单一最优生成的评估限制。通过训练DeBERTa-v3-large实现输出的功能等价判定,结合RewardBench的质量评分,建立了多维度、多指标的评估体系,为模型多样性研究提供了标准化工具。实验中对20个前沿模型的系统评估,揭示了模型规模与多样性之间的逆相关关系,为模型设计和训练提供了新的理论依据。该方法的核心创新在于将多样性与质量融合考虑,模拟用户交互中的累积效用,推动生成模型向更符合人类偏好的方向发展。

新颖性

本研究首次提出基于功能等价分类的多样性指标(distinctk),并结合用户模型(patience p=0.8)设计累积效用(utilityk),实现对模型输出多样性和质量的联合评估。相比以往只关注单一最优生成的指标(如BLEU、ROUGE、BERTScore),本方法强调生成的多样性在实际应用中的价值,特别是在主观性、创造性任务中的重要性。此外,利用训练的DeBERTa分类器对输出进行功能等价判定,显著提升了多样性评估的准确性和可操作性。这一创新突破了传统评估的局限,为未来多样性优化提供了理论和实践基础。

局限性

  • 尽管NoveltyBench在多样性评估方面取得了突破,但其依赖人工筛选的提示和分类器,可能在多样性定义和判定上存在偏差,影响评估的客观性和普适性。
  • 模型在特定任务和提示下的多样性表现差异较大,当前指标难以完全覆盖所有类型的多样性(如风格、内容、语调等),未来需引入更多维度的评估标准。
  • 实验主要集中在公开模型和特定数据集上,尚未充分验证在实际应用中的泛化能力和鲁棒性,未来应扩展到更多场景和模型类型。

未来方向

未来研究将着重于提升多样性指标的全面性和鲁棒性,探索自适应、多维度的多样性评估方法。同时,结合多任务训练和强化学习技术,优化模型在多样性和质量之间的平衡,推动模型在实际应用中的多样性表现。此外,还应考虑用户个性化偏好和上下文信息,开发更智能的多样性调控机制,满足不同用户的多样化需求,推动生成模型向更人性化、创造性方向发展。

AI 总览摘要

在当今人工智能领域,语言模型(Large Language Models, LLMs)已展现出令人瞩目的能力,尤其在文本理解、推理和知识问答方面取得了显著突破。然而,随着模型规模的不断扩大,研究者逐渐发现这些模型在生成多样性方面存在严重的瓶颈。这一问题被称为“模式崩溃”,即模型倾向于输出少量的高概率答案,缺乏丰富的变异性,难以满足用户多样化的需求。

传统的模型评估体系主要关注生成内容的准确性、逻辑性和相关性,忽视了输出的多样性。这导致模型在实际应用中表现出“单一答案”的局限,尤其在主观性、创造性任务中表现尤为明显。为此,本文提出了NoveltyBench,一个专门设计的多样性评估基准,旨在系统衡量模型在生成多样化、具有高质量的多答案集合中的表现。

NoveltyBench包含1100个经过精心设计或筛选的提示,涵盖随机性、事实、创造性和主观性四大类别。通过结合基于功能等价的分类器(训练自DeBERTa-v3-large)和用户模型(p=0.8),实现对模型输出的多样性和质量的联合评估。具体指标包括distinctk(衡量不同生成的数量)和utilityk(考虑内容新颖性和用户体验的累积效用)。此外,采用RewardBench中的Gemma-2-27B奖励模型对生成质量进行评分,确保评估的科学性和可比性。

在对20个最前沿模型的系统评估中,结果显示大部分模型在多样性方面表现不佳,最大模型Llama-3.3-70B和GPT-4o的平均不同生成数(distinctk)仅为1.94和2.88(10次采样),远低于人类平均值(约5.5)。更令人震惊的是,模型规模越大,输出多样性越差,反映出模型能力的“规模悖论”。这些发现表明,现有模型在追求单一最优解的同时,忽视了多样性的重要性,限制了其在个性化和创造性应用中的潜力。

为了改善这一状况,本文还探索了多种提示策略,包括重采样、改写提示和上下文再生成。结果显示,后者在提升多样性方面效果显著,甚至能超越人类水平,证明模型在特定条件下可以生成丰富多彩的答案。这一发现为未来模型设计提供了新的思路,即通过引导和调控模型输出分布,实现多样性与质量的平衡。

总体而言,本文的研究不仅揭示了当前生成模型在多样性方面的根本缺陷,也为未来的模型训练和评估提供了新的工具和方向。推动模型在保持高质量的同时,增强多样性能力,将极大提升AI的实用性和用户体验,特别是在内容创作、个性化推荐和人机交互等关键领域。未来工作应继续优化多样性指标,结合多任务学习和强化学习技术,推动生成模型向更具创造性和个性化的方向发展。

深度解读

原文摘要

Language models have demonstrated remarkable capabilities on standard benchmarks, yet they struggle increasingly from mode collapse, the inability to generate diverse and novel outputs. Our work introduces NoveltyBench, a benchmark specifically designed to evaluate the ability of language models to produce multiple distinct and high-quality outputs. NoveltyBench utilizes prompts curated to elicit diverse answers and filtered real-world user queries. Evaluating 20 leading language models, we find that current state-of-the-art systems generate significantly less diversity than human writers. Notably, larger models within a family often exhibit less diversity than their smaller counterparts, challenging the notion that capability on standard benchmarks translates directly to generative utility. While prompting strategies like in-context regeneration can elicit diversity, our findings highlight a fundamental lack of distributional diversity in current models, reducing their utility for users seeking varied responses and suggesting the need for new training and evaluation paradigms that prioritize diversity alongside quality.

cs.CL

参考文献 (20)

Evaluating the State-of-the-Art of End-to-End Natural Language Generation: The E2E NLG Challenge

Ondrej Dusek, Jekaterina Novikova, Verena Rieser

2019 249 引用 查看解读 →

Judging LLM-as-a-judge with MT-Bench and Chatbot Arena

Lianmin Zheng, Wei-Lin Chiang, Ying Sheng 等

2023 10642 引用 查看解读 →

Whose Opinions Do Language Models Reflect?

Shibani Santurkar, Esin Durmus, Faisal Ladhak 等

2023 984 引用 查看解读 →

Simultaneous Translation and Paraphrase for Language Education

Stephen Mayhew, K. Bicknell, Chris Brust 等

2020 41 引用

DeBERTa: Decoding-enhanced BERT with Disentangled Attention

Pengcheng He, Xiaodong Liu, Jianfeng Gao 等

2020 4050 引用 查看解读 →

Evaluating the Evaluation of Diversity in Natural Language Generation

Guy Tevet, Jonathan Berant

2020 167 引用 查看解读 →

Generating Diverse Translations with Sentence Codes

Raphael Shu, Hideki Nakayama, Kyunghyun Cho

2019 54 引用

Boosting Dialog Response Generation

Wenchao Du, A. Black

2019 44 引用

BERTScore: Evaluating Text Generation with BERT

Tianyi Zhang, Varsha Kishore, Felix Wu 等

2019 9398 引用 查看解读 →

Towards Measuring the Representation of Subjective Global Opinions in Language Models

Esin Durmus, Karina Nyugen, Thomas Liao 等

2023 473 引用 查看解读 →

(Preprint)

Sarah Verschueren, J. van Aalst, A. Bangels 等

2018 5204 引用

Hierarchical Neural Story Generation

Angela Fan, M. Lewis, Yann Dauphin

2018 2083 引用 查看解读 →

Texygen: A Benchmarking Platform for Text Generation Models

Yaoming Zhu, Sidi Lu, Lei Zheng 等

2018 914 引用 查看解读 →

Deal or No Deal? End-to-End Learning of Negotiation Dialogues

M. Lewis, Denis Yarats, Yann Dauphin 等

2017 503 引用 查看解读 →

A Diversity-Promoting Objective Function for Neural Conversation Models

Jiwei Li, Michel Galley, Chris Brockett 等

2015 2800 引用 查看解读 →

Rank-biased precision for measurement of retrieval effectiveness

Alistair Moffat, J. Zobel

2008 681 引用

ROUGE: A Package for Automatic Evaluation of Summaries

Chin-Yew Lin

2004 21554 引用

Bleu: a Method for Automatic Evaluation of Machine Translation

Kishore Papineni, Salim Roukos, T. Ward 等

2002 34375 引用

Modeling Human Subjectivity in LLMs Using Explicit and Implicit Human Factors in Personas

Salvatore Giorgi, Tingting Liu, A. Aich 等

2024 29 引用 查看解读 →

2 OLMo 2 Furious

Team OLMo, Pete Walsh, Luca Soldaini 等

2024 248 引用 查看解读 →

被引用 (20)

The One-Word Census: Answer-Choice Conformity Across 44 Language Models

2026 2 引用 ⭐ 高影响力 查看解读 →

Jointly Reinforcing Diversity and Quality in Language Model Generations

2025 73 引用 ⭐ 高影响力 查看解读 →

Inducing Sustained Creativity and Diversity in Large Language Models

2026 2 引用 ⭐ 高影响力 查看解读 →

Random Policy Valuation is Enough for LLM Reasoning with Verifiable Rewards

2025 9 引用 ⭐ 高影响力 查看解读 →

"I've Seen How This Goes": Characterizing Diversity via Progressive Conditional Surprise

2026 ⭐ 高影响力 查看解读 →

No Single Best Model for Diversity: Learning a Router for Sample Diversity

2026 1 引用 ⭐ 高影响力 查看解读 →

G2: Guided Generation for Enhanced Output Diversity in LLMs

2025 14 引用 ⭐ 高影响力 查看解读 →

Optimizing Diversity and Quality through Base-Aligned Model Collaboration

2025 7 引用 ⭐ 高影响力 查看解读 →

Enhancing Diversity of LLM-Generated Educational Tasks

2025 1 引用 查看解读 →

What Shapes a Creative Machine Mind? Comprehensively Benchmarking Creativity in Foundation Models

2025 5 引用 查看解读 →

Polychromic Objectives for Reinforcement Learning

2025 9 引用 查看解读 →

LLM-NAS: LLM-driven Hardware-Aware Neural Architecture Search

2025 1 引用 查看解读 →

Death of the Novel(ty): Beyond n-Gram Novelty as a Metric for Textual Creativity

2025 4 引用 查看解读 →

Mode-Conditioning Unlocks Superior Test-Time Scaling

2025 5 引用 查看解读 →

Beware of Reasoning Overconfidence: Pitfalls in the Reasoning Process for Multi-solution Tasks

2025 1 引用 查看解读 →

MindGPT-4ov: An Enhanced MLLM via a Multi-Stage Post-Training Paradigm

2025 9 引用 查看解读 →

String Seed of Thought: Prompting LLMs for Distribution-Faithful and Diverse Generation

2025 6 引用 查看解读 →

The Homogenization Problem in LLMs: Towards Meaningful Diversity in AI Safety

2026 1 引用 查看解读 →

DPWriter: Reinforcement Learning with Diverse Planning Branching for Creative Writing

2026 4 引用 查看解读 →

Language of Thought Shapes Output Diversity in Large Language Models

2026 3 引用 查看解读 →