Death of the Novel(ty): Beyond n-Gram Novelty as a Metric for Textual Creativity

TL;DR

Using n-gram novelty as a sole metric for textual creativity is inadequate; models and experts show high correlation but also significant divergence, emphasizing multi-dimensional evaluation.

cs.CL 🔴 Advanced 2025-09-27 56 views
Arkadiy Saakyan Najoung Kim Smaranda Muresan Tuhin Chakrabarty
NLP Creativity Evaluation Language Models n-gram AI Assessment

Key Findings

Methodology

This study analyzes 8,618 expert annotations on human and AI-generated texts, examining the relationship between n-gram novelty (via infini-gram) and perceived creativity. Hierarchical logistic regression models assess how perplexity correlates with creativity, controlling for raters and topics. Additionally, open-source models (OLMo, OLMo-2) and closed-source models (GPT-5, Claude 4.1) generate texts evaluated for novelty and pragmaticality. Expression-level matching tasks evaluate models' ability to identify novel and non-pragmatic expressions, comparing their F1 scores against expert annotations.

Key Results

  • Approximately 91% of top-quartile n-gram novel expressions are not judged as creative by experts, indicating that novelty alone is insufficient. High n-gram novelty correlates negatively with pragmaticality in open-source models, but shows no such effect in human text.
  • Models outperform random baselines in identifying novel expressions (F1 > 40), yet struggle with non-pragmatic expressions (F1 < 20). The scores of LLMs align closely with expert preferences, validating their potential as automatic judges.
  • 封闭源模型在创造力识别方面表现较差,提示训练数据的关键作用。模型在识别非合理表达方面仍有明显不足,表明需要多维度评估体系。

Significance

本研究质疑单一n-gram新颖度作为创造力指标的有效性,强调内容合理性和语境适应性的重要性。利用大模型作为表达级评判工具,显著提升自动化评估的准确性,为AI内容生成的质量控制和创新能力提供新思路。这对于推动AI与人类合作中的内容创新具有深远意义,也为未来多维度、自动化的创造力评估体系奠定基础。

Technical Contribution

提出结合专家标注与多模型评估的统计框架,利用大模型(如GPT-5、Claude 4.1)进行表达级判别,超越传统单一频次指标。开发多模型、多维度的自动化评价体系,验证其在识别新颖与非合理表达中的优越性,为自动化创造力评估提供新工具。

Novelty

首次系统性分析n-gram新颖度与专家创造力判断的偏差,揭示其在开源与封闭源模型中的不同表现。提出用大型语言模型作为表达级评判工具,突破单纯统计频次的局限,推动自动化评估方法的发展。

Limitations

  • 研究主要集中在小说文本,未来需验证在其他文本类型的适用性。
  • 模型评判依赖训练数据和标注者,存在偏差,难以完全模拟人类复杂判断。
  • 封闭源模型的训练数据不可得,影响结果的可解释性和可复现性。

Future Work

未来将结合多模态数据(如图像、音频)丰富评估体系,探索多任务学习提升模型理解与判别能力,推动标准化和普适化。同时,研究如何结合用户反馈优化创造性输出,促进人机协作创新。

AI Executive Summary

近年来,深度学习和预训练模型推动了自然语言生成的快速发展。尽管n-gram新颖度成为衡量文本创新的常用指标,但其局限性逐渐显现。本文分析8,618份专家标注,发现高n-gram新颖度并不总伴随创造性,约91%的高新颖表达未获专家认可。研究还揭示在开源模型中,追求新颖反而降低合理性,而在人工文本中无明显关系。为解决这一问题,作者提出利用大型语言模型(如GPT-5、Claude 4.1)作为表达级评判工具,显著优于传统指标。实验显示,模型在识别新颖表达(F1超过40)方面表现优异,但在识别非合理表达(F1低于20)方面仍有差距。模型的评判结果与专家偏好高度一致,验证了其应用潜力。这项工作不仅挑战了以往单一统计指标的局限,也为未来多维度、自动化的文本创造力评估提供了理论基础和技术路径。未来,结合多模态信息,优化模型性能,将推动自动化评估体系的标准化发展,为AI内容生成与人类创造力融合开辟新局。

Deep Analysis

Background

近年来,深度学习和预训练模型(如GPT-3、BERT)推动了自然语言生成的快速发展。早期研究多依赖频次统计和人工评估,缺乏系统性量化指标。随着工具如WiMBD、Rusty-DAWG、infini-gram的出现,尝试用统计新颖度衡量创新性,但忽视内容合理性和语境适应性。学界逐渐认识到,创造力应包括新颖性、合理性和适切性,单一指标难以全面反映文本质量。本文在此基础上,结合专家标注数据,提出多维度评价体系,推动自动化创造力评估的发展。

Core Problem

现有指标如n-gram新颖度虽能反映一定的创新程度,但存在偏差。高新颖度不一定代表创造性,尤其在开源模型中,追求新颖反而降低合理性,影响生成内容的质量。此外,缺乏自动化工具模拟专家细粒度判断,限制大规模评估。单一指标难以兼顾内容的多方面质量,亟需更科学的多维度评估体系,以提升内容的创新性和合理性。

Innovation

本研究的创新点包括:1)系统分析n-gram新颖度与专家创造力判断的偏差,揭示其局限性;2)提出利用大规模语言模型(如GPT-5、Claude 4.1)作为表达级评判工具,显著优于传统统计指标;3)开发多模型、多维度的自动化评估框架,结合专家标注数据,提升评估的准确性与可扩展性。这些创新突破了以往仅依赖频次的局限,为自动化创造力评估提供了新思路。

Methodology

  • �� 收集8,618份专家对人类与AI生成文本的细粒度标注,涵盖新颖度、合理性和通顺性;
  • �� 利用infinigram工具计算表达的n-gram新颖度,采用最大后退概率(∞-概率)估算困惑度(perplexity);
  • �� 构建混合效应逻辑回归模型,分析困惑度与创造力、合理性关系,控制标注者和文本主题变异;
  • �� 生成文本采用开源模型(OLMo、OLMo-2)和封闭源模型(GPT-5、Claude 4.1),评估模型在识别新颖与非合理表达上的表现;
  • �� 设计表达级“近似匹配”任务,利用LLMs进行新颖性和合理性判别,比较模型与专家的F1得分。

Experiments

实验采用小说文本,内容来自《纽约客》,确保多样性。用开源模型生成对应文本,避免数据泄露。专家标注表达的合理性与新颖度。模型评估指标包括困惑度和F1分数,比较不同模型在识别新颖和非合理表达上的性能。引入偏差校正,确保评估公平性。还进行跨模型对比,验证模型在不同任务中的表现差异。实验设计合理,确保结论的稳健性。

Results

统计显示,91%的高新颖表达未被专家评为创造性,说明新颖度不足以作为唯一指标。高新颖度在开源模型中与合理性呈负相关,模型在识别新颖表达方面表现优异(F1 > 40),但在识别非合理表达时表现较差(F1 < 20)。模型的评分与专家偏好高度相关,验证其潜在应用价值。封闭源模型在创造力识别方面表现较差,提示训练数据的重要性。研究还发现,单纯追求新颖可能降低内容合理性。

Applications

该评估体系适用于自动内容审核、创意写作辅助、AI内容质量控制。企业和研究机构可用模型快速筛查高质量文本,提升创新效率。未来结合多模态信息,有望实现更全面的创造力评价体系,推动AI与人类合作中的创新表达。

Limitations & Outlook

研究主要集中在小说文本,泛化到其他类型仍需验证。模型评判依赖训练数据和标注者,存在偏差。封闭源模型训练数据不可得,影响可解释性。未来应考虑多样化文本和多模态信息,提升鲁棒性。

Plain Language Accessible to non-experts

想象一个工厂在生产不同的产品。传统方法就像只看产品是否新颖(比如颜色或形状),但这不能保证产品是否实用或符合需求。真正好的产品不仅要新,还要符合使用场景,比如一把椅子要稳固、舒适。AI生成文本也是一样,不能只看它有多新,还要看它是否合理、贴切。研究发现,只看新颖的表达,容易误判内容的价值。有时候,虽然用了新词,但内容不合理或不连贯。科学家用特殊的电脑程序(叫大语言模型)帮忙判断,发现这些程序比单纯统计新词更能判断内容好坏。未来,我们希望用这些智能程序,帮老师更准确地评判学生作文,让每个人都能写出既新颖又合理的好文章!

ELI14 Explained like you're 14

想象你在学校写作文,老师说好作文不仅要有新奇的点子,还要写得合理。现在,有些人用电脑帮写作文,只看用了哪些新词,但这样不一定好,因为内容可能不合理或不连贯。研究发现,只看新颖的表达,不能完全判断作文的好坏。有时候,虽然用了新词,但内容不合理或不连贯。科学家用一些特别的电脑程序(叫大语言模型)帮忙判断,发现这些程序比单纯统计新词更能判断作文的质量。未来,我们希望用这些智能程序,帮老师更公平、更准确地评判学生的作文,让每个人都能写出既新颖又合理的好文章!

Abstract

N-gram novelty is widely used to evaluate language models' ability to generate text outside of their training data. More recently, it has also been adopted as a metric for measuring textual creativity. However, theoretical work on creativity suggests that this approach may be inadequate, as it does not account for creativity's dual nature: novelty (how original the text is) and appropriateness (how sensical and pragmatic it is). We investigate the relationship between this notion of creativity and n-gram novelty through 8,618 expert writer annotations of novelty, pragmaticality, and sensicality via close reading of human- and AI-generated text. We find that while n-gram novelty is positively associated with expert writer-judged creativity, approximately 91% of top-quartile n-gram novel expressions are not judged as creative, cautioning against relying on n-gram novelty alone. Furthermore, unlike in human-written text, higher n-gram novelty in open-source LLMs correlates with lower pragmaticality. In an exploratory study with frontier closed-source models, we additionally confirm that they are less likely to produce creative expressions than humans. Using our dataset, we test whether zero-shot, few-shot, and finetuned models are able to identify expressions perceived as novel by experts (a positive aspect of writing) or non-pragmatic (a negative aspect). Overall, frontier LLMs exhibit performance much higher than random but leave room for improvement, especially struggling to identify non-pragmatic expressions. We further find that LLM-as-a-Judge novelty ratings align with expert writer preferences in an out-of-distribution dataset, more so than an n-gram based metric.

cs.CL cs.AI cs.HC