StoryAlign: Evaluating and Training Reward Models for Story Generation

TL;DR

StoryAlign通过StoryRMB评估故事生成奖励模型,StoryReward在StoryRMB上达到66.3%的准确率。

cs.CL 🔴 高级 2026-05-06 2 次浏览
Haotian Xia Hao Peng Yunjia Qi Xiaozhi Wang Bin Xu Lei Hou Juanzi Li
故事生成 奖励模型 人类偏好 大语言模型 自然语言处理

核心发现

方法论

本文提出StoryRMB作为评估故事偏好的基准,包含1,133个高质量实例。通过构建10万个故事偏好对,训练出StoryReward模型,显著提高了对人类偏好的捕捉能力。

关键结果

  • StoryReward在StoryRMB上取得了66.3%的准确率,超过了更大规模的模型。
  • 在下游应用中,StoryReward在BoN选择中表现优异,选择的故事更符合人类偏好。
  • 实验表明,现有奖励模型在选择人类偏好故事上表现不佳,最高仅达66.3%的准确率。

研究意义

该研究填补了故事生成中人类偏好建模的空白,通过StoryRMB和StoryReward的引入,为未来的研究提供了新的方向和工具,推动了自动化故事生成的进步。

技术贡献

提出了首个专注于故事偏好的奖励模型评估基准StoryRMB,并通过大规模数据集训练出StoryReward,显著提升了模型在故事偏好选择上的表现。

新颖性

StoryRMB是第一个专注于故事偏好的奖励模型评估基准,StoryReward在捕捉人类偏好方面表现出色,超越了现有更大规模的模型。

局限性

  • StoryReward在某些复杂的叙事结构上仍表现不足。
  • 模型在处理多维度偏好时的表现有待提高。

未来方向

未来研究可探索更复杂的偏好建模,结合多模态数据以提升故事生成的质量和多样性。

AI 总览摘要

故事生成旨在自动生成连贯、有结构且引人入胜的叙述。尽管大语言模型在文本生成方面取得了显著进展,但生成的故事在复杂叙事结构和人类偏好方面仍与人类创作存在差距。本文提出了StoryRMB,这是第一个用于评估故事偏好奖励模型的基准,包含1,133个高质量的人类验证实例。研究发现,现有奖励模型在选择人类偏好故事方面表现不佳,最佳模型的准确率仅为66.3%。为了解决这一问题,研究者构建了约10万个高质量的故事偏好对,并开发了StoryReward,一个在该数据集上训练的高级奖励模型。StoryReward在StoryRMB上达到了最先进的性能,超过了更大规模的模型。研究还在下游测试时扩展应用中采用了StoryReward进行BoN故事选择,发现其选择的故事通常更符合人类偏好。研究团队将发布数据集、模型和代码以促进未来的研究。

深度分析

研究背景

故事生成领域随着大语言模型的发展取得了显著进展,但生成的故事在复杂性和创造性上仍与人类作品存在差距。现有的奖励模型主要关注一般领域,忽视了故事偏好建模。

核心问题

当前大语言模型在训练中缺乏有效的人类故事偏好建模,导致生成的故事在叙事结构和人类偏好上与人类创作存在差距。

核心创新

本文引入了StoryRMB,这是第一个专注于故事偏好的奖励模型评估基准,结合大规模数据集训练出StoryReward,显著提升了模型在故事偏好选择上的表现。

方法详解

  • �� 构建StoryRMB基准,包含1,133个高质量实例。
  • �� 收集10万个故事偏好对,涵盖多样化领域。
  • �� 训练StoryReward模型,提升对人类偏好的捕捉能力。

实验设计

实验使用StoryRMB评估现有奖励模型,发现其在选择人类偏好故事方面表现不佳。通过BoN实验验证StoryReward在下游应用中的有效性。

结果分析

StoryReward在StoryRMB上取得了66.3%的准确率,超过了更大规模的模型,并在BoN选择中表现优异。

应用场景

StoryReward可用于自动化故事生成,提升生成故事的质量和人类偏好对齐度。

局限与展望

StoryReward在处理复杂叙事结构和多维度偏好时仍有提升空间,未来研究可探索更复杂的偏好建模。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。大语言模型就像是厨房里的厨师,它们可以根据食谱(提示)制作出美味的菜肴(故事)。然而,有时候这些菜肴并不符合你的口味(人类偏好)。StoryReward就像是一个美食评论家,它帮助厨师了解你的口味偏好,从而制作出更符合你口味的菜肴。通过不断品尝和反馈,厨师可以不断改进菜肴的味道,让你每次都能享受到美味的佳肴。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,你需要创造一个故事。大语言模型就像是游戏中的角色,它们可以根据你的指令生成故事。但是,有时候这些故事并不符合你的想法。StoryReward就像是一个游戏助手,它帮助角色了解你的想法,从而生成更符合你想法的故事。通过不断尝试和调整,角色可以不断改进故事的内容,让你每次都能享受到精彩的故事冒险!

术语表

大语言模型 (LLM)

一种能够生成自然语言文本的人工智能模型,通常基于深度学习技术。

用于生成故事文本。

奖励模型 (RM)

用于评估生成内容质量的模型,通常通过人类反馈进行训练。

用于选择符合人类偏好的故事。

StoryRMB

一个用于评估故事偏好奖励模型的基准,包含1,133个高质量实例。

用于评估现有奖励模型的表现。

StoryReward

一个高级奖励模型,通过大规模故事偏好对进行训练,提升对人类偏好的捕捉能力。

在StoryRMB上表现优异。

BoN选择

一种在多个生成结果中选择最佳结果的方法,通常用于测试时扩展应用。

用于验证StoryReward的有效性。

开放问题 这项研究留下的未解疑问

  • 1 如何在复杂叙事结构上提升StoryReward的表现仍是一个开放问题。
  • 2 现有模型在多维度偏好建模上的表现有待提高。

应用场景

近期应用

自动化故事生成

StoryReward可用于提升生成故事的质量和人类偏好对齐度,适用于内容创作平台。

远期愿景

多模态故事生成

结合多模态数据,提升故事生成的多样性和复杂性,推动创意产业的发展。

原文摘要

Story generation aims to automatically produce coherent, structured, and engaging narratives. Although large language models (LLMs) have significantly advanced text generation, stories generated by LLMs still diverge from human-authored works regarding complex narrative structure and human-aligned preferences. A key reason is the absence of effective modeling of human story preferences, which are inherently subjective and under-explored. In this work, we systematically evaluate the modeling of human story preferences and introduce StoryRMB, the first benchmark for assessing reward models on story preferences. StoryRMB contains $1,133$ high-quality, human-verified instances, each consisting of a prompt, one chosen story, and three rejected stories. We find existing reward models struggle to select human-preferred stories, with the best model achieving only $66.3\%$ accuracy. To address this limitation, we construct roughly $100,000$ high-quality story preference pairs across diverse domains and develop StoryReward, an advanced reward model for story preference trained on this dataset. StoryReward achieves state-of-the-art (SoTA) performance on StoryRMB, outperforming much larger models. We also adopt StoryReward in downstream test-time scaling applications for best-of-n (BoN) story selection and find that it generally chooses stories better aligned with human preferences. We will release our dataset, model, and code to facilitate future research. Related code and data are available at https://github.com/THU-KEG/StoryReward.

cs.CL cs.AI