Detecting and Guiding LLM-Generated Korean Poetry with Interpretable Form-level Features

TL;DR

通过解释性形式特征检测和指导LLM生成韩诗,检测AUC-ROC达83.60。

cs.CL 🔴 高级 2026-08-29 4 次浏览
Keunhyeung Park Seunguk Yu YoungBin Kim
LLM 韩诗 检测 生成 解释性特征

核心发现

方法论

研究提出了四个语言维度:输出长度、结构变化、节奏不规则性和规范遵循性,并将其转化为五个可解释特征,用于检测和指导生成韩诗。通过逻辑回归分类器实现检测,使用特征指导生成。

关键结果

  • 检测结果:在七个未见LLM上,平均AUC-ROC为83.60,较基线KatFishNet提高7.76点。
  • 生成结果:专家评估中,特征指导的诗比无约束基线更接近人类诗歌。
  • 特征有效性:移除任何维度都会降低AUC-ROC,尤其是结构变化。

研究意义

该研究通过解释性特征填补了人类与LLM生成诗歌之间的差距,提供了一种新的检测和生成指导方法,具有重要的学术和工业意义,尤其是在语言特定的诗歌生成领域。

技术贡献

技术上,该研究提供了一种新的检测框架,超越了现有的基线方法,并通过特征指导生成,使LLM生成的诗歌更接近人类诗歌的形式。

新颖性

这是首次将语言特定的解释性特征应用于韩诗的检测和生成指导,区别于以往的硬约束方法。

局限性

  • 检测方法在某些生成器特定的标点模式上表现不佳。
  • 生成指导在规范遵循性上仍有局限。

未来方向

未来研究可探索如何进一步优化特征指导生成,使其在规范遵循性上更接近人类诗歌。

AI 总览摘要

大型语言模型(LLM)在生成现代韩诗时常常表现出局限性,生成的诗歌更像是“断行散文”。现有解决方案未能有效解决这一问题。本研究提出了一种新的方法,通过解释性形式特征来检测和指导LLM生成韩诗。该方法量化了人类与LLM生成诗歌之间的差距,提出了四个语言维度:输出长度、结构变化、节奏不规则性和规范遵循性,并将其转化为五个可解释特征。实验结果表明,使用这些特征的逻辑回归分类器在检测任务中表现优异,平均AUC-ROC达83.60,较基线方法有显著提升。在生成任务中,特征指导使得生成的诗歌更接近人类诗歌的形式,专家评估结果支持这一结论。尽管如此,该方法在某些生成器特定的标点模式上仍有局限,未来研究可进一步优化特征指导生成。

深度分析

研究背景

随着大型语言模型的发展,它们在生成诗歌方面的表现受到关注。以往研究主要依赖于硬约束,如韵律和押韵,但这些方法与现代韩诗的自由形式不符。

核心问题

LLM生成的韩诗常常缺乏诗意,表现为“断行散文”,缺乏节奏和诗意张力。如何让LLM生成的诗歌更接近人类诗歌是一个重要且具有挑战性的问题。

核心创新

本研究提出了一种新的检测和生成指导方法,通过解释性形式特征量化人类与LLM生成诗歌之间的差距。这些特征包括输出长度、结构变化、节奏不规则性和规范遵循性。

方法详解

  • �� 提出四个语言维度并转化为五个可解释特征
  • �� 使用逻辑回归分类器进行检测
  • �� 通过特征指导生成,使诗歌更接近人类形式

实验设计

实验使用了KatFishNet数据集和新收集的诗歌样本,评估了七个未见LLM的检测性能,并进行了生成指导的专家评估。

结果分析

检测任务中,使用五个特征的分类器在七个未见LLM上平均AUC-ROC达83.60。生成任务中,特征指导的诗歌在专家评估中更接近人类诗歌。

应用场景

该方法可用于提高LLM生成诗歌的质量,使其更接近人类诗歌的形式,适用于诗歌创作和文学分析。

局限与展望

尽管检测性能优异,但在某些生成器特定的标点模式上表现不佳。生成指导在规范遵循性上仍有局限。

通俗解读 非专业人士也能看懂

想象你在厨房里烹饪。LLM就像一个新手厨师,它知道如何做基本的菜,但缺乏创造力和变化。本研究就像给这个厨师提供了一些新的调料和技巧,让它能做出更接近专业厨师的菜肴。通过分析菜肴的长度、结构、节奏和规范,我们帮助厨师改进它的烹饪技巧,使得最终的菜肴更符合人类的口味。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,游戏里的角色需要写诗。LLM就像一个新手玩家,它写的诗总是很平淡,没有什么特别的。本研究就像给这个玩家提供了一些秘籍,让它能写出更有诗意的作品。通过分析诗的长度、结构、节奏和规范,我们帮助玩家提升它的诗歌创作能力,让它的作品更像人类写的诗。

术语表

LLM (大型语言模型)

一种能够生成文本的人工智能模型,通常通过大量数据训练。

用于生成韩诗的模型。

AUC-ROC (曲线下面积-接收者操作特征)

一种评估分类器性能的指标,数值越高表示性能越好。

用于评估检测任务的效果。

KatFishNet

一种用于检测韩文LLM文本的基线方法,利用标点和间距线索。

与本研究方法进行比较。

解释性特征

用于量化和分析文本特征的指标,帮助理解模型输出。

用于检测和生成指导。

节奏不规则性

诗歌中行长度的变化,影响诗歌的节奏感。

作为检测和生成指导的特征之一。

开放问题 这项研究留下的未解疑问

  • 1 如何在生成指导中进一步优化规范遵循性仍需探索。
  • 2 生成器特定的标点模式对检测性能的影响仍需研究。

应用场景

近期应用

诗歌创作

帮助诗人和作家利用LLM生成更接近人类诗歌的作品。

远期愿景

文学分析

通过LLM生成的诗歌分析语言特定的诗歌特征,推动文学研究。

原文摘要

LLMs often struggle with modern Korean poetry, producing outputs that resemble "line-broken prose." We address two coupled tasks: detecting whether a Korean poem is human- or LLM-authored, and guiding LLMs to generate poetry closer in form to human writing. We quantify the human-LLM gap along four form-level linguistic dimensions: output length (Volume), the diversity and connective use of line-final forms (Structure Variation), the irregularity of line lengths (Rhythmic Irregularity), and adherence to standard orthography (Normative Adherence). We operationalize these dimensions as five interpretable features. For detection, a logistic regression classifier over these five features attains an average AUC-ROC of 83.60 in zero-shot out-of-distribution detection across seven unseen LLMs, versus 75.84 for the strongest baseline in our comparison, KatFishNet, an absolute gain of 7.76 AUC points and a 10.23% relative improvement; one generator-specific punctuation pattern outside our taxonomy remains a boundary case. For generation, expert evaluation on GPT-5.2 prefers feature-guided poems over the unconstrained baseline, and analyses across GPT-5.2 and Gemini-3 show that targeted length, rhythm, and ending statistics move toward the human distribution. These results suggest that interpretable, language-specific features can bridge the diagnosis and guidance of LLM-generated poetry.

cs.CL