CAPITU: A Benchmark for Evaluating Instruction-Following in Brazilian Portuguese with Literary Context

TL;DR

CAPITU利用巴西文学经典文本,设计59个可自动验证的指令类型,评估大模型在葡萄牙语中的指令遵循能力。

cs.CL 🔴 高级 2026-03-24 44 次浏览
Giovana Kerche Bonás Roseval Malaquias Junior Marcos Piau Thiago Laitz Thales Sales Almeida Hugo Abonizio Celio Larcher Ramon Pires Rodrigo Nogueira
自然语言处理 指令遵循 文化语境 多轮对话 文学背景

核心发现

方法论

CAPITU采用基于文学文本的指令设计,结合正则表达式和字符串匹配实现自动验证。指令类型涵盖葡萄牙语特有的形态学特征(如-ando/-endo/-indo后缀、-inho/-inha等 diminutives)和结构要求(如首字母成词的藏头诗)。通过模板化生成任务,确保多样性与难度递增。多轮对话测试模型在连续约束下的保持能力。评估18个先进模型,采用严格和宽松准确率指标,验证模型在单轮和多轮场景中的表现。

关键结果

  • 最先进模型GPT-5.2在单轮严格准确率达98.5%,显示出极强的推理和指令遵循能力。
  • 专为葡萄牙语优化的模型(如Sabiazinho-4)表现优异,达87.0%的准确率,成本仅为0.13美元/次,而多功能模型(如Claude-Haiku-4.5)成本较高但表现略逊(73.5%,1.12美元/次)。
  • 多轮对话中,模型在保持约束一致性方面差异显著,准确率从60%到96%不等,揭示约束持续性和记忆能力的挑战。

研究意义

该研究填补了葡萄牙语指令遵循评估的空白,结合文化语境与形态学特性,推动多语言模型的公平性与鲁棒性。通过自动验证机制,确保评估的客观性和可复现性,为未来多语言、多轮交互场景中的模型调控提供技术基础。文学背景的引入增强了评估的文化相关性,有助于理解模型在实际应用中的表现差异。

技术贡献

提出专为葡萄牙语设计的指令分类体系,涵盖59个类型,结合正则表达式和词典匹配实现自动验证。设计多轮对话机制,模拟真实交互场景,测试模型在连续约束下的稳定性。构建文学语料库,丰富指令场景,提升评估的文化语境相关性。提供开源工具和基线模型,为后续研究提供标准化平台。

新颖性

首次在葡萄牙语环境中系统引入基于文学文本的指令遵循评估框架,结合自动验证与文化背景,超越以英语为主的多语言评估体系。创新性在于针对葡语特有的形态学和结构性约束设计专属指令集,解决翻译适配带来的局限,彰显文化嵌入与自动验证的结合优势。

局限性

  • 当前模型在复杂形态学约束(如多重后缀叠加)和长文本中保持约束一致性方面仍存在不足,反映出模型对细粒度结构控制的挑战。
  • 多轮对话中,模型在约束持续性和记忆保持方面表现差异较大,提示模型在连续交互中的鲁棒性有待提升。
  • 评估主要依赖于字符串匹配和正则表达式,可能无法覆盖所有语义或语用层面的复杂约束,未来需结合语义理解增强验证机制。

未来方向

未来将扩展指令类型,涵盖更多文学体裁和语用场景,提升模型在多样化任务中的泛化能力。探索深度学习驱动的语义验证方法,结合知识图谱和语义理解技术,增强验证的鲁棒性。推动多轮对话中的记忆与约束保持机制研究,改善模型的连续交互表现。

AI 总览摘要

CAPITU作为首个专为巴西葡萄牙语设计的指令遵循评估基准,融合文学语境与形态学约束,突破了现有英语为主的评估体系限制。通过59个可自动验证的指令类型,涵盖葡语特有的词尾变化和结构要求,确保模型在多样化任务中的指令遵循能力。基于经典文学作品的语料库,为模型提供丰富的文化背景,提升评估的现实意义。多轮对话机制模拟实际交互场景,检验模型在连续约束下的稳定性。实验结果显示,最先进模型(如GPT-5.2)在单轮任务中达98.5%的严格准确率,而专为葡语优化的模型(如Sabiazinho-4)在成本与性能间表现优异。多轮评估揭示模型在保持指令一致性方面的差异,指出模型在复杂约束和长文本中的挑战。该工作不仅丰富了多语言指令遵循评估的内容体系,也为未来多轮交互和文化语境的模型调控提供了重要工具。CAPITU的开源资源将推动学界和产业界在葡萄牙语环境下的模型研究与应用,促进多语言、多文化的AI发展。

深度分析

研究背景

近年来,随着大规模语言模型(LLMs)在自然语言处理中的广泛应用,指令遵循能力成为衡量模型控制性和鲁棒性的关键指标。早期工作如IFEval引入可自动验证的指令类型,主要集中在英语环境,涵盖格式、关键词等基础约束。随后,跨语言评估体系如Multi-IF扩展到多语种,但仍以英语为主,缺乏对特定语言文化特征的关注。葡萄牙语作为重要的世界语言,具有丰富的形态学和语用特性,现有评估工具未能充分反映其复杂性。国内外研究逐步意识到本土化、文化化的重要性,出现如PoETa v2和OAB等本土任务,但缺乏系统的、可自动验证的指令框架。CAPITU应运而生,旨在填补这一空白,结合文学语料和语言特性,推动葡语环境下的指令遵循研究。

核心问题

现有指令遵循评估多依赖翻译或通用模板,难以捕捉葡萄牙语的形态学细节和文化语境,导致模型在实际应用中表现不佳。特别是在多轮对话场景中,模型难以持续保持指令一致性,影响交互质量。此外,缺乏专门针对葡语特有语法结构(如 diminutives、gerunds)和结构性约束的评估工具,限制了模型调优和性能提升的空间。如何设计具有文化嵌入、自动验证且能反映真实应用需求的指令体系,成为亟待解决的核心问题。

核心创新

CAPITU的创新点在于:1)基于文学经典文本,设计了涵盖多样文化和语体的指令集,增强模型的文化理解能力;2)引入葡萄牙语特有的形态学约束(如-inho/-inha、-mente等),确保模型在细粒度结构控制方面的能力;3)采用自动化验证机制,利用正则表达式和词典匹配,避免主观评判,提高评估的客观性和可复现性;4)构建多轮对话场景,模拟实际交互,测试模型在连续约束中的表现,推动模型在复杂任务中的适应性。

方法详解

  • �� 设计指令类型:定义59个指令,涵盖字数、词尾、结构、语气等方面,结合正则表达式和词典实现自动验证。• 任务模板:基于8部巴西文学经典,生成多样化任务(如评论、分析、比较),确保文化语境丰富。• 参数生成:随机采样词数、句数、特定词汇,确保任务多样性。• 难度递增:通过组合不同数量的约束(单一、双重、多重)设计易中难任务。• 多轮对话:设计三轮交互,逐步增加约束,测试模型持续遵循能力。• 评估指标:采用严格和宽松准确率,确保评估客观全面。

实验设计

在18个前沿模型(如GPT-5.2、Sabiazinho-4、Claude-Haiku-4.5)上进行评估,设置单轮和多轮场景。采用公开的文学语料库,设计多样化任务,确保覆盖不同难度和约束类型。指标包括严格准确率、宽松准确率和多轮保持率。对比分析模型在不同约束组合和多轮场景中的表现差异,识别模型在形态学控制和连续性方面的不足。通过消融实验验证指令设计和验证机制的有效性。

结果分析

最先进模型在单轮任务中达98.5%的严格准确率,显示出极强的指令遵循能力。专为葡语优化的模型表现优异,成本低廉(如Sabiazinho-4仅0.13美元/次),但在多轮对话中保持一致性方面存在差异,准确率从60%到96%不等。多轮场景揭示模型在约束持续性和记忆保持方面的挑战,提示未来需加强模型的连续学习和记忆能力。

应用场景

该基准可广泛应用于提升葡萄牙语模型的控制性,适用于智能写作、对话系统、文化内容生成等场景。企业可以利用CAPITU优化模型在本土化内容中的表现,确保输出符合文化和结构要求。学术界则可借助此工具研究多语言、多轮交互中的模型鲁棒性,为未来多语种AI系统设计提供理论基础。

局限与展望

目前验证机制主要依赖字符串匹配,难以覆盖语义层面的复杂约束,模型在处理多重嵌套和长文本时表现不稳定。多轮对话中,模型的记忆和约束保持能力仍需提升,尤其在应对更复杂的语境和多样化任务时。此外,评估成本虽低,但在极端复杂场景下可能仍需人工辅助验证,未来需结合深度语义理解技术。

通俗解读 非专业人士也能看懂

想象你在一个工厂里,工人们需要按照一套严格的规则生产产品。每个工人都必须遵守特定的流程,比如用特定的工具、按照顺序操作,还要确保每个步骤都符合标准。这就像让AI模型写作文一样,要遵守很多规则,比如使用特定的词尾、结构或内容。CAPITU就像是一个检测工厂是否按规操作的机器人,它会自动检查每个工人(模型)是否遵守所有规则,没有人需要人工检查。它还用工厂里经典的文学作品作为背景,让工人们在熟悉的故事中练习,确保他们不仅懂规则,还能理解文化。这样一来,模型就能更好地在真实生活中,像人一样遵守规则,写出符合文化的内容。

简单解释 像给14岁少年讲一样

想象你在学校里,有一位老师给你很多任务,比如写一篇关于一本书的评论,或者用特定的词语开始每句话。这些任务都要遵守一些特别的规则,比如不能用某些词,或者每句话都要符合一定的格式。现在,假设你有一个超级聪明的机器人朋友,它可以帮你完成这些任务,但它必须严格遵守老师的规则。CAPITU就像是给这个机器人设计的考试,它会检查机器人是否按照规则写东西。这个考试用巴西的经典文学作品作为背景,让机器人在熟悉的故事里练习,不仅要写得好,还要符合所有的规则。通过这个考试,我们可以知道这个机器人在理解和遵守规则方面有多厉害,也能帮我们让机器人变得更聪明、更懂文化。

术语表

指令遵循 (Instruction Following)

指模型按照给定任务和规则生成内容的能力,确保输出符合预设的结构和内容要求。

本文评估模型在葡萄牙语环境下的指令遵循表现。

自动验证 (Automated Verification)

利用正则表达式和字符串匹配等程序化方法,自动判断模型输出是否满足特定规则,无需人工干预。

确保评估过程的客观性和可复现性。

多轮对话 (Multi-turn Dialogue)

在连续交互中,模型需要保持对前文指令的遵守,逐步累积约束。

测试模型在复杂交互场景中的稳定性。

文学语料库 (Literary Corpus)

由巴西经典文学作品组成的文本集合,用于提供丰富的文化和语言背景。

作为任务背景,提升模型的文化理解能力。

形态学约束 (Morphological Constraints)

对词尾变化、词形结构的限制,反映语言的语法特性。

设计专门针对葡萄牙语的指令类型。

开放问题 这项研究留下的未解疑问

  • 1 如何将深度语义理解结合到自动验证机制中,以更好捕捉复杂语用和语义约束。
  • 2 多轮对话中模型在长时间保持指令遵循的机制和优化策略仍需深入研究。
  • 3 跨文化、跨语境的指令设计如何兼顾多样性与普适性,未来需探索更智能的生成与验证方法。

原文摘要

We introduce CAPITU, a benchmark for evaluating instruction-following capabilities of Large Language Models (LLMs) in Brazilian Portuguese. Unlike existing benchmarks that focus on English or use generic prompts, CAPITU contextualizes all tasks within eight canonical works of Brazilian literature, combining verifiable instruction constraints with culturally-grounded content. The benchmark comprises 59 instruction types organized into seven categories, all designed to be automatically verifiable without requiring LLM judges or human evaluation. Instruction types include Portuguese-specific linguistic constraints (word termination patterns like -ando/-endo/-indo, -inho/-inha, -mente) and structural requirements. We evaluate 18 state-of-the-art models across single-turn and multi-turn settings. Our results show that frontier reasoning models achieve strong performance (GPT-5.2 with reasoning: 98.5% strict accuracy), while Portuguese-specialized models offer competitive cost-efficiency (Sabiazinho-4: 87.0% at \$0.13 vs Claude-Haiku-4.5: 73.5% at \$1.12). Multi-turn evaluation reveals significant variation in constraint persistence, with conversation-level accuracy ranging from 60% to 96% across models. We identify specific challenges in morphological constraints, exact counting, and constraint persistence degradation across turns. We release the complete benchmark, evaluation code, and baseline results to facilitate research on instruction-following in Portuguese.

cs.CL