Actions Speak Louder than Words: Measuring Cross-Lingual Policy Retention in Tool-Using Agents

TL;DR

本文提出跨语言策略保持率的量化方法,通过修正偏差,发现8个模型在多语言任务中保持71-73%的策略一致性。

cs.CL 🔴 高级 2026-08-12 99 次浏览
Sourabrata Mukherjee Kalika Bali Sunayana Sitaram
多语言模型 策略保持 工具使用 模型评估 跨语言迁移

核心发现

方法论

研究采用一套基于行动轨迹的评估框架,将多模型、多任务和多语言环境中的工具调用行为作为核心指标。通过在8个不同模型、6个平行基准测试和41种语言中进行2.38百万次的模型输出,提取每次任务的行动轨迹。为了避免偏差,设计了多重校正措施,包括排除空轨迹、匹配轨迹长度、采用双重随机种子重复、校正模型重现性等。最终,定义归一化的策略保持率指标˜I,将交叉语言轨迹与同语轨迹进行比值计算,确保结果不受模型自身偏差影响。此方法在每个任务单元中进行bootstrap抽样,确保统计稳健性。实验中还验证了模型在不同温度、参数规模和架构下的表现一致性,显示出跨语言策略的结构性特征,而非采样噪声或随机偏差。

关键结果

  • 在贪婪解码(greedy decoding)条件下,四个不同架构、不同训练数据的前沿模型(如Gemma-3-27B、Qwen-3-235B、Llama-4-Maverick、Sarvam-M)在跨语言任务中保持了71%到73%的策略一致性,归一化后几乎无差异。即使模型参数从4B到235B变化,策略保持率变化极小,模型身份仅解释了5.7%的方差。通过校正模型重现性,发现模型在不同语言间的行为差异主要源于其自身的采样偏差,而非结构性差异。
  • 研究还发现,模型普遍采用“将非英语任务通过英语中转”的策略,这一行为在多模型、多任务中具有因果关系,且模型在被明确指示放弃此策略时表现出极低的遵从率。此外,单一的轨迹提取正则表达式错误引发了多语言环境中的假象失败,导致某模型的测量准确率被夸大26倍,而在可读输出上的表现几乎无变化。
  • 在参数规模方面,策略保持率在8B以下模型中表现出明显的结构性边界,模型在边界以下表现出较大变异,而在边界上趋于收敛。通过校正随机采样的影响,发现模型的策略保持率并非简单的规模规律,而是受限于模型的结构性和训练策略。

研究意义

该研究突破了传统只关注最终输出结果的评估范式,将模型的中间行为作为衡量指标,揭示了多语言环境下模型行为的结构性差异。这不仅丰富了模型跨语言迁移的理解,也为多语言多任务系统的安全性、可控性提供了新的评估工具。通过校正偏差,研究展示了模型在不同语言间保持一致行为的潜在能力,为未来多语言模型的设计和优化提供了理论依据和实践指南。此外,该方法还能帮助识别模型在多语言环境中的潜在偏差和不一致性,推动多语言AI的公平性和透明度提升。

技术贡献

本文提出了一套基于行动轨迹的跨语言策略保持率测量框架,创新性地引入了多重偏差校正机制,包括轨迹长度匹配、空轨迹排除、模型重现性校正和随机采样影响控制。通过在大规模多模型、多任务、多语言数据集上应用,验证了策略保持率的结构性特征。该方法突破了传统只关注输出结果的评估限制,为模型行为的可解释性提供了新工具。技术上,结合bootstrap抽样和归一化指标,有效降低了模型偏差和采样噪声的干扰,为多语言模型的行为一致性提供了定量分析基础。

新颖性

本研究首次系统性地将行动轨迹作为跨语言策略保持的核心指标,突破了以最终答案为唯一评估对象的传统框架。通过引入多重偏差校正机制,确保了指标的可比性和稳健性。与以往只关注模型输出的研究不同,本文强调模型中间行为的结构性特征,揭示了模型在多语言环境中的潜在行为一致性。这一创新方法为多语言模型的行为分析提供了全新视角,具有重要的理论和实践价值。

局限性

  • 本研究主要集中在贪婪解码条件下的策略保持率,对于采样温度较高或采用其他解码策略的情况,模型行为的稳定性尚未充分验证,可能存在偏差。
  • 模型在多语言环境中的行为受到训练数据和策略的影响,当前方法未能完全捕捉模型内部潜在的语义迁移机制,未来需要结合模型内部表示进行深入分析。
  • 轨迹提取正则表达式的设计存在一定局限性,可能在某些模型或任务中引入偏差,影响测量的准确性,未来应探索更鲁棒的轨迹抽取方法。

未来方向

未来将扩展至多样化的解码策略和更大规模模型,验证策略保持率的普适性。计划结合模型内部表示和因果推断技术,深入分析模型行为的结构性根源。此外,将探索多语言训练策略对行为保持的影响,推动多语言模型的公平性和鲁棒性提升。还希望将该评估框架应用于实际部署场景,优化模型的行为一致性和安全性,为多语言AI的实际应用提供更科学的评估工具。

AI 总览摘要

在人工智能快速发展的今天,多语言模型已成为推动全球化应用的核心技术之一。尽管这些模型在最终输出的准确性方面取得了显著进步,但其在不同语言环境中执行策略的行为一致性仍未得到充分理解。传统评估方法主要关注模型的最终答案,忽视了中间行为的差异,这在实际应用中可能导致成本增加、失败模式变化甚至安全风险。本文提出了一套创新的行动轨迹评估框架,旨在量化模型在多语言环境中的策略保持率。

该方法通过在多模型、多任务和多语言场景中采集大量轨迹数据,结合多重偏差校正技术,确保测量的稳健性和可比性。核心指标˜I代表模型在不同语言间保持的策略比例,经过校正后显示,四个不同架构、不同训练背景的前沿模型在贪婪解码条件下,能保持其原有策略的71%到73%。这一结果表明,模型的行为具有结构性特征,而非随机或采样噪声所致。

研究还发现,模型普遍采用“通过英语中转”的策略,且在被明确指示放弃此策略时,表现出极低的遵从率。这一行为的因果关系得到验证,表明模型在多语言任务中存在潜在的偏差路径。参数规模方面,策略保持率在8B以下模型中表现出明显的边界,低于此规模的模型行为差异较大,而在边界上趋于一致。

这些发现不仅丰富了我们对多语言模型行为的理解,也为模型设计和调优提供了科学依据。未来,研究将结合模型内部表示和因果推断技术,深入探索行为结构的根源,推动多语言AI的公平性和安全性。该评估框架具有广泛的应用潜力,可以帮助开发者优化模型策略,降低多语言环境中的风险,促进多语言AI的健康发展。

深度解读

原文摘要

When a tool-using agent is given the same task in a different language, does it still take the same steps? Multilingual evaluation rarely asks: it compares final answers and discards the actions. Yet those actions are the product: they fix cost and latency, decide how the system fails, and are the only auditable part of its behaviour. We make the action policy the measured object across 8 models, 6 parallel benchmarks and 41 languages (2.38M rollouts). The naive measurement fails: five confounds sit between raw trace similarity and any defensible claim, each able to flip a conclusion. Short traces score higher, empty traces score perfectly, unrelated traces agree by chance over half the time, the gap is capped by each model's reproducibility, and a model asked the same question twice in one language answers differently, leaving no baseline. We remove all five, and every correction makes the effect larger. Divergence proves structural, not sampling noise: it survives greedy decoding in every cell and stays flat as temperature rises, even as models grow less self-consistent. Normalised by their own reproducibility, four very different frontier models converge under greedy decoding, each keeping 71-73% of its action policy across languages, with model identity explaining only 5.7% of the variance. Below roughly 10B parameters it breaks down, and the ordering among smaller models is largely an artifact of a chance floor we measure by permutation rather than assume. Agents route non-English tasks through English; this pivot is causally load-bearing, confirmed by a pre-registered prediction across four models, and models will not abandon it when told to. Finally, a single trace-extraction regex, not the model, manufactured a multilingual failure: two worked examples raise one model's measured accuracy twenty-sixfold while its accuracy on readable outputs barely moves.

cs.CL

参考文献 (20)

Efficient Memory Management for Large Language Model Serving with PagedAttention

Woosuk Kwon, Zhuohan Li, Siyuan Zhuang 等

2023 7619 引用 ⭐ 高影响力 查看解读 →

Aya Expanse: Combining Research Breakthroughs for a New Multilingual Frontier

John Dang, Shivalika Singh, Daniel D'souza 等

2024 132 引用 ⭐ 高影响力 查看解读 →

Gemma 3 Technical Report

Gemma Team Aishwarya Kamath, Johan Ferret, Shreya Pathak 等

2025 1693 引用 ⭐ 高影响力 查看解读 →

gpt-oss-120b&gpt-oss-20b Model Card

OpenAI Sandhini Agarwal, L. Ahmad, Jason Ai 等

2025 1149 引用 ⭐ 高影响力 查看解读 →

Markov Decision Processes: Discrete Stochastic Dynamic Programming

M. Puterman

1994 14331 引用

Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting

Melanie Sclar, Yejin Choi, Yulia Tsvetkov 等

2023 889 引用 查看解读 →

The Belebele Benchmark: a Parallel Reading Comprehension Dataset in 122 Language Variants

Lucas Bandarkar, Davis Liang, Benjamin Muller 等

2023 347 引用 查看解读 →

On the Cross-lingual Transferability of Monolingual Representations

Mikel Artetxe, Sebastian Ruder, Dani Yogatama

2019 978 引用 查看解读 →

MLQA: Evaluating Cross-lingual Extractive Question Answering

Patrick Lewis, Barlas Oğuz, Ruty Rinott 等

2019 617 引用 查看解读 →

XL-Sum: Large-Scale Multilingual Abstractive Summarization for 44 Languages

Tahmid Hasan, Abhik Bhattacharjee, Md Saiful Islam 等

2021 539 引用 查看解读 →

Do Llamas Work in English? On the Latent Language of Multilingual Transformers

Chris Wendler, Veniamin Veselovsky, Giovanni Monea 等

2024 320 引用 查看解读 →

No Language Left Behind: Scaling Human-Centered Machine Translation

Nllb team, M. Costa-jussà, James Cross 等

2022 1923 引用 查看解读 →

How do Large Language Models Handle Multilingualism?

Yiran Zhao, Wenxuan Zhang, Guizhen Chen 等

2024 181 引用 查看解读 →

XCOPA: A Multilingual Dataset for Causal Commonsense Reasoning

E. Ponti, Goran Glavavs, Olga Majewska 等

2020 464 引用 查看解读 →

Qwen3 Technical Report

An Yang, Anfeng Li, Baosong Yang 等

2025 7175 引用 查看解读 →

Holistic Evaluation of Language Models

Percy Liang, Rishi Bommasani, Tony Lee 等

2023 1932 引用

XTREME: A Massively Multilingual Multi-task Benchmark for Evaluating Cross-lingual Generalization

Junjie Hu, Sebastian Ruder, Aditya Siddhant 等

2020 1179 引用 查看解读 →

Chain of Thought Prompting Elicits Reasoning in Large Language Models

Jason Wei, Xuezhi Wang, Dale Schuurmans 等

2022 20943 引用 查看解读 →

GAIA: a benchmark for General AI Assistants

G. Mialon, Clémentine Fourrier, Craig Swift 等

2023 1088 引用 查看解读 →

XNLI: Evaluating Cross-lingual Sentence Representations

Alexis Conneau, Guillaume Lample, Ruty Rinott 等

2018 1652 引用 查看解读 →