核心发现
方法论
研究采用一套基于行动轨迹的评估框架,将多模型、多任务和多语言环境中的工具调用行为作为核心指标。通过在8个不同模型、6个平行基准测试和41种语言中进行2.38百万次的模型输出,提取每次任务的行动轨迹。为了避免偏差,设计了多重校正措施,包括排除空轨迹、匹配轨迹长度、采用双重随机种子重复、校正模型重现性等。最终,定义归一化的策略保持率指标˜I,将交叉语言轨迹与同语轨迹进行比值计算,确保结果不受模型自身偏差影响。此方法在每个任务单元中进行bootstrap抽样,确保统计稳健性。实验中还验证了模型在不同温度、参数规模和架构下的表现一致性,显示出跨语言策略的结构性特征,而非采样噪声或随机偏差。
关键结果
- 在贪婪解码(greedy decoding)条件下,四个不同架构、不同训练数据的前沿模型(如Gemma-3-27B、Qwen-3-235B、Llama-4-Maverick、Sarvam-M)在跨语言任务中保持了71%到73%的策略一致性,归一化后几乎无差异。即使模型参数从4B到235B变化,策略保持率变化极小,模型身份仅解释了5.7%的方差。通过校正模型重现性,发现模型在不同语言间的行为差异主要源于其自身的采样偏差,而非结构性差异。
- 研究还发现,模型普遍采用“将非英语任务通过英语中转”的策略,这一行为在多模型、多任务中具有因果关系,且模型在被明确指示放弃此策略时表现出极低的遵从率。此外,单一的轨迹提取正则表达式错误引发了多语言环境中的假象失败,导致某模型的测量准确率被夸大26倍,而在可读输出上的表现几乎无变化。
- 在参数规模方面,策略保持率在8B以下模型中表现出明显的结构性边界,模型在边界以下表现出较大变异,而在边界上趋于收敛。通过校正随机采样的影响,发现模型的策略保持率并非简单的规模规律,而是受限于模型的结构性和训练策略。
研究意义
该研究突破了传统只关注最终输出结果的评估范式,将模型的中间行为作为衡量指标,揭示了多语言环境下模型行为的结构性差异。这不仅丰富了模型跨语言迁移的理解,也为多语言多任务系统的安全性、可控性提供了新的评估工具。通过校正偏差,研究展示了模型在不同语言间保持一致行为的潜在能力,为未来多语言模型的设计和优化提供了理论依据和实践指南。此外,该方法还能帮助识别模型在多语言环境中的潜在偏差和不一致性,推动多语言AI的公平性和透明度提升。
技术贡献
本文提出了一套基于行动轨迹的跨语言策略保持率测量框架,创新性地引入了多重偏差校正机制,包括轨迹长度匹配、空轨迹排除、模型重现性校正和随机采样影响控制。通过在大规模多模型、多任务、多语言数据集上应用,验证了策略保持率的结构性特征。该方法突破了传统只关注输出结果的评估限制,为模型行为的可解释性提供了新工具。技术上,结合bootstrap抽样和归一化指标,有效降低了模型偏差和采样噪声的干扰,为多语言模型的行为一致性提供了定量分析基础。
新颖性
本研究首次系统性地将行动轨迹作为跨语言策略保持的核心指标,突破了以最终答案为唯一评估对象的传统框架。通过引入多重偏差校正机制,确保了指标的可比性和稳健性。与以往只关注模型输出的研究不同,本文强调模型中间行为的结构性特征,揭示了模型在多语言环境中的潜在行为一致性。这一创新方法为多语言模型的行为分析提供了全新视角,具有重要的理论和实践价值。
局限性
- 本研究主要集中在贪婪解码条件下的策略保持率,对于采样温度较高或采用其他解码策略的情况,模型行为的稳定性尚未充分验证,可能存在偏差。
- 模型在多语言环境中的行为受到训练数据和策略的影响,当前方法未能完全捕捉模型内部潜在的语义迁移机制,未来需要结合模型内部表示进行深入分析。
- 轨迹提取正则表达式的设计存在一定局限性,可能在某些模型或任务中引入偏差,影响测量的准确性,未来应探索更鲁棒的轨迹抽取方法。
未来方向
未来将扩展至多样化的解码策略和更大规模模型,验证策略保持率的普适性。计划结合模型内部表示和因果推断技术,深入分析模型行为的结构性根源。此外,将探索多语言训练策略对行为保持的影响,推动多语言模型的公平性和鲁棒性提升。还希望将该评估框架应用于实际部署场景,优化模型的行为一致性和安全性,为多语言AI的实际应用提供更科学的评估工具。
AI 总览摘要
在人工智能快速发展的今天,多语言模型已成为推动全球化应用的核心技术之一。尽管这些模型在最终输出的准确性方面取得了显著进步,但其在不同语言环境中执行策略的行为一致性仍未得到充分理解。传统评估方法主要关注模型的最终答案,忽视了中间行为的差异,这在实际应用中可能导致成本增加、失败模式变化甚至安全风险。本文提出了一套创新的行动轨迹评估框架,旨在量化模型在多语言环境中的策略保持率。
该方法通过在多模型、多任务和多语言场景中采集大量轨迹数据,结合多重偏差校正技术,确保测量的稳健性和可比性。核心指标˜I代表模型在不同语言间保持的策略比例,经过校正后显示,四个不同架构、不同训练背景的前沿模型在贪婪解码条件下,能保持其原有策略的71%到73%。这一结果表明,模型的行为具有结构性特征,而非随机或采样噪声所致。
研究还发现,模型普遍采用“通过英语中转”的策略,且在被明确指示放弃此策略时,表现出极低的遵从率。这一行为的因果关系得到验证,表明模型在多语言任务中存在潜在的偏差路径。参数规模方面,策略保持率在8B以下模型中表现出明显的边界,低于此规模的模型行为差异较大,而在边界上趋于一致。
这些发现不仅丰富了我们对多语言模型行为的理解,也为模型设计和调优提供了科学依据。未来,研究将结合模型内部表示和因果推断技术,深入探索行为结构的根源,推动多语言AI的公平性和安全性。该评估框架具有广泛的应用潜力,可以帮助开发者优化模型策略,降低多语言环境中的风险,促进多语言AI的健康发展。
深度解读
原文摘要
When a tool-using agent is given the same task in a different language, does it still take the same steps? Multilingual evaluation rarely asks: it compares final answers and discards the actions. Yet those actions are the product: they fix cost and latency, decide how the system fails, and are the only auditable part of its behaviour. We make the action policy the measured object across 8 models, 6 parallel benchmarks and 41 languages (2.38M rollouts). The naive measurement fails: five confounds sit between raw trace similarity and any defensible claim, each able to flip a conclusion. Short traces score higher, empty traces score perfectly, unrelated traces agree by chance over half the time, the gap is capped by each model's reproducibility, and a model asked the same question twice in one language answers differently, leaving no baseline. We remove all five, and every correction makes the effect larger. Divergence proves structural, not sampling noise: it survives greedy decoding in every cell and stays flat as temperature rises, even as models grow less self-consistent. Normalised by their own reproducibility, four very different frontier models converge under greedy decoding, each keeping 71-73% of its action policy across languages, with model identity explaining only 5.7% of the variance. Below roughly 10B parameters it breaks down, and the ordering among smaller models is largely an artifact of a chance floor we measure by permutation rather than assume. Agents route non-English tasks through English; this pivot is causally load-bearing, confirmed by a pre-registered prediction across four models, and models will not abandon it when told to. Finally, a single trace-extraction regex, not the model, manufactured a multilingual failure: two worked examples raise one model's measured accuracy twenty-sixfold while its accuracy on readable outputs barely moves.
参考文献 (20)
Efficient Memory Management for Large Language Model Serving with PagedAttention
Woosuk Kwon, Zhuohan Li, Siyuan Zhuang 等
Aya Expanse: Combining Research Breakthroughs for a New Multilingual Frontier
John Dang, Shivalika Singh, Daniel D'souza 等
Gemma 3 Technical Report
Gemma Team Aishwarya Kamath, Johan Ferret, Shreya Pathak 等
gpt-oss-120b&gpt-oss-20b Model Card
OpenAI Sandhini Agarwal, L. Ahmad, Jason Ai 等
Markov Decision Processes: Discrete Stochastic Dynamic Programming
M. Puterman
Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting
Melanie Sclar, Yejin Choi, Yulia Tsvetkov 等
The Belebele Benchmark: a Parallel Reading Comprehension Dataset in 122 Language Variants
Lucas Bandarkar, Davis Liang, Benjamin Muller 等
On the Cross-lingual Transferability of Monolingual Representations
Mikel Artetxe, Sebastian Ruder, Dani Yogatama
MLQA: Evaluating Cross-lingual Extractive Question Answering
Patrick Lewis, Barlas Oğuz, Ruty Rinott 等
XL-Sum: Large-Scale Multilingual Abstractive Summarization for 44 Languages
Tahmid Hasan, Abhik Bhattacharjee, Md Saiful Islam 等
Do Llamas Work in English? On the Latent Language of Multilingual Transformers
Chris Wendler, Veniamin Veselovsky, Giovanni Monea 等
No Language Left Behind: Scaling Human-Centered Machine Translation
Nllb team, M. Costa-jussà, James Cross 等
How do Large Language Models Handle Multilingualism?
Yiran Zhao, Wenxuan Zhang, Guizhen Chen 等
XCOPA: A Multilingual Dataset for Causal Commonsense Reasoning
E. Ponti, Goran Glavavs, Olga Majewska 等
Holistic Evaluation of Language Models
Percy Liang, Rishi Bommasani, Tony Lee 等
XTREME: A Massively Multilingual Multi-task Benchmark for Evaluating Cross-lingual Generalization
Junjie Hu, Sebastian Ruder, Aditya Siddhant 等
Chain of Thought Prompting Elicits Reasoning in Large Language Models
Jason Wei, Xuezhi Wang, Dale Schuurmans 等
GAIA: a benchmark for General AI Assistants
G. Mialon, Clémentine Fourrier, Craig Swift 等
XNLI: Evaluating Cross-lingual Sentence Representations
Alexis Conneau, Guillaume Lample, Ruty Rinott 等