The Model as One Rater Among Several: Measuring Political Positions in Data-Sparse Regions with a Language-Model Panel

TL;DR

提出一种利用语言模型作为评分者的面板方法,Krippendorff's α达0.86,适用于数据稀缺地区的政治定位。

cs.CY 🔴 高级 2026-06-22 38 次浏览
Tarek Gara
语言模型 政治定位 数据稀缺 专家面板 可靠性分析

核心发现

方法论

本文提出了一种将大型语言模型作为评分者的面板方法,结合专家调查的思想,通过定义明确的轴线和规则对中东和北非地区的政治行为体进行定位。方法包括适用性规则、声明与行为分离的镜头系统,以及保留评分分歧的综合策略。

关键结果

  • 结果1:在21点量表上,添加书面定义后评分平均移动1.8点,评分者间的平均绝对差距从2.81降至2.50,相关系数从0.81升至0.89。
  • 结果2:在9个模型组成的面板中,Krippendorff's α在区间和序数指标上均达到0.86,且随着评分者数量从5增至9保持稳定。
  • 结果3:最大分歧出现在对国家基础秩序的立场上,三重盲编码显示约2/3的分歧源于解释而非错误。

研究意义

该方法解决了传统政治定位工具在非西方地区失效的问题,为数据稀缺地区提供了可靠的政治定位手段。通过保留评分分歧,该方法不仅提高了可靠性,还揭示了模型间分歧的潜在信息价值。

技术贡献

技术贡献包括:1) 将语言模型作为评分者融入专家面板方法;2) 提出适用性规则以避免错误的中间值;3) 定义声明与行为分离的镜头系统;4) 通过Krippendorff's α验证评分可靠性。

新颖性

首次将语言模型作为专家面板评分者,并通过实验验证其在数据稀缺地区的可靠性。这种方法与传统文本缩放和专家调查方法有本质区别。

局限性

  • 局限1:模型间可能存在共享偏差,尤其在训练数据重叠的情况下。
  • 局限2:缺乏人类验证,当前结果仅能视为可靠性试验。
  • 局限3:部分轴线在跨文化比较中可能缺乏一致性。

未来方向

未来工作包括:1) 增加人类验证以提升有效性;2) 扩展到更多地区和语言;3) 研究如何更好地处理模型共享偏差。

AI 总览摘要

传统的政治定位工具在非西方地区表现不佳,尤其是中东和北非等数据稀缺区域。本文提出了一种新方法,将大型语言模型作为评分者,与专家面板方法相结合,通过定义明确的轴线和规则对政治行为体进行定位。

实验显示,该方法在21点量表上添加书面定义后,评分者间的相关系数从0.81提升至0.89,Krippendorff's α在区间和序数指标上均达0.86,表明评分具有高度可靠性。此外,分歧分析揭示了模型间分歧的解释性价值。

尽管方法可靠性已验证,但有效性仍需通过人类验证进一步确认。未来工作将扩展至更多地区,并研究如何更好地处理模型共享偏差。这一方法为数据稀缺地区的政治研究提供了重要工具。

深度分析

研究背景

传统政治定位工具如宣言编码、专家调查和文本缩放模型主要基于西方党派系统开发,在非西方地区效果不佳。这些地区缺乏竞争性选举和西式宣言,行为体的声明与实际行为常有矛盾,导致现有工具无法适用。

核心问题

核心问题是如何在数据稀缺地区对政治行为体进行可靠定位。现有方法依赖于大规模语料库和训练数据,而这些资源在中东和北非等地区严重不足。

核心创新

本文创新点包括:1) 将语言模型作为评分者融入专家面板方法;2) 提出适用性规则以避免错误的中间值;3) 定义声明与行为分离的镜头系统;4) 通过保留分歧揭示模型间的潜在信息价值。

方法详解

  • �� 使用9个语言模型作为评分者,结合专家面板方法。
  • �� 定义16个轴线,包括经济、社会、宗教与国家关系等。
  • �� 提出适用性规则,区分空白值与零值。
  • �� 使用Krippendorff's α评估评分可靠性。
  • �� 通过声明与行为分离的镜头系统提高评分精度。

实验设计

实验基于中东和北非地区的98个政党和274位公众人物,使用286份文件和101条引文作为数据来源。通过多轮评分和添加书面定义,验证模型间一致性和分歧信息。

结果分析

实验结果显示,添加书面定义后评分者间的相关系数从0.81提升至0.89,Krippendorff's α达到0.86。此外,分歧分析表明,约2/3的分歧源于解释而非错误。

应用场景

该方法可用于中东和北非等数据稀缺地区的政治研究,帮助学者更准确地分析党派和公众人物的政治立场。

局限与展望

局限包括:1) 模型间可能存在共享偏差;2) 缺乏人类验证;3) 部分轴线在跨文化比较中可能缺乏一致性。

通俗解读 非专业人士也能看懂

想象你在组建一个专家团队,每位专家都有自己的观点和偏见。现在,你邀请了9位专家,他们分别来自不同国家和背景,但有些专家可能读过同样的书。你让他们对某个政治问题打分,并观察他们的分歧。通过分析这些分歧,你不仅能了解他们的共识,还能发现问题的复杂性。这种方法类似于本文提出的语言模型面板方法。

简单解释 像给14岁少年讲一样

想象你和朋友们要给学校里的俱乐部打分,比如环保社团和篮球队。每个人都有自己的看法,有些人喜欢环保,有些人更喜欢运动。你们把分数平均后发现,大家对篮球队的评分差异很大。这时,你会想:为什么会有这么大的分歧?这就是本文研究的重点,用语言模型来模拟这种评分过程,并分析分歧的原因!

术语表

Krippendorff's α (克里彭多夫α)

一种用于评估评分者一致性的统计指标,适用于部分缺失数据的情况。

用于衡量语言模型面板的评分一致性。

Declared Position (声明立场)

根据政党或人物的公开声明、宣言或演讲得出的政治立场。

用于区分声明与行为的镜头系统。

Behavioral Position (行为立场)

基于政党或人物实际行为(如立法记录)的政治立场。

用于验证声明立场的准确性。

Applicability Rule (适用性规则)

决定某一轴线是否适用于特定行为体的规则。

避免错误地将空白值视为中间值。

Panel of Raters (评分者面板)

由多个评分者组成的集合,用于综合不同评分者的意见。

本文使用语言模型作为评分者面板的核心。

开放问题 这项研究留下的未解疑问

  • 1 如何更好地验证模型评分的有效性?
  • 2 如何减少模型间共享偏差对评分结果的影响?
  • 3 是否可以扩展到其他语言和地区?

应用场景

近期应用

中东政治分析

帮助学者更准确地定位中东地区政党和公众人物的政治立场。

政策制定支持

为政策分析师提供更可靠的政治定位数据,支持跨国政策研究。

远期愿景

全球化扩展

将方法扩展到其他数据稀缺地区,实现全球范围内的政治比较研究。

原文摘要

Most tools for measuring political positions, manifesto coding, expert surveys, text-scaling models, were built and validated on Western party systems, and outside that setting they work poorly, and often not at all. This paper is an attempt at a method for those settings. It treats a large language model not as a measurement device but as a single, fallible rater in a panel, roughly the way an expert survey treats one expert: the value comes from pooling many judges rather than trusting any one of them. I describe the panel, an applicability rule that keeps a score of zero distinct from a blank, and a lens system that separates what an actor says from what it does. I report three results. First, holding a definition-free round fixed, adding written axis definitions moves scores by a mean of 1.8 points on a 21-point scale and tightens agreement between raters (mean absolute gap 2.81 to 2.50; r 0.81 to 0.89); they make two independent raters agree more closely, which an arbitrary steer would not. Second, across nine models from eight laboratories in two countries, Krippendorff's alpha is 0.86 on both an interval and an ordinal metric, and it stayed put as the panel grew from five raters to nine. That is reliability, the reproducibility of a reading, and not validity, its correctness. Third, where the panel does disagree, the disagreement is informative: the sharpest split, a full-scale divergence on an actor's stance toward its state's foundational order, points to a referent problem, and a blind triple-coding puts about two-thirds of it down to interpretation rather than error. I try to be plain about what the method can't do, including the human validation it still lacks, and I release the instrument and data in full. The worked example is the Middle East and North Africa, but I'd expect the method to carry to any region these standard tools leave out.

cs.CY cs.AI cs.CL stat.AP