Towards Scalable Measurement of Durable Skills

TL;DR

使用Executive LLM框架提升耐久技能测量的可扩展性,显著提高证据密度。

cs.HC 🔴 高级 2026-09-15 4 次浏览
Amir Globerson Amy Keeling Anisha Choudhury Anna Iurchenko Aviad Segal Avinatan Hassidim Ayça Çakmakli Ben Gomes Benn Witt Cathy Cheunga Cristine Legare Diana Akrong Eliad Carmi Elisabeth Bauer Gal Elidan Hadas Gelbart Hairong Mu Katherine Chou Lev Borovoi Nir Kerem Niv Efron Noa Kerrem Gilo Preeti Singh Rajvi Kapadia Rena Levitt Roni Rabin Ronit Levavi Morad Rotem Yulzary Shashank Agarwal Sophie Allweis Tracey Lee-Joe Tzvika Stein Yael Bar Moshe Yael Haramaty Yaniv Carmel Yishay Mor Yoav Bar Sinai Yoav Bergner Yossi Matias Yuri Lev
大语言模型 耐久技能 可扩展性 心理测量 教育技术

核心发现

方法论

该研究提出了一种基于大语言模型(LLM)的框架,用于测量耐久技能如协作、创造力和批判性思维。框架通过让被试与AI队友进行类人对话,保持生态效度,同时使用Executive LLM引导对话以获取高密度的技能证据。AI评估器用于分析对话记录并评估技能水平。

关键结果

  • 使用Executive LLM的对话中,技能证据的密度显著增加,冲突解决技能的对话中,证据率达到85%。
  • AI自动评分与专家评分高度一致,Cohen's Kappa值在0.45-0.64之间。
  • 在创造力任务中,AI评估器与人类专家评分一致,表明其在复杂任务中的有效性。

研究意义

该研究展示了使用LLM进行复杂社会和认知构建测量的潜力,解决了传统方法中生态效度与心理测量严谨性之间的矛盾。通过引入Executive LLM,研究在教育评估领域提供了一种新的技术路径,可能影响未来教育评估的标准。

技术贡献

技术贡献包括开发了Executive LLM框架,能够在保持自然对话的同时引导对话以获取更多技能证据。此外,AI评估器的自动评分与人类专家评分一致,证明了其在大规模评估中的可行性。

新颖性

首次将Executive LLM用于引导对话以获取技能证据,与现有的硬编码规则模拟相比,提供了更自然和高效的评估方式。

局限性

  • 在某些复杂对话中,AI可能无法完全捕捉人类微妙的社交信号。
  • 需要进一步验证在不同文化背景下的适用性。

未来方向

未来研究可以探索不同文化背景下的适用性,并扩展到更多的耐久技能评估领域,如情绪智能和领导力。

AI 总览摘要

在现代职场中,耐久技能如协作、创造力和批判性思维至关重要,但其测量一直是个挑战。传统评估方法难以兼顾生态效度和心理测量的严谨性。本研究提出了一种基于大语言模型(LLM)的新框架,通过模拟人类对话的方式,既保留了自然互动的真实性,又提供了可控性和可重复性。

该框架的核心是Executive LLM,它不仅作为AI队友参与对话,还引导对话以获取高密度的技能证据。通过与AI评估器结合,框架能够自动分析对话记录并评估技能水平。实验结果表明,使用Executive LLM的对话中,技能证据的密度显著增加,AI自动评分与专家评分高度一致。

这项研究为教育评估领域提供了一种新的技术路径,展示了LLM在复杂社会和认知构建测量中的潜力。未来研究可以探索不同文化背景下的适用性,并扩展到更多的耐久技能评估领域,如情绪智能和领导力。

深度分析

研究背景

耐久技能如协作、创造力和批判性思维在现代职场中越来越重要。然而,这些技能的测量一直是个难题,因为传统方法难以兼顾生态效度和心理测量的严谨性。以往的研究多集中于自动评分和详细过程数据分析,但这些方法在真实情境中的应用有限。

核心问题

核心问题在于如何在保持自然互动的同时,进行可控和可重复的技能评估。传统方法往往在生态效度和心理测量的严谨性之间难以平衡,导致这些技能在教育课程中被忽视。

核心创新

本研究的核心创新在于引入了Executive LLM框架,通过模拟人类对话的方式,既保留了自然互动的真实性,又提供了可控性和可重复性。与现有的硬编码规则模拟相比,提供了更自然和高效的评估方式。

方法详解

  • �� 使用大语言模型(LLM)模拟人类对话,保持生态效度。
  • �� 引入Executive LLM,引导对话以获取高密度的技能证据。
  • �� 使用AI评估器自动分析对话记录并评估技能水平。

实验设计

实验设计包括让参与者与AI队友进行对话,任务包括科学讨论和辩论。使用Cohen's Kappa评估AI自动评分与专家评分的一致性,结果表明两者高度一致。

结果分析

实验结果显示,使用Executive LLM的对话中,技能证据的密度显著增加,冲突解决技能的对话中,证据率达到85%。AI自动评分与专家评分高度一致,Cohen's Kappa值在0.45-0.64之间。

应用场景

该框架可用于教育评估,帮助教师更好地理解学生的耐久技能水平,并为教育课程设计提供数据支持。

局限与展望

虽然该框架在实验中表现出色,但在某些复杂对话中,AI可能无法完全捕捉人类微妙的社交信号。此外,需要进一步验证在不同文化背景下的适用性。

通俗解读 非专业人士也能看懂

想象你在一个团队中工作,团队成员需要一起解决问题。通常情况下,团队成员之间的互动是自然的,但如果我们想要评估每个人的协作能力,就需要一种既能保持自然互动又能进行有效评估的方法。这个研究就像是给团队配备了一位智能助手,它不仅参与讨论,还能引导对话,让每个人的能力都能被清晰地展示出来。通过这种方式,我们可以更好地理解团队中每个人的能力。

简单解释 像给14岁少年讲一样

想象一下你和朋友在一起玩游戏,你们需要一起合作才能赢。这个研究就像是给你们的游戏加入了一个超级聪明的AI队友,它不仅能和你们一起玩,还能帮助你们展示出最好的合作技能。通过这种方式,老师可以更好地了解你们的合作能力,帮助你们在未来的学习中更好地发展这些技能。

术语表

大语言模型 (LLM)

一种能够理解和生成自然语言文本的AI模型,广泛用于对话系统和文本生成。

用于模拟人类对话,保持生态效度。

Executive LLM

一种特殊的大语言模型,负责引导对话以获取高密度的技能证据。

用于引导对话以获取更多技能证据。

AI评估器

一种用于分析对话记录并评估技能水平的AI工具。

用于自动分析对话记录并评估技能水平。

Cohen's Kappa

一种用于评估分类一致性的统计指标,值越高表示一致性越好。

用于评估AI自动评分与专家评分的一致性。

耐久技能

如协作、创造力和批判性思维等在现代职场中至关重要的技能。

研究的核心测量对象。

开放问题 这项研究留下的未解疑问

  • 1 如何在不同文化背景下应用该框架,确保其普适性和有效性。
  • 2 在更复杂的社交互动中,AI如何更好地捕捉人类微妙的社交信号。

应用场景

近期应用

教育评估

教师可以使用该框架更好地理解学生的耐久技能水平,并为教育课程设计提供数据支持。

远期愿景

智能教育系统

未来可以发展出更智能的教育系统,自动评估和提升学生的耐久技能。

原文摘要

Durable skills, such as collaboration, creativity and critical thinking, are instrumental to success in the modern workforce. Yet, measuring these skills remains a persistent challenge. Moreover, because what is not measured is often not taught, these skills are often overlooked in mainstream educational curricula. Designing effective assessments for these skills necessitates balancing two often-conflicting requirements: ecological validity and psychometric rigor. On the one hand, the assessment environment should emulate natural real-world human interaction between humans. On the other hand, it should be scalable, controllable and reproducible. Here we argue that LLMs can be used to better capture both of these aims. Concretely, we develop a framework where the subject converses with AI teammates in a way that resembles human-human interaction for authenticity, while also offering the psychometric control required for informative and robust assessment. Importantly, the AI participants not only act as teammates but also, in an "Executive LLM" setup, steer the conversation towards eliciting a high density of observable evidence for skill proficiency. We complement this with an AI evaluator that can be used to measure skill proficiency in such interactions. We evaluate our assessment protocol based on transcripts of interactions of human participants with our AI framework, for multiple durable skills. For the skill of creativity, we further demonstrate the efficacy of an autorater for evaluating complex tasks performed by real students. Our analysis shows that the use of the Executive LLM significantly increases elicited evidence and that LLM-automated scoring of conversations largely agrees with that of expert annotators. This research demonstrates the utility of orchestrated LLMs approaches for measuring complex social and cognitive constructs in a scalable and controllable manner.

cs.HC