Agents' Last Exam

TL;DR

ALE基准评估AI在长远、经济价值高的真实行业任务中的表现,涵盖55个子领域,实测全通过率低于1%。

cs.AI 🔴 高级 2026-06-04 9 引用 88 次浏览
Yiyou Sun Xinyang Han Weichen Zhang Yuanbo Pang Tianyu Wang Yuhan Cao Yixiao Huang Chris Duroiu Haoyun Zhang Jeffrey Lin Weishu Zhang Tyler Zeng Ying Yan Bo Liu Hanson Wen Mingyang Xu Xiaoyuan Liu Zimeng Chen Weiyan Shi Amanda Dsouza Vincent Sunn Chen Patrick Bryant Carl Boettiger Yamini Rangan Bradley Rothenberg Kyle Steinfeld Arvind Rao Tapio Schneider Georgios Yannakakis Laure Zanna Kaan Ozbay Ida Sim Tarek Zohdi George Em Karniadakis Jack Gallant Teresa Head-Gordon Yushan Li Wenxi Deng Tao Sun Huiqi Wang Zhun Wang Justin Xu Chris Yuhao Liu Yafei Cheng Rongwang Hu Aras Bacho Shengcao Cao Zengyi Qin Yixiong Chen Hengduan Fan Hao Liu Lin Zeng Shashank Muralidhar Bharadwaj Litian Gong Yingxuan Yang Maojia Song Ruheng Wang Zongzheng Zhang Honglin Bao Shuo Lu Jianhong Tu Zhonghua Wang Zheng Zhang Zijiao Chen Yanqiong Jiang Zhendong Li Bohan Lyu Chang Ma Peiran Xu Benran Zhang Shangding Gu Haoyue Hua Haoyang Li Wanzhe Liao Chengzhi Liu Junbo Peng Haoran Sun Zechen Xu Bo Chen Jiayi Cheng Yi Jiang Keying Kuang Yuan Li Youbang Pan Ziyan Rao Alexander Schubert Yifan Shen Vincent Siu Xiatao Sun Kangqi Zhang Xiaopan Zhang Yuchen Zhu Ishaan Singh Chandok Lei Ding Jingxuan Fan Andrew Glover Jiaming Hu Yiran Hu Wenbo Huang Zixin Jiang Haoran Jin Lukas Kim Ming Liu Yang Liu Alireza Rafiei Xuhuan Shen Kunyang Sun Sophia Sun Ting Sun Eric Wang Yixin Wang Hanwen Xing Sihan Xu Yuzheng Xu Zhongxing Xu Zhiling Yan Boqin Yuan Ruiqi Zhang Yifan Zhang Zibo Zhao Liana Santanu Bosu Antu Haoyue Bai Carlo Bosio Joseph Cavanagh Patricia Cavazos-Rehg Tianxing Chen Xuewen Chen Yipu Chen Chenyu Zhu Chen Dai Stefano De Castro Yunfu Deng Kaustubh Dhole Jiayuan Ding Chenchen Du Zhehang Du Hao Fan Run-Ze Fan Hengyu Fu Shi Gu Yifan Gu Charlie Guo Baihe Huang Baixiang Huang Rimika Jaiswal Zhihan Jiang Ran Jin Erin Kasson Xin Lan Joseph Lee Deren Lei Chenyu Li Daofeng Li Haitao Li Hongwei Li Jingyan Li Xiao Li Yi Li Yinsheng Li Yuangang Li Zhixu Li Wenyu Liang Longtai Liao Kevin Qinghong Lin Andy Zeyi Liu Che Liu Jiaming Liu Kaiyuan Liu Xuan Liu Pan Lu Wenbo Lv Yicheng Lyu Qiuyang Mang Kyle Montgomery Yuzhou Nie Ruoxi Ning Jorin Overwiening Xu Pan Layna Paraboschi Core Francisco Park Justin Purnomo Swati Rajwal Scott Rankin Bixuan Ren Yiren Rong HaoYang Shang Ventus Shaw Fiona Shen Jiawei Shen Minqi Shi Shi Qiu Huaxiu Yao Tianneng Shi Jonah So Vladislav Susoy Hannah Szlyk Haocheng Wang Jialu Wang Wei Wang Xinyu Wang Zehao Wang Dowling Wong Angela Wu Dehao Wu Fangyu Wu Mengyuan "Millie" Wu Yu Wu Yuchen Wu Yuhao Wu Qingpo Wuwu Weihang Xiao Yongyi Xiong Fan Xu Ruiling Xu Mingxuan Yan Benjamin Yang Jirong Yang Sen Yang Xiaoli Yang Yushi Yang Haoran Ye Xiaohu Yu Zhengming Yu Chenlong Zhang Chi Zhang Hanning Zhang Hanwen Zhang Junge Zhang Kunpeng Zhang Song Zhang Wenjin Zhang Wenshuo Zhang Ying Zhang Yizhi Zhang Brian Zhao Qijian Zhao Yimin Zhao Yuhaohua Zheng Liwei Zhou Tianyue Zhou Sichen Zhu Siqi Zhu Yan Zhu Yishu Zhu Jierui Zuo Chonghao Cai Helena Casademunt Wenjia Chen Cheng Cheng Nawen Deng Rao Fu Tianfu Fu Yifan Han He Ren Zhenyu He Qiao Jin Langlang Li Yuetai Li Sylvia Liu Lu Lu Luqing Zhou Subhabrata Mukherjee Yunqi Ouyang Yin Ren Dawei Shi Haoran Wu Zhiyue Wu Hannah Yao Zhuoran Yi Jenny Yu Rhea Zhan Hang Zhou Blake Zhu Junfan Zhu Alan Yuille Yang Liu Russell Alan Poldrack Jiachen Li Zhenglu Li Molei Tao Jing Huang Wenqi Shi Costas Spanos Lichao Sun Chenguang Wang Orson Xu Zhen Dong Hector Gomez Aylin Caliskan Ali Emami Haimin Hu Zhi Li Lihui Liu Murphy Niu Yi Shao Jianxin Sun Mikko Tolonen Ting Wang Sanjiv Das Yanjun Gao Wenbo Guo Erika J Schneider Zhiyong Lu Yian Ma Mark Mueller Radha Poovendran Somayeh Sojoudi Yinglun Zhu Dawn Song
AI评估 行业应用 长远任务 实证验证 行业任务

核心发现

方法论

本研究设计了‘Agents的最后考试’(ALE)基准,结合250余行业专家的深度合作,构建涵盖55个子领域、13个行业集群的任务体系。任务采集自真实职业实践,确保代表性与复杂性,采用多轮专家评审和质量控制,确保任务的真实性、复杂度和可验证性。ALE通过结构化的交付物和里程碑检查,避免了人类主观判断的偏差,标准化了评估流程。目标系统为通用计算机操作智能体(如Claude Code、Codex),融合视觉感知、代码执行、工具使用和长远规划能力,模拟真实工作环境中的多模态交互。其评估体系不仅关注任务完成率,也强调任务的经济价值和行业影响,推动AI从“竞赛”走向“产业应用”。

关键结果

  • 目前最强配置(Codex配合GPT-5.5)在Terminal-Bench中已达82%的成功率,但在ALE最易级别任务中仍不足50%,最难级别任务的成功率低于10%。大部分主流模型(如Claude Code)在高难度任务中几乎无法通过,平均全通过率低于1%。这表明当前AI系统在复杂、真实的行业任务中仍处于早期阶段,尚未达到工业应用的门槛。
  • 不同子领域的任务难度差异显著,部分行业如电子工程、生命科学表现相对较好,但整体覆盖仍不足。ALE的持续扩展和滚动评估机制,有望逐步推动模型在多行业、多任务场景中的能力提升。
  • 实验还显示,模型在多模态、多步骤任务中的表现远低于人类专家,验证了行业任务的复杂性和对系统推理、规划能力的高要求。这也强调了未来模型需要在长远规划、跨模态理解方面取得突破。

研究意义

ALE作为一个面向真实行业的长远任务评估基准,填补了目前AI行业评估体系的空白。它不仅衡量模型的技术能力,更关注模型在实际产业中的应用潜力,推动AI从“实验室”走向“产业化”。通过与行业专家合作,确保任务的真实性和复杂性,ALE为AI系统的工业落地提供了科学、可量化的评价工具,有助于引导研究聚焦于具有经济价值的长远任务,促进AI技术的产业转化,最终实现对GDP的实际贡献。这一评估体系的建立,有望引领行业制定更具实际意义的研发目标,加快AI在制造、医疗、金融等关键行业的应用步伐。

技术贡献

本研究提出了结合真实行业任务的长远评估框架,创新性地将复杂的职业工作流程转化为结构化、可验证的任务实例,突破了传统基准在真实性和复杂性上的限制。ALE采用多轮专家评审和自动化质量控制,确保任务的真实性和可重复性,避免了人工主观偏差。其核心技术包括多模态交互模拟、长远规划能力的评估以及基于结构化交付物的自动验证机制,显著提升了评估的科学性和实用性。此外,ALE还引入滚动评估和私有/公共任务池机制,有效防止模型过拟合和数据污染,为未来持续评估提供了可持续的架构。这些技术创新为行业级AI评估提供了新范式,也为未来模型的长远能力提升提供了明确的目标。

新颖性

ALE的最大创新在于其基于真实行业工作流程的长远任务设计,结合多模态交互和结构化验证,首次实现了行业任务的标准化、可验证和持续评估。不同于以往偏重短期问答或模拟环境的基准,ALE强调任务的复杂性和经济价值,体现了从“能力测试”向“产业应用”转变的趋势。这一创新突破了现有评估体系在真实性、复杂性和行业覆盖上的局限,为AI系统的工业落地提供了科学依据。其采用的多轮专家评审和滚动更新机制,也为行业评估树立了新标杆,推动AI评估从静态向动态、从局部向全局演进。

局限性

  • 当前ALE的任务仍主要依赖专家贡献,存在一定的主观偏差和行业覆盖不平衡的问题,部分行业的任务数量和复杂度尚未充分代表行业全貌。
  • 模型在多模态、多步骤复杂任务中的表现仍远低于人类专家,说明模型在长远规划、跨模态理解和复杂交互方面仍有较大差距,未来需要在模型架构和训练策略上进行创新。
  • 评估过程的自动化程度有限,部分验证环节依赖人工判断,可能影响评估的客观性和效率。未来需引入更先进的自动验证技术,提升评估的规模和一致性。

未来方向

未来,ALE将不断扩展任务库,涵盖更多行业和复杂场景,推动模型在更广泛的行业应用中实现突破。同时,将结合强化学习、元学习等技术,提升模型的长远规划和跨模态理解能力。还计划引入更智能的自动验证机制,减少人工干预,提升评估效率。行业合作方面,将加强与产业界的深度合作,推动AI在制造、医疗、金融等行业的实际部署。最终目标是建立一个动态、全面、可信的行业AI能力评估体系,助力AI技术实现真正的产业变革。

AI 总览摘要

近年来,人工智能(AI)技术在多个标准化测试中取得了令人瞩目的突破,如在围棋、国际象棋、图像识别和自然语言处理等领域,模型表现已逼近甚至超越人类水平。然而,这些技术成就未能有效转化为产业级的实际应用,尤其是在需要长远规划、复杂交互和行业专业知识的真实工作场景中,AI系统的表现仍远远不够。这一差距的根源在于现有的评估体系缺乏对行业真实任务的持续、系统性衡量,难以反映模型在实际生产环境中的能力和潜力。

为解决这一问题,本文提出了‘Agents的最后考试’(ALE)基准,旨在通过真实行业任务的长远评估,推动AI系统向产业应用迈进。ALE由来自250余行业专家共同设计,涵盖13个行业集群、55个子领域,涉及超过1000个具体任务。这些任务源自真实职业实践,经过多轮专家评审和质量控制,确保其真实性、复杂性和可验证性。ALE采用多模态交互、结构化交付物和自动验证机制,模拟AI在复杂工作流程中的表现,评估其在长远规划、工具使用和行业知识上的能力。

实验结果显示,当前最先进的模型(如Codex配合GPT-5.5)在最简单任务中成功率仅达50%,在最难任务中甚至不足10%,远低于人类专家的水平。这表明,尽管在短期任务和标准测试中表现优异,但在真实行业环境中的长远任务中,AI仍面临巨大挑战。ALE的持续扩展和滚动评估机制,有望引导模型逐步突破行业壁垒,实现从“能力测试”到“产业应用”的转变。

这一基准的建立,不仅为学术界提供了新的研究方向,也为产业界提供了科学的评估工具,推动AI技术在制造、医疗、金融等关键行业的落地应用。未来,ALE将不断扩充任务库,结合强化学习等前沿技术,提升模型的长远规划和多模态理解能力,最终实现AI在真实行业中的广泛应用,助力数字经济的高速发展。

深度分析

研究背景

人工智能技术经过数十年的发展,逐步从基础算法研究走向实际应用。早期的研究主要集中在图像识别、自然语言处理等单一任务上,如ImageNet竞赛推动了深度学习的快速发展。近年来,诸如BERT、GPT系列模型、Transformer架构等技术的出现,极大提升了模型的能力,使其在问答、翻译、生成等方面表现出色。然而,尽管在标准化测试中取得了突破,AI在复杂、长远、行业特定任务中的表现仍有限。传统评估多依赖于短期任务或模拟环境,难以反映模型在真实工作场景中的能力。为此,行业亟需建立面向实际产业的评估体系,衡量模型在长远、复杂、经济价值高的任务中的表现。此前的工作如GDPval、Remote Labor Index等,尝试引入经济指标,但缺乏真实行业任务的深度结合,难以全面反映模型的实际应用潜力。

核心问题

当前AI系统在标准测试中表现优异,但在实际行业应用中仍面临巨大挑战。主要问题包括:1)缺乏针对真实行业长远任务的系统性评估,导致模型在实际生产环境中的能力难以量化;2)行业任务的复杂性和多模态交互要求超出大多数模型的能力范围,尤其是在长远规划、跨模态理解和多步骤操作方面;3)现有评估多依赖人工判断,缺乏自动化、客观的验证机制。这些问题限制了AI技术的产业化进程,也阻碍了模型在关键行业的广泛应用。解决这些问题,要求建立一个全面、真实、可验证的行业任务评估体系,推动模型在复杂、多模态、多步骤任务中的能力提升。

核心创新

ALE的核心创新在于其面向真实行业的长远任务设计,结合多模态交互和结构化验证,建立了一个具有代表性和可扩展性的评估框架。具体创新点包括:1)任务源自行业专家的真实项目,确保代表性和复杂性;2)采用多轮专家评审和自动化质量控制,保证任务的真实性和可验证性;3)引入结构化交付物和里程碑式检查,避免主观判断偏差;4)支持多模态交互(GUI、CLI、视觉感知等),模拟真实工作场景;5)滚动评估机制,持续扩展任务池,保持评估的动态性。这些创新使ALE成为首个兼具真实性、复杂性和行业广泛覆盖的长远任务评估体系,为AI产业化提供了坚实基础。

方法详解

  • �� 任务设计:结合行业专家贡献的真实项目,定义任务目标、输入输出、软件环境和评价标准。
  • �� 任务采集:通过专家提交、自动筛选和多轮评审,确保任务的真实性和复杂性。
  • �� 质量控制:多轮专家评审、工程调试和自动验证,确保任务的可执行性和可验证性。
  • �� 任务组织:将任务划分为子领域和行业集群,构建多层次任务体系。
  • �� 评估体系:采用结构化交付物和里程碑检查,结合自动化验证和专家评审,确保评估的客观性和一致性。
  • �� 模型评测:在虚拟环境中运行模型,模拟真实工作流程,记录任务完成情况和质量指标。
  • �� 持续更新:滚动引入新任务,维护任务池的动态平衡,避免数据污染和过拟合。

实验设计

实验采用由行业专家贡献的真实任务,覆盖电子工程、生命科学、工业设计等多个行业。模型选择包括Codex、Claude Code、GPT-5.5等主流大模型,评估指标为任务成功率、任务完成质量和行业相关指标。通过不同难度层级的任务,测试模型在长远规划、多模态交互和复杂操作中的表现。实验还设计了消融研究,分析模型在不同模块(视觉、代码、规划)上的贡献。评估过程中引入滚动机制,动态调整任务难度和数量,确保评估的持续性和代表性。结果显示,最先进模型在最简单任务中成功率达82%,在最难任务中不足10%,验证了行业任务的复杂性和模型的差距。

结果分析

  • �� 目前最强模型(Codex + GPT-5.5)在Terminal-Bench中成功率达82%,但在ALE最易任务中仅达50%,在最难任务中不足10%。
  • �� 大部分模型在复杂、多模态任务中的表现远低于人类专家,成功率平均低于1%,显示出模型在行业级长远任务中的巨大差距。
  • �� 不同行业表现差异明显,电子工程和生命科学表现较好,但整体覆盖仍不足,表明模型需要在多行业、多任务场景中持续提升。
  • �� 实验还揭示模型在多步骤、多模态交互中的局限,强调未来模型在长远规划、跨模态理解方面的突破需求。

应用场景

ALE的评估体系可直接应用于工业界,用于检测和提升AI在制造、医疗、金融等行业的长远任务能力。企业可以利用ALE评估模型的行业适应性,指导研发方向。未来,结合ALE的评估结果,行业可以设计定制化的AI解决方案,实现自动化、智能化生产流程。长远来看,ALE有望成为行业标准,推动AI在复杂、长远、经济价值高的任务中的广泛应用,助力数字经济升级。

局限与展望

  • �� 目前任务主要由行业专家贡献,存在一定的主观偏差,行业覆盖尚未完全平衡,部分行业任务数量不足。
  • �� 模型在多模态、多步骤复杂任务中的表现仍远低于人类,说明模型在长远规划和跨模态理解方面仍有巨大提升空间。
  • �� 评估流程部分依赖人工判断,自动化验证尚不完善,未来需引入更先进的自动验证技术以提升效率和客观性。

通俗解读 非专业人士也能看懂

想象你在一家大型工厂工作,这个工厂生产各种各样的商品。每个岗位都有一套复杂的流程,比如设计、装配、检验和包装。工人们都非常熟悉自己的任务,知道每一步该做什么,也知道怎么检查工作是否符合标准。现在,假如你要设计一个机器人,让它能像人一样完成这些复杂的任务,不仅要懂得怎么操作各种工具,还要能规划整个流程,确保每个环节都顺利完成。这个机器人需要学会看、听、操作,还要理解每个任务的目标和标准。ALE就像是给这个机器人出的一场“期末考试”,它会让机器人去完成真实的行业任务,比如设计一款机械零件或编写一段代码,最后检查它的成果是否符合行业标准。这个考试的难度很大,因为任务很复杂,要求机器人像专业人士一样工作,还能验证成果是否正确。通过这个考试,我们可以知道这个机器人是否真的具备了进入工厂工作的能力,是否能帮企业提高效率、降低成本。ALE的目标就是让AI系统像工厂里的顶尖工人一样,能长远、稳定地完成复杂的行业任务,从而推动整个产业的智能化升级。

简单解释 像给14岁少年讲一样

想象你在学校里参加一个特别的考试,这个考试不是简单的选择题,而是要你用一整天的时间完成一项复杂的任务,比如设计一个模型、写一段程序,或者做一份科学报告。这种考试很难,因为它需要你用到很多技能:观察、思考、规划、操作工具,还要确保你的作品符合老师的标准。现在,假设有个机器人也要参加这个考试,但它不是用普通的方法,而是用一种特别聪明的方式:它可以看、听、操作各种工具,还能自己规划每一步怎么做。这个机器人要在考试中表现得像一个专业人士一样,完成所有任务,并且让老师能验证它的成果是不是符合要求。这个“考试”就是ALE,它用真实的行业任务来测试这些机器人,看它们是不是能像人一样完成复杂的工作。比如,让机器人设计一款机械零件,或者写一段代码,然后检查它的作品是不是符合标准。这个考试很难,因为任务很复杂,要求机器人不仅要会操作,还要会思考、规划。通过这个考试,我们可以知道这些机器人是否真的有能力在未来的工厂、医院、公司里工作,帮人们做更好的事情。ALE的目标就是让AI变得更聪明、更可靠,最终能帮我们解决很多实际问题,让我们的生活变得更方便、更高效。

术语表

Long Horizon Tasks (长远任务)

指需要多步骤、多时间段完成的复杂工作流程,涉及规划、决策和多模态交互。技术上要求模型具备长远规划和跨模态理解能力。

本文中ALE评估的行业任务都属于长远任务,考察AI系统在复杂、多步骤工作中的表现。

Structured Deliverable (结构化交付物)

指任务完成后产生的具有明确格式和内容的输出物,如设计文件、代码、报告等,便于自动验证。

ALE采用结构化交付物作为评估标准,确保任务成果可自动比对和验证。

Multi-modal Interaction (多模态交互)

模型同时处理视觉、文本、操作界面等多种信息输入,实现复杂场景中的信息融合与决策。

ALE中的任务要求模型在GUI、CLI、视觉感知等多模态环境中操作,模拟真实工作流程。

Expert Review (专家评审)

由行业专家对任务设计、执行和验证进行多轮评审,确保任务的真实性和行业代表性。

ALE的任务由行业专家贡献,经过严格评审和质量控制,保证其行业适用性。

Rolling Evaluation (滚动评估)

持续引入新任务、淘汰旧任务,保持评估体系的动态性和代表性,避免模型过拟合。

ALE采用滚动机制,确保模型在不断变化的任务环境中持续提升。

Verifiable Outcomes (可验证结果)

任务输出可以通过自动化手段或明确标准进行验证,减少主观判断。

ALE强调任务成果的可验证性,以确保评估的客观性和一致性。

Industry Clusters (行业集群)

将相关行业按照工作流程和软件工具相似性归类,便于系统性评估。

ALE的任务体系基于行业集群划分,确保覆盖多样化的行业场景。

Benchmark (评估基准)

用于衡量模型能力的标准体系,包括任务集、评价指标和验证机制。

ALE作为面向行业的长远评估基准,旨在推动模型产业化。

Multi-round Quality Control (多轮质量控制)

通过多次评审和调试,确保任务的真实性、复杂性和可验证性。

ALE采用多轮专家评审和自动验证,确保任务质量。

Economic Value Workflows (经济价值工作流程)

在行业中具有明确经济贡献的工作任务,涉及设计、生产、分析等环节。

ALE任务源自真实行业实践,强调其经济价值。

Automated Validation (自动验证)

利用算法和规则自动检查任务成果的正确性和符合性。

ALE引入自动验证机制,减少人工判断,提高效率。

Task Taxonomy (任务分类体系)

按照行业、技能和软件工具,将任务系统化分类,便于评估和扩展。

ALE基于SOC和O*NET构建任务分类体系,确保行业覆盖的科学性。

Industry Experts (行业专家)

具有丰富行业经验的专业人士,负责任务设计、评审和验证。

ALE的任务由行业专家贡献,确保真实性和复杂性。

Benchmark Saturation (基准饱和度)

指模型在某一评估体系中达到接近最大能力的状态。

ALE目前尚未饱和,模型在最难任务中的成功率仍很低。

Long-term Planning (长远规划)

模型在完成任务时,能合理安排多步骤、多阶段的工作流程。

ALE强调模型在复杂行业任务中的长远规划能力。

开放问题 这项研究留下的未解疑问

  • 1 尽管ALE在行业任务的真实性和复杂性方面取得了突破,但模型在跨行业迁移和泛化能力方面仍存在不足。未来需要研究如何提升模型在不同任务和行业间的知识迁移能力,解决行业特定知识的泛化问题。此外,自动验证机制的完善也是未来的重要方向,以减少人工干预,提高评估效率。如何设计更具普适性和可扩展性的任务体系,也是行业面临的挑战。最后,模型在长远规划和多模态理解中的能力仍需突破,这需要结合新型架构和训练策略。

应用场景

近期应用

行业能力评估工具

企业可以利用ALE对AI模型进行行业适应性和能力的评估,指导研发和部署,提升自动化水平,降低行业门槛。

模型性能诊断平台

ALE提供详细的任务表现分析,帮助企业识别模型在复杂行业任务中的短板,优化模型结构和训练策略。

行业标准制定依据

作为行业能力评估的参考标准,ALE可以推动行业制定AI应用的能力门槛和行业准入标准。

远期愿景

推动产业智能化升级

ALE的持续发展将促使AI在制造、医疗、金融等行业实现深度融合,推动产业数字化转型,提升整体生产效率和创新能力。

构建行业级AI能力评估体系

未来,ALE有望成为行业通用的AI能力评估平台,为不同企业提供统一的能力验证标准,促进AI技术的广泛应用和标准化。

原文摘要

Recent AI systems have achieved strong results on a wide range of benchmarks, yet these gains have not translated into economically meaningful deployment across many professional domains. We argue that this gap is largely an evaluation problem: widely used benchmarks lack sustained performance measurement on real and economically valuable workflows. This paper introduces Agents' Last Exam (ALE), a benchmark designed to evaluate AI agents on long horizon, economically valuable, real world tasks with verifiable outcomes. Developed in collaboration with 250+ industry experts, ALE covers non-physical industries defined with reference to O*NET / SOC 2018 (the U.S. federal occupational taxonomy). It is organized around a task taxonomy with 55 sub fields grouped into 13 industry clusters covering 1K+ tasks. Current results show that the hardest tier remains far from saturated: across mainstream harness and backbone configurations, the average full pass rate is below 1%. ALE is designed as a living benchmark: its task pool grows continuously as new workflows and industries are onboarded. More broadly, ALE is intended not merely as another leaderboard, but as an instrument for closing the gap between benchmark success and GDP relevant impact.

cs.AI cs.CL cs.LG

参考文献 (20)

ReAct: Synergizing Reasoning and Acting in Language Models

Shunyu Yao, Jeffrey Zhao, Dian Yu 等

2022 10647 引用 查看解读 →

The U.S. National Science Foundation

1963 8 引用

google,我,萨娜

Huafu Fang

2006 9452 引用

Cursor

Kenneth A. Ross, C. S. Jensen, R. Snodgrass 等

2009 197 引用

Artificial Intelligence Risk Management Framework (AI RMF 1.0)

AI Nist, Secretary Gina M. Raimondo, L. Locascio

2023 1276 引用

The Twelfth International Conference on Learning Representations, ICLR 2024, Vienna, Austria, May 7-11, 2024

2024 249 引用

UNDERSTANDING WORK USING THE OCCUPATIONAL INFORMATION NETWORK (O*NET): IMPLICATIONS FOR PRACTICE AND RESEARCH

NORMAN G. Peterson, Michael D. Mumford, W. C. Borman 等

2001 469 引用

ImageNet: A large-scale hierarchical image database

Jia Deng, Wei Dong, R. Socher 等

2009 75571 引用

Mastering the game of Go with deep neural networks and tree search

David Silver, Aja Huang, Chris J. Maddison 等

2016 19210 引用

Video Processing From Electro-Optical Sensors for Object Detection and Tracking in a Maritime Environment: A Survey

D. K. Prasad, D. Rajan, L. Rachmawati 等

2016 447 引用 查看解读 →

“Alibaba”

Ltd. v. Shenzhen Netac Technology Co. Ltd. and Guangzho Hangzhou Alibaba Advertising Co.

2019 205 引用

Measuring Massive Multitask Language Understanding

Dan Hendrycks, Collin Burns, Steven Basart 等

2020 9302 引用 查看解读 →

Gym-Anything: Turn any Software into an Agent Environment

Pranjal Aggarwal, Graham Neubig, S. Welleck

2026 15 引用 查看解读 →

Asynchronous Trajectory Matching-Based Multimodal Maritime Data Fusion for Vessel Traffic Surveillance in Inland Waterways

Yu Guo, Ryan Wen Liu, Jingxiang Qu 等

2023 95 引用 查看解读 →

WebArena: A Realistic Web Environment for Building Autonomous Agents

Shuyan Zhou, Frank F. Xu, Hao Zhu 等

2023 1891 引用 查看解读 →

SWE-bench: Can Language Models Resolve Real-World GitHub Issues?

Carlos E. Jimenez, John Yang, Alexander Wettig 等

2023 3510 引用 查看解读 →

GAIA: a benchmark for General AI Assistants

G. Mialon, Clémentine Fourrier, Craig Swift 等

2023 1140 引用 查看解读 →

OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments

Tianbao Xie, Danyang Zhang, Jixuan Chen 等

2024 1081 引用 查看解读 →

SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering

John Yang, Carlos E. Jimenez, Alexander Wettig 等

2024 1689 引用 查看解读 →

OpenHands: An Open Platform for AI Software Developers as Generalist Agents

Xingyao Wang, Boxuan Li, Yufan Song 等

2024 968 引用 查看解读 →

被引用 (9)

Kimi K3: Open Frontier Intelligence

2026 9 引用 ⭐ 高影响力 查看解读 →

BrainPilot: Automating Brain Discovery with Agentic Research

2026 1 引用 ⭐ 高影响力 查看解读 →

FrontierChallenge: Evaluating Scientific Workflow Completion

What is Missing from AI Post-Training AI: An Empirical Analysis

StartupBench: Benchmarking General-Purpose Agents on Market-Validated End-to-End Workflows

FinProBench: Evaluating Financial AI Agents with Role-Grounded Rubrics Derived from Professional Deliverables

2026 1 引用 查看解读 →

How Well Can Frontier Large Language Models Generate Structures? High Quality Prediction of Molecular Geometries with Help from Fine-Tuning

MobileForge: Annotation-Free Adaptation for Mobile GUI Agents with Hierarchical Feedback-Guided Policy Optimization

2026 3 引用 查看解读 →

AGENTS4GEOS: agentic platform for open-source multi-physics simulation