ASI-Bench: At the Dawn of Artificial Superintelligence

TL;DR

提出ASI-Bench基准,评估AI自主探索和科研能力,平均得分从50.91降至26.62,显示系统依赖人类指导。

cs.AI 🔴 高级 2026-08-18 69 次浏览
Junwei Zhou Zhen Sun Binyu Li Jiangyu Zhou Yuexi Pan Hengyu Wang Honghe Ren Xiaohan Jia Xueyang Zhou Xiaoyu Cao Yongchao Chen Yuanning Feng Junhao Wu Cheng Zhang Sijia Chen Haoyu Xue Chengsong You Huan Wang Koutian Wu Peigan Gao Jiakun Wu Wenzhe Li Ergan Shang Qingyuan Zheng Jingjing Zhou Ruixuan Jia Yan Xu Hongrui Zhang Xiao-Han Ma Zhengxiang Cheng Yuexing Hao Liting Mai Xianglin Ji Wenjun Zhang Zhuofan Chen Yixiao Huang Chi Wang Wenyue Hua Yilun Hao Yuantao Zhai Ziyan Zhao Jingyan Xie
人工智能 科学研究 自主探索 基准测试 人工超智能

核心发现

方法论

ASI-Bench由40余专家耗时3万多小时设计,包含60个跨11领域的科研任务。采用逐步减少人类指导的策略,从全程指导到完全自主,评估AI在科研中的创新探索和自主执行能力。任务经过专家审查、AI辅助审核、沙箱执行和评分验证,确保科学性与可靠性。多模型配置下,性能从50.91降至26.62,揭示当前系统对人类指导依赖较重,尚未实现端到端自主科研。

关键结果

  • 在18种最先进模型配置中,平均得分由全指导的50.91下降至仅提供方法的29.10,完全自主的26.62,差距明显,反映出自主科研能力仍有限。
  • 模型如GPT-5.6 Ultra在全指导条件下得分最高达71.78,但在自主条件下仅剩26.62,说明自主探索仍面临巨大挑战。
  • 性能下降主要源于方法转化为完整流程的难度,模型在缺乏详细步骤指导时表现显著退步,强调操作化能力的瓶颈。

研究意义

该基准突破了传统以知识掌握为核心的评估范式,首次系统衡量AI在科研中的创新和自主能力,为未来超智能系统的研发提供量化指标。揭示当前AI在端到端自主科研方面的巨大差距,推动学界关注模型自主性与创新能力的提升,具有里程碑意义。

技术贡献

提出逐步减少人类指导的科研评估框架,结合多领域任务设计,构建科学严谨的验证体系。引入模型与系统的交互分析,强调操作化能力的重要性,推动科研自动化技术的理论与工程创新。实现了跨模型、跨任务的性能对比,为未来自主科研系统的设计提供基础。

新颖性

首次将科研任务逐步去除人类指导,系统评估AI自主探索、方法选择和科研执行的全过程,突破了传统单一任务或知识回忆的评估限制,强调自主性与创新能力的结合,具有开创性。

局限性

  • 当前系统在复杂科研任务中仍依赖人类指导,模型自主能力不足,难以应对高难度创新问题,反映出模型推理与操作化能力的不足。
  • 实验多依赖大规模算力和高端模型,成本较高,实际应用推广仍受限制。
  • 任务设计虽覆盖多领域,但仍未涵盖所有科研场景,未来需扩展复杂性和多样性。

未来方向

未来将优化模型的操作化能力,提升自主方法生成与验证效率。推动多模态、多任务协同,增强模型的跨领域泛化能力。同时,鼓励社区贡献新任务和评估指标,完善基准体系,逐步实现更高层次的自主科研能力。

AI 总览摘要

在人工智能快速发展的背景下,科学研究的自动化已成为学界关注的焦点。传统评估体系多侧重于知识掌握和任务执行,难以衡量AI在创新探索中的自主能力。为此,ASI-Bench应运而生,作为首个跨领域、逐步减少人类指导的科研能力评估基准,旨在检验AI自主进行科学研究的潜力。

ASI-Bench由40余专家耗费超过3万小时设计,涵盖11个科学领域的60个复杂科研任务。每个任务都模拟真实科研流程,从问题理解、方法选择、实验设计到结果验证,强调端到端的科研能力。通过逐步减少人类指导,从提供完整方法到仅给出研究目标,评估模型在自主探索、方法操作和结果产出方面的表现。

实验结果显示,最先进模型在全指导条件下得分达50.91,但在完全自主条件下仅剩26.62,差距明显。这反映出当前AI系统在科研自主性方面仍有巨大提升空间。性能的主要瓶颈在于模型将科学方法转化为完整流程的能力不足,强调操作化能力的关键作用。

该基准不仅为科研自动化提供了量化工具,也为未来超智能系统的研发指明方向。它推动学界关注模型的自主探索和创新能力,激励开发更具自主性和创造性的AI科研系统。未来,ASI-Bench将不断扩展任务范围,完善评估体系,助力人类迈向真正的人工超智能时代。

深度分析

研究背景

科学研究的自动化经历了从规则系统到深度学习的演变。早期的专家系统如DENDRAL和MYCIN在特定领域表现出色,但缺乏泛化能力。近年来,深度学习模型如AlphaFold和GPT系列在蛋白折叠预测和自然语言处理方面取得突破,推动科研自动化发展。然而,现有系统多依赖大量数据和人类指导,缺乏自主创新能力。传统评估多关注知识回忆和任务执行,难以衡量模型的创新探索和自主决策能力。随着超智能目标的提出,亟需新的评估框架来衡量AI在科研中的自主探索、方法创新和端到端执行能力。

核心问题

核心问题在于当前AI系统在科研中仍严重依赖人类指导,缺乏自主探索未知问题的能力。现有基准多局限于知识回忆或预定义任务,无法反映模型在开放性科研中的表现。如何设计一个能逐步减少人类干预、全面评估AI自主科研能力的基准,成为亟待解决的难题。该问题关系到未来AI能否真正成为科学创新的助力,突破现有技术瓶颈,实现自主创新和科学发现的目标。

核心创新

本研究的主要创新在于:1)提出逐步减少人类指导的科研评估策略,模拟真实科研中的自主探索过程;2)设计跨领域、多阶段的复杂科研任务,涵盖多学科知识和操作流程;3)引入多模型、多系统性能对比,强调模型与系统的交互作用;4)建立科学严谨的验证体系,确保任务的科学性和评估的可靠性。这些创新突破了传统单一任务或知识回忆的评估方式,为衡量AI科研自主性提供了全新思路。

方法详解

  • �� 任务设计:基于真实科研问题,涵盖数学、物理、化学等11个领域,构建60个复杂项目。• 逐步减少指导:从提供完整方法(B1)到只给研究目标(B3),逐步剥离人类干预。• 任务执行:模型需理解问题、选择方法、实现实验、验证结果,跨越多阶段、多决策点。• 审查验证:专家评审、AI辅助审核、沙箱执行,确保任务科学性和评估公正性。• 性能评估:在不同指导水平下,比较模型得分,分析自主探索能力。• 统计分析:多模型、多任务、多轮次,确保结果的可靠性与可重复性。

实验设计

采用多模型(如GPT-5.6 Ultra、Codex)在60个任务上进行评估,指标为B1-B4得分。实验设计包括不同指导级别(全指导、只给方法、完全自主)下的性能对比。通过大量沙箱运行验证任务的科学性,分析模型在方法转化、结果验证等环节的表现。还进行成本-性能分析,探讨算力投入与科研能力的关系。多轮次实验确保结果的稳定性和统计显著性。

结果分析

模型在全指导条件下平均得分50.91,逐步减少指导后,得分降至26.62,差异显著。GPT-5.6 Ultra在全指导条件下最高达71.78,但自主条件仅26.62,表明自主探索仍受限。性能下降主要源于操作化能力不足,模型难以将方法转化为完整流程。成本分析显示,完全指导显著降低算力消耗,而自主条件成本较高但效果有限,强调模型自主性的提升空间。

应用场景

该基准可用于评估未来AI科研系统的自主探索能力,推动自动化科学发现。行业中,药物设计、材料研发、天体物理等领域可借助此类系统实现高效创新。学术界可用其衡量模型的创新潜力,指导下一代科研AI的设计。未来,结合多模态数据和多任务学习,将进一步拓展应用场景。

局限与展望

当前系统在复杂创新任务中表现仍受限,模型自主能力不足,难以应对高难度科研挑战。实验成本高,依赖大规模算力,实际推广受限。任务设计虽多样,但仍未涵盖所有科研场景,未来需增加复杂性和多样性。模型操作化能力的不足是主要瓶颈,未来需加强推理与操作的结合。

通俗解读 非专业人士也能看懂

想象一个工厂里,工人们负责制造各种产品。传统上,工人们会按照说明书操作,每一步都很明确。现在,AI就像一个新来的工人,刚开始需要老板详细指导,告诉他每个步骤怎么做。随着时间推移,老板逐渐减少指导,让他自己决定怎么做。最开始,他只需要照着说明书走,后来只告诉他目标,最后完全让他自己决定怎么完成任务。这个过程就像ASI-Bench测试的逐步减少指导,让我们知道这个工人(AI)能不能自己独立完成复杂的制造任务。结果显示,刚开始他表现不错,但完全靠自己做时,还差得远。这个实验告诉我们,AI还需要很多训练,才能像真正的工人一样自主工作。

简单解释 像给14岁少年讲一样

想象你在学校里学做菜,一开始老师会详细告诉你每一步怎么做,比如切菜、炒菜、调味。慢慢地,老师会少一些指导,只告诉你目标,比如做一道意大利面。最后,你自己决定用什么调料、怎么炒,自己试试。这个过程就像让AI自己探索科研问题,从一开始的全程指导,到最后完全靠自己完成任务。实验发现,AI在老师全程指导时表现很好,但自己做时就差很多,就像你自己做菜时还不够熟练。这个研究告诉我们,要让AI变得更聪明、更自主,还需要很多练习和改进,就像你学做菜一样。

原文摘要

Artificial superintelligence (ASI) requires AI to move beyond mastering existing knowledge toward exploring the unknown, creating new knowledge, and turning new ideas into verifiable results. However, the capabilities of today's AI systems are still largely built on learning, compressing, and applying existing human knowledge. Accordingly, existing benchmarks primarily test whether AI can produce correct answers based on learned knowledge, or whether it can complete tasks under extensive human guidance. We therefore introduce ASI-Bench, the first benchmark to jointly evaluate AI systems' capabilities of innovative exploration and autonomous scientific execution across general research domains, and the first to progressively withdraw human methodological guidance within the same research project to test how far AI can proceed on its own. Built by over 40 experts with the cost of 31,000+ human hours, ASI-Bench contains 60 project-level research tasks across 11 scientific domains and progressively reduces methodological guidance to test whether AI can independently select methods, conduct research, and produce verifiable results. All tasks undergo expert review, AI-assisted auditing, sandbox execution, and scorer validation. Across 18 state-of-the-art agent--model configurations, the average score drops from 50.91 with full methodological guidance to 29.10 with only the method specified and 26.62 when agents must determine the method themselves. This sharp decline shows that current systems remain heavily dependent on human guidance and are still far from autonomously conducting end-to-end, project-level scientific research. ASI-Bench is open to the world. We invite researchers and builders everywhere to contribute new tasks, challenge the limits of today's AI, and help accelerate humanity's collective path toward artificial superintelligence at https://asibench.apexin.ai/submit.

cs.AI