核心发现
方法论
AIBuildAI-2采用层级知识系统,分为高层策略指令和底层知识文档,动态加载相关内容。通过多代理架构(设计、编码、调优)结合知识检索,基于Web采集、清洗和结构化知识,结合自我经验提炼,持续更新知识库。模型设计利用特定算法(如XGBoost、LightGBM、CheMeleon)实现多任务预测,结合动态知识检索优化决策。系统在Web数据基础上构建知识体系,利用LLM分析运行经验,自动更新策略,有效提升模型性能。
关键结果
- 在MLE-Bench上,AIBuildAI-2以70.7%的奖牌率排名第一,显著优于所有基线方法(如R&D-Agent、AIRA-dojo等),在不同复杂度任务中表现均衡。其在心脏病预测竞赛中,排名前6.6%,达到了专家水平,使用多模型融合策略(如CatBoost、XGBoost、LightGBM)实现高性能预测,AUC达0.95529。
- 在药物ADMET预测中,AIBuildAI-2通过结合图神经网络(CheMeleon)和传统机器学习(LightGBM),在多任务预测中获得平均绝对相对误差0.63,排名前40名,超越基于静态知识库的模型,展现出强泛化能力。
- 模型的持续学习机制(通过运行后提炼经验,更新知识库)显著提升了系统的适应性和性能,验证了知识系统在自动AI建模中的关键作用。
研究意义
该研究突破了AI模型自动化开发的瓶颈,显著降低非AI专家的门槛,推动科学研究和工业应用的普及。通过层级知识系统结合自我演化机制,有效解决了知识静态、更新滞后问题,提升了模型开发效率和性能。这不仅推动了自动化AI的理论发展,也为实际科研提供了强大工具,具有广泛应用前景。
技术贡献
创新点在于引入层级知识系统,结合动态知识检索与自我更新机制,打破静态知识限制。多代理架构实现端到端自动建模,利用LLM分析经验,自动提炼策略,显著提升模型性能。系统在多个真实任务中实现超越人类专家的表现,验证了其技术优势。
新颖性
首次将层级知识体系与自我演化机制结合,构建动态、可扩展的自动AI建模平台。区别于传统静态知识库和单一搜索方法,本系统实现知识的持续积累与优化,显著提升自主建模能力,填补了自动AI开发中知识动态更新的空白。
局限性
- 系统对Web数据质量依赖较大,可能受到噪声干扰,影响知识准确性。
- 在极端复杂或新颖任务中,知识系统的覆盖度有限,表现仍有提升空间。
- 模型训练和知识更新过程计算成本较高,存在效率瓶颈。
未来方向
未来将结合强化学习优化知识检索策略,提升系统自主学习能力;扩展多模态知识融合,增强对新兴领域的适应性;同时优化系统架构,降低计算成本,推动工业化应用。
AI 总览摘要
AIBuildAI-2代表了自动AI模型开发的最新突破。传统方法依赖人工设计和调优,耗时耗力,难以普及。本文提出的AIBuildAI-2通过引入层级知识系统,结合多代理架构,实现从任务描述到模型训练的全自动流程。其核心创新在于动态加载相关知识,结合外部不断演化的知识库,自动提炼经验,持续优化模型性能。在多个真实任务中,AIBuildAI-2表现优异,MLE-Bench排名第一,奖牌率达70.7%,远超现有方法。其在心脏病预测和药物ADMET任务中,也达到了专家水平,验证了系统的泛化能力。这一技术不仅降低了非专业人士的门槛,也为科研和工业界提供了强大工具。未来,系统将结合强化学习和多模态知识,进一步提升自主学习和适应新领域的能力,推动自动AI的广泛应用。
深度分析
研究背景
随着深度学习的发展,AI模型在图像、文本、生命科学等领域取得巨大成功。早期工作如AutoML、Neural Architecture Search(NAS)实现了模型自动设计,但仍依赖大量人工调优。近年来,基于大规模预训练模型(如GPT、BERT)的方法推动了自动化,但其知识静态、更新滞后,限制了实际应用。现有自动AI系统多依赖静态知识库或简单搜索,难以应对快速变化的技术前沿。尽管如此,自动化建模仍面临知识动态更新、复杂任务适应性不足等挑战。
核心问题
核心问题在于现有自动AI系统缺乏动态、结构化的知识体系,导致模型设计受限,难以应对新兴任务和技术。静态知识库无法跟上领域快速演进,搜索噪声和信息不一致也影响决策质量。此外,缺乏自我学习机制,使系统难以积累经验和持续优化。这些限制严重制约了自动AI的普及和性能提升。
核心创新
本研究创新在于引入层级知识系统,将AI开发知识分为高层策略指令和底层技术文档,结合动态检索机制,保证知识的相关性和时效性。多代理架构(设计、编码、调优)结合知识检索,实现端到端自动建模。系统利用Web数据构建知识库,结合LLM分析运行经验,自动提炼策略,持续更新知识体系,突破静态知识的局限。此机制显著提升了模型性能和系统适应性。
方法详解
- �� 采集Web数据:技术博客、开源库、文档,清洗结构化。
- �� 构建知识体系:分为30个主题类别(如视觉、NLP、时间序列),每类配备高层策略指令和底层技术文档。
- �� 动态检索:在模型设计、编码、调优时,根据任务描述和状态,条件性加载相关知识。
- �� 多代理架构:包括准备环境的setup agent、管理模型的manager、设计、编码、调优的子代理,以及最终模型的聚合(ensemble)agent。
- �� 经验提炼:每次任务完成后,分析运行轨迹,自动生成经验总结,更新知识库。
- �� 持续演化:结合新任务和新文献,自动扩充和优化知识体系。
实验设计
在MLE-Bench、心脏病预测和药物ADMET三个场景中验证。MLE-Bench涵盖75个真实Kaggle任务,评估模型设计、训练和优化能力。心脏病预测使用公开数据,AUC达0.95529,排名前6.6%。ADMET任务涉及化学结构预测,平均绝对相对误差0.63,排名前40%。对比静态知识库和搜索基础方法,AIBuildAI-2表现出明显优势。实验还包括消融研究,验证知识系统的关键作用。
结果分析
系统在多个任务中均优于基线,MLE-Bench奖牌率70.7%,在复杂任务中表现稳定。心脏病预测中,模型融合策略实现了高精度,AUC达0.95529。药物ADMET预测中,误差显著低于传统方法,验证了知识系统的有效性。持续学习机制提升了系统的适应性和性能,展现出强泛化能力。
应用场景
可广泛应用于科研、药物开发、工业自动化等领域,帮助非AI专家快速构建高性能模型。系统适合处理多模态、多任务场景,降低技术门槛,提升效率。未来还可结合强化学习和多模态知识,推动自动化AI在更复杂环境中的应用。
局限与展望
当前系统对Web数据质量敏感,噪声影响知识准确性。复杂新颖任务中知识覆盖有限,需扩展知识库。计算成本较高,模型训练和知识更新耗时长。未来需优化效率和知识覆盖,增强系统鲁棒性。
通俗解读 非专业人士也能看懂
想象你是一位厨师,面对各种食材和菜谱。传统做菜需要你手工挑选食材、调配调料、反复试验。AIBuildAI-2就像一个聪明的厨房助手,它有一本详细的菜谱书(知识系统),还能根据你手头的食材(任务描述)快速找到合适的做法。每次你做完一道菜,助手会记住经验,更新菜谱,让下一次做得更好。它还能根据不同菜系(任务类别)调整策略,不断学习新菜式。这样,厨师不用专业技能,也能做出美味佳肴,厨房变得高效又智能。
简单解释 像给14岁少年讲一样
想象你在学校里参加一个烹饪比赛,但你没有学过任何菜谱。AIBuildAI-2就像一个超级聪明的朋友,他有一本超级详细的菜谱书,里面写满了各种菜的做法。每次你告诉他你想做什么,他就会翻开书,帮你挑选合适的食材和调料,还会告诉你用什么方法做。做完后,他会记住这次的经验,下次就能帮你做得更好。这个朋友还会不断学习新菜谱,把最新的烹饪技巧加入到书里。这样,你不用担心不会做菜,也能做出美味的饭菜,变成厨房里的大厨!
原文摘要
AI models underpin data-centric applications from image and text processing to scientific discovery in biology, physics, and chemistry. Yet developing them remains heavily manual, requiring practitioners to design architectures, build training pipelines, and iteratively refine solutions, making it challenging for natural scientists without specialized AI engineering expertise to build the high-performing models their research demands. To reduce this burden and broaden access to AI for scientific discovery, agents that automatically build AI models have been proposed. However, the performance of these agents is largely limited by the parametric knowledge of their underlying large language models, which is static, often outdated, and sparse on practical AI model engineering know-how. To address this limitation, we introduce AIBuildAI-2, a knowledge-enhanced agent with an external, evolving knowledge system for automatically building AI models. The knowledge system of AIBuildAI-2 is hierarchical, organizing curated AI development knowledge into high-level knowledge instructions over topical categories and low-level knowledge documents under each category, from which the agent dynamically loads only the context relevant to its current state and the AI task being solved, grounding each design and implementation decision in concrete, externally verifiable expertise. The system is initialized by collecting and cleaning AI-development-related documents from the web and organizing them into the corresponding categories, and continually evolves from the agent's own experience by distilling each completed run on an AI task into structured takeaways that are written back into the knowledge system. AIBuildAI-2 achieves state-of-the-art results, ranking first on MLE-Bench with a 70.7% medal rate and placing in the top 6.6% among 4,370 human-expert teams in a heart disease prediction competition.