OmniScientist: An Omni-Modal Omni-Discipline AI Scientist
OmniScientist采用多模态感知与多智能体架构,实现跨学科从原始证据到论文的全流程自动化科研,平均论文得分6.3。
Bobo Li, Hao Fei, Tianjie Ju 等
OmniScientist采用多模态感知与多智能体架构,实现跨学科从原始证据到论文的全流程自动化科研,平均论文得分6.3。
Bobo Li, Hao Fei, Tianjie Ju 等
提出了一种评估长时间AI研究的框架,分析36项任务中7个模型的表现。
Yiwei Li, Wanli Yang, Hexiang Tan 等
提出Uniform Herding,通过代表刷新实现类增量学习中的 exemplar 重放,提升准确率至44.00%。
Krishna Subedi
SkillMisevo-Gym揭示LLM代理中的技能误进化,SafeEvolve减少不安全检索26.7个百分点。
Xutao Mao, Liangjie Zhao, Xiang Zheng 等
本研究提出基于检索增强生成和大模型的自动构建动态主逻辑模型(DML)知识图谱(KG-DML),实现复杂系统诊断。
Saman Marandi, Yu-Shu Hu, Mohammad Modarres
本研究提出预算依赖的LLM评估框架,分析7个预算水平(64-4096 tokens)对4个模型在3个推理基准上的影响,发现模型排名随预算变化而逆转,强调预算条件下的评估必要性。
Rodrigo Guedes de Souza, Alison R. Panisson
MindMemOS提供便携且自我进化的记忆层,LOCOMO准确率达94.03%。
Kaichao Liang, Yuqi Cui, Hao Kong 等
XBRIDGE通过实体锚定映射和潜在丰富桥实现异构大模型高效通信,显著降低延迟。
Wooseong Yang, Wei-Chieh Huang, Weizhi Zhang 等
提出Social Chain of Thought (SCoT),通过多轮多专家交互提升复杂医疗鉴别诊断的召回率。
Del Coburn, Scott Sanner, Dan Silver
利用AI系统优化Grothendieck常数上下界,首次实现从1.6769到1.7135的突破。
Alan Li, Rahul Saha, Anton Xue 等
SkillLens利用视觉技能卡实现GUI动作预测,提升11.6点Step SR。
Zhou Liu, Ligang Huang, Zeli Su 等
提出基于混合态原型的量子增量学习框架,有效应对参数和存储限制。
Yu Wu, Qianli Zhou, Xinyang Deng 等
引入DSAgentBench,评估AI代理在真实计算环境中自动化端到端数据科学流程的能力,成功率仅56.7%。
Mizanur Rahman, Mohammed Saidul Islam, Ridwan Mahbub 等
MESA按查询选择并融合记忆结构,在AMA-Bench达65.1%,少用41%证据词。
Beidi Zhao, Yaoqi Chen, Yuru Feng 等
提出TIDE方法,通过偏离匹配修正学生-教师错配,显著提升大模型蒸馏效果,Avg@8从6.9%提升至20.3%。
Zichao Yu, Chengzhi Yu, Shengze Xu 等
提出BCSD框架,通过双向自蒸馏提升LLM外部技能利用率,实验在ALFWorld和WebShop中表现优异。
Tianjun Pan, Yuan Li, Hongda Wang 等
提出Coderlet,基于请求生命周期设计的紧凑控制层,实现模型、环境和状态的分离与连续。
Mengfan Li
提出CoRE,通过图结构和复制者动力学改善测试时强化学习的奖励,平均提升21.7分。
Ambuj Mehrish, Sebastiano Vascon
提出线性化的2-单纯形注意力,通过随机特征逼近实现线性复杂度,结合Kimi Delta Attention优化性能。
Aritra Das, Dhruman Gupta, Debayan Gupta
本研究分析了偏优似然在自我蒸馏中的价值,提出三项验证指标以确保其作为有效的中间Token信用。
Xuan-Phi Nguyen, Shrey Pandit, Yiran Zhao 等