The Landscape of Emerging AI Agent Architectures for Reasoning, Planning, and Tool Calling: A Survey
本研究调查AI代理架构在推理、规划和工具调用中的新兴趋势,揭示其能力和局限。
Tula Masterman, Sandi Besen, Mason Sawtell 等
本研究调查AI代理架构在推理、规划和工具调用中的新兴趋势,揭示其能力和局限。
Tula Masterman, Sandi Besen, Mason Sawtell 等
提出Language Ranker,基于内部表示量化LLM在不同语言中的性能差异。
Zihao Li, Yucheng Shi, Zirui Liu 等
本研究分析会议摘要自动评估指标的表现,发现其对会议特有错误反应不足。
Frederic Kirstein, Jan Philip Wahle, Terry Ruas 等
提出LAPTOP-Diff,通过层剪枝和归一化蒸馏高效压缩扩散模型,保持性能下降最低4%。
Dingkun Zhang, Sijia Li, Chen Chen 等
提出语义感知注意引导(SAG)框架,结合组织和病理信息提升全切片图像诊断准确率。
Kechun Liu, Wenjun Wu, Joann G. Elmore 等
提出FAC框架结合环境上下文独立性,利用JACI算法实现复杂环境中的实际因果关系自动发现。
Caleb Chuck, Sankaran Vaidyanathan, Stephen Giguere 等
MiniCheck通过合成数据训练,达到GPT-4水平的事实核查,成本降低400倍。
Liyan Tang, Philippe Laban, Greg Durrett
通过自我对抗语言游戏SPAG,提升了大语言模型的推理能力,表现提升达5%。
Pengyu Cheng, Tianhao Hu, Han Xu 等
本研究评估VLM在未显露人类的隐私属性推断中的能力,最高达77.6%准确率。
Batuhan Tömekçe, Mark Vero, Robin Staab 等
MK-SGN结合多模态融合和知识蒸馏,实现骨架动作识别,能耗降低98%。
Naichuan Zheng, Hailun Xia, Zeyu Liang 等
提出多消息协议实现最优误差,消息复杂度为O(min(nε², d)),并证明单消息和鲁棒性极限。
Hilal Asi, Vitaly Feldman, Jelani Nelson 等
提出MMInA基准,评估多跳多模态互联网代理的长程推理能力,数据涵盖1050个真实网站任务。
Shulin Tian, Ziniu Zhang, Liangyu Chen 等
Ctrl-Adapter框架高效适配扩展ControlNet,提升COCO和DAVIS 2017性能。
Han Lin, Jaemin Cho, Abhay Zala 等
本研究发现大型语言模型(如GPT-4)具有自我识别能力,且自我识别与偏向自身生成内容呈线性相关。
Arjun Panickssery, Samuel R. Bowman, Shi Feng
提出考虑连接关系的多表检索方法,F1提升9.3%。
Peter Baile Chen, Yi Zhang, Dan Roth
使用MLIR框架实现高性能AI编译器,性能达到手写代码的90%。
Renato Golin, Lorenzo Chelini, Adam Siemieniuk 等
SparseOcc利用稀疏潜在表示实现语义占用预测,FLOPs降低74.9%,mIoU提升1.3%。
Pin Tang, Zhongdao Wang, Guoqing Wang 等
提出Wasserstein Wormhole,基于Transformer的自动编码器,将经验分布嵌入潜在空间,实现OT距离的线性近似,显著提升大规模分布比较效率。
Doron Haviv, Russell Zhang Kunes, Thomas Dougherty 等
本文提出ATACOM方法,通过约束流形上的安全动作空间实现安全强化学习,成功应用于机器人空气曲棍球任务。
Puze Liu, Haitham Bou-Ammar, Jan Peters 等
本研究通过任务探针分析大规模视觉基础模型的3D感知能力,发现其在深度、法线和多视图一致性方面存在显著局限。
Mohamed El Banani, Amit Raj, Kevis-Kokitsi Maninis 等