AgentBench: Evaluating LLMs as Agents
提出AgentBench基准,评估29个大模型在8类复杂环境中的推理与决策能力,揭示性能差异与改进方向。
Xiao Liu, Hao Yu, Hanchen Zhang 等
提出AgentBench基准,评估29个大模型在8类复杂环境中的推理与决策能力,揭示性能差异与改进方向。
Xiao Liu, Hao Yu, Hanchen Zhang 等
提出GTE模型,采用多阶段对比学习,参数110M,在文本和代码检索中超越多倍大模型。
Zehan Li, Xin Zhang, Yanzhao Zhang 等
FourLLIE通过傅里叶频率信息提升低光图像增强性能,在四个数据集上超越SOTA,仅用0.31%参数。
Chenxi Wang, Hongjun Wu, Zhi Jin
MM-Vet评估大型多模态模型的整合能力,提出LLM评估器,揭示模型能力差异。
Weihao Yu, Zhengyuan Yang, Linjie Li 等
利用量子算法实现随机优化中的方差减缩,提升低维问题的效率。
Aaron Sidford, Chenyi Zhang
提出MVFlow,利用压缩视频中的运动向量作为先验,显著提升光流估计速度与精度。
Shili Zhou, Xuhao Jiang, Weimin Tan 等
OpenFlamingo是一个开源框架,用于训练3B到9B参数的自回归视觉语言模型,性能达到Flamingo的80-89%。
Anas Awadalla, Irena Gao, Josh Gardner 等
提出带证书的多保真零阶优化算法MFDOO变体,界定其近最优成本复杂度。
Étienne de Montbrun, Sébastien Gerchinovitz
利用样本丰富性,通过线性可行性转化实现一比特感知的理论保证与算法优化。
Arian Eamaz, Farhang Yeganegi, Deanna Needell 等
LISA结合大语言模型实现推理分割,突破传统依赖明确指令的限制。
Xin Lai, Zhuotao Tian, Yukang Chen 等
提出两种生成式查询重写框架GenQR和GenPRF,利用预训练模型提升检索效果。
Xiao Wang, Sean MacAvaney, Craig Macdonald 等
DriveAdapter通过特征对齐实现感知与规划解耦,提升自主驾驶性能。
Xiaosong Jia, Yulu Gao, Li Chen 等
MetaGPT通过标准操作流程(SOP)和多角色协作,提升多智能体系统的代码生成准确率,达85.9%的Pass@1指标。
Sirui Hong, Mingchen Zhuge, Jiaqi Chen 等
提出一种结合LSTM的混合优化算法,提高DER控制的网络弹性,验证于IEEE 37节点。
Mohammad Panahazari, Matthew Koscak, Jianhua Zhang 等
系统分析光学计算的11个物理特性,揭示其潜在速度与能效优势。
Peter L. McMahon
本研究提出Dynalang,通过多模态世界模型预测未来文本和图像,实现多样化语言理解与行动,显著优于传统方法。
Jessy Lin, Yuqing Du, Olivia Watkins 等
研究评估指令跟随模型在问答任务中的正确性和忠实性,提出新评估指标。
Vaibhav Adlakha, Parishad BehnamGhader, Xing Han Lu 等
ToolLLM通过构建ToolBench数据集,实现对16000+真实API的高效调用,提升开源模型工具使用能力。
Yujia Qin, Shihao Liang, Yining Ye 等
SpatialNet通过交替窄带与跨带模块,利用空间信息实现多通道语音分离与增强。
Changsheng Quan, Xiaofei Li
提出PACC和PACC-PE模型,显著减轻电商搜索中的位置偏差。
Yibo Wang, Yanbing Xue, Bo Liu 等