AI Hospital: Benchmarking Large Language Models in a Multi-agent Medical Interaction Simulator
提出AI Hospital多智能体框架,评估大模型在模拟临床诊断中的表现,诊断准确率低于一阶GPT-4。
Zhihao Fan, Jialong Tang, Wei Chen 等
提出AI Hospital多智能体框架,评估大模型在模拟临床诊断中的表现,诊断准确率低于一阶GPT-4。
Zhihao Fan, Jialong Tang, Wei Chen 等
DoRA通过权重分解提升LoRA的学习能力,在多个任务上超越LoRA。
Shih-Yang Liu, Chien-Yi Wang, Hongxu Yin 等
SLGM模型通过损失校准和格式化解码提升结构预测,显著提高<1B参数模型性能。
Minho Lee, Junghyun Min, Yerang Kim 等
InternLM-Math结合链式推理、奖励模型和形式证明,达成SOTA性能。
Huaiyuan Ying, Shuo Zhang, Linyang Li 等
提出WebLINX,基于多轮对话的真实网站导航,利用检索模型优化HTML元素选择。
Xing Han Lù, Zdeněk Kasner, Siva Reddy
本报告介绍多语种E5文本嵌入模型,基于对10亿多语料对的对比预训练,结合高质量标注数据微调,性能在多项基准中领先。
Liang Wang, Nan Yang, Xiaolong Huang 等
DeepSeekMath 7B通过120B数学相关tokens和GRPO算法,显著提升开源模型数学推理能力,接近GPT-4表现。
Zhihong Shao, Peiyi Wang, Qihao Zhu 等
研究表明,通过提示工程和指令微调,大语言模型在表格事实验证任务中表现出潜力。
Hanwen Zhang, Qingyi Si, Peng Fu 等
PiCO通过一致性优化实现LLM间的无监督互评,显著提高排名与人类偏好的一致性。
Kun-Peng Ning, Shuo Yang, Yu-Yang Liu 等
利用Dutch图像描述与眼动数据,分析人类视觉-语言信号变异,评估预训练模型捕获能力。
Ece Takmaz, Sandro Pezzelle, Raquel Fernández
LitLLM工具通过检索增强生成方法,显著减少文献综述时间。
Shubham Agarwal, Gaurav Sahu, Abhay Puri 等
提出基于可执行Python代码的LLM代理框架CodeAct,通过集成Python解释器显著提升多任务复杂场景下的成功率(最高提升20%),并构建开源模型实现自主调试与协作。
Xingyao Wang, Yangyi Chen, Lifan Yuan 等
提出Superfiltering,用小模型筛选指令数据,提升效率与性能。
Ming Li, Yong Zhang, Shwai He 等
采用链式推理和外部工具提升LLMs数学推理能力,关键数据在MathGPT上达成85%准确率。
Janice Ahn, Rishu Verma, Renze Lou 等
RAPTOR通过递归摘要树结构提升长文检索效果,在多个QA任务中实现20%以上性能提升。
Parth Sarthi, Salman Abdullah, Aditi Tuli 等
本研究评估GPT-4V在地球观测数据上的场景理解、定位、计数和变化检测能力,发现其空间推理不足。
Chenhui Zhang, Sherrie Wang
Mobile-Agent利用视觉感知实现自主多模态移动设备操作,达成91%成功率。
Junyang Wang, Haiyang Xu, Jiabo Ye 等
Routoo通过性能预测器和成本感知选择器优化多模型路由,降低推理成本达33%。
Alireza Mohammadshahi, Arshad Rafiq Shaikh, Majid Yazdani
WebVoyager通过大规模多模态模型实现59.1%的任务成功率。
Hongliang He, Wenlin Yao, Kaixin Ma 等
SEER通过强化学习提升结构化推理,EntailmentBank上提升6.9%。
Guoxin Chen, Kexin Tang, Chao Yang 等