Toward Generalist Autonomous Research via Hypothesis-Tree Refinement
提出Arbor框架,通过假设树细化实现自主研究,显著提升多任务性能。
Jiajie Jin, Yuyang Hu, Kai Qiu 等
提出Arbor框架,通过假设树细化实现自主研究,显著提升多任务性能。
Jiajie Jin, Yuyang Hu, Kai Qiu 等
VISTA引入融合UI与API的混合用户模拟器,采用六项指标评估交互真实性与能力覆盖,显著优于现有方法。
Yunan Lu, Ryan Shea, Yusen Zhang 等
KATE框架通过整合经验知识和扩展推理宽度,提升LLM工具调用性能,在BFCL-V3上提升15%。
Yupu Hao, Zhuoran Jin, Huanxuan Liao 等
提出基于预测门控的银行级稀疏训练方法,将Dense模型转化为4倍稀疏的LLM,提升长文本处理效率。
Ruixuan Huang, Jinyuan Shi, Hantao Huang 等
REAL采用时间与置信度感知的图结构,有效管理LLMs的长时记忆,提升22.72%。
Keer Lu, Liwei Chen, Guoqing Jiang 等
UniSVQ结合标量与向量量化,通过线性变换实现2-bit压缩,性能优于SOTA标量方法。
Haoyu Wang, Haiyan Zhao, Xingyu Yu 等
通过对比Llama 3.1 8B模型前后RLHF的内部表示,揭示RLHF只实现浅层对齐,未去除偏见结构,反而压缩偏见信号变异。
Wendy K. Tam
提出AdvGRPO框架,结合密集多通道奖励和解耦优势归一,实现语言模型的攻防联合优化,提升攻击成功率和防御鲁棒性。
Blake Bullwinkel, Eugenia Kim, Amanda Minnich 等
提出SG-OPD,通过信号门控和阶段性采样提升对强教师的信任,显著改善数学推理性能。
Haoran Xu, Hongyu Wang, Yifei Gao 等
RadOT-Eval利用结构证据的最优传输实现放射学报告的可审计评估,相关相关性达0.715。
Weixin Liu, Juming Xiong, Yang Li 等
SAPO框架通过验证技能的边际效用来优化策略,提升了技能质量和性能。
Zhiwei Zhang, Yudi Lin, Nikki Lijing Kuang 等
提出基于分布差异的评价指标,解决生成困惑度(gen-PPL)无法区分低质量文本的问题。
Antonio Franca, Alexander Tong
TrustMargin是一种无需训练的候选答案可信度判定方法,结合参数优先边界与证据绑定边界提升模型表现。
Jingyan Xu, Hong Shi, Yi Shan 等
CATPO通过树信息评分与批判修复,提升数学推理任务中的准确率,达37.5%。
Ayush Singh, Umang Goyal, Ankur Dahiya
PoE-Bridge通过引入中间分布实现扩散语言模型的并行解码,提升5倍速度并恢复95%性能。
Juntong Shi, Brian L. Trippe, Jure Leskovec 等
提出Agentopia框架,模拟10年长周期多智能体社会,利用生命奖励训练LLMs,提升社会行为和人类认知模拟能力。
Xintao Wang, Sirui Zheng, Hongqiu Wu 等
提出EmbedFilter,通过过滤未嵌入矩阵中的潜在子空间,提升LLMs文本嵌入性能,降低存储和加速检索。
Songhao Wu, Zhongxin Chen, Yuxuan Liu 等
本文提出基于LLM引导的MAP-Elites演化方法,用于优化医疗决策流程,包括急诊分诊、互动咨询和医学影像分类,显著提升性能。
Ivan Sviridov, Artem Oskin, Ivan Panin 等
FinEvolveBench以31个A股行业、177324篇新闻检验延迟反馈下的智能体自进化,通用记忆未稳定提升IC。
Zihao Deng, Yining Zhu, Leiming Wang 等
提出CRAFT框架,通过双向反事实推理显著提升表格问答与事实验证性能。
Chenshuo Pan, Yu Zhao, Jie Zhang 等