InfiniteScienceGym: An Unbounded, Procedurally-Generated Benchmark for Scientific Analysis
提出InfiniteScienceGym,基于种子生成可验证的科学问答基准,评估模型推理能力。
Oliver Bentham, Vivek Srikumar
提出InfiniteScienceGym,基于种子生成可验证的科学问答基准,评估模型推理能力。
Oliver Bentham, Vivek Srikumar
提出SD-Zero,通过自我修正将二元奖励转化为密集的逐词监督,提升数学和编码推理性能。
Yinghui He, Simran Kaur, Adithya Bhaskar 等
提出TCER(微不足道偏差校正内源奖励),通过相对信息增益缓解开放式文本生成中的偏差问题。
Xinda Wang, Zhengxu Hou, Yangshijie Zhang 等
METRO利用大型语言模型从专家对话中自动提取策略,性能提升9%-10%。
Haofu Yang, Jiaji Liu, Chen Huang 等
系统评估10个多语教师模型,提出Polyglot Score指标,发现模型规模非关键,数据质量更重要。
Lester James V. Miranda, Ivan Vulić, Anna Korhonen
CARE框架通过社区反应语气评估LLM与在线社区语言行为的对齐度。
Nuan Wen, Xuezhe Ma
BLUEmed结合多智能体辩论与混合检索增强,提升临床术语替换错误检测准确率至69.13%。
Saukun Thika You, Nguyen Anh Khoa Tran, Wesley K. Marizane 等
提出GIANTS模型,通过强化学习优化文献中的科学洞察预测,模型在17k样本上实现34%提升。
Joy He-Yueya, Anikait Singh, Ge Gao 等
RecaLLM通过显式上下文检索解决“思维迷失”问题,在RULER和HELMET基准上表现优异。
Kyle Whitecross, Negin Rahimi
MedConceal利用交互式患者模拟器评估医疗对话中的隐性关切推理,包含300个案例和600次互动。
Yikun Han, Joey Chan, Jingyuan Chen 等
通过分解长上下文推理为基本技能,提升LLMs的推理能力,平均提高7.7%。
Yanling Xiao, Huaibing Xie, Guoliang Zhao 等
提出以轨迹来源区分的LLM后训练框架,结合支持扩展与策略重塑,系统性分析多阶段方法。
Shiwan Zhao, Zhihu Wang, Xuyang Zhao 等
本研究分析多语嵌入模型在预测学习者CEFR水平中的表现,发现跨语料迁移能力不足。
Laurits Lyngbaek, Ross Deans Kristensen-McLachlan
BOSCH采用黑箱二值优化,针对LLMs短上下文注意力头选择,显著优于静态方法。
Abbas Ghaddar, Ivan Kobyzev, Boxing Chen 等
AutoSOTA通过多代理架构实现AI模型自动化优化,平均每篇论文5小时发现105个新SOTA模型。
Yu Li, Chenyang Shao, Xinyang Liu 等
提出RTT框架,将响应级评分与Token级奖励结合,利用Token相关判别器实现细粒度奖励,显著提升指令跟随性能。
Tianze Xu, Yanzhao Zheng, Pengrui Lu 等
通过限制简单词汇(如“非常”、“只是”)改善LLM推理效果,优于深层语法约束(如E-Prime),验证了输出正则化机制。
Rodney Jehu-Appiah
通过角色扮演LLM训练,LLMimic显著提升AI素养,降低AI劝说成功率,改善社会责任感。
Qihui Fan, Min Ge, Chenyan Jia 等
采用社会媒体模拟,分析LLMs对残障群体的偏见,发现过度理想化与偏见强化。
Marco Bombieri, Simone Paolo Ponzetto, Marco Rospocher
提出统一框架分析多种记忆方法,设计新模型在长对话任务中超越SOTA。
Yanchen Wu, Tenghui Lin, Yingli Zhou 等