VeriBound: PAC-Bayesian Generalization Bounds for Process Reward Models Trained with Formal Verification Tools
VeriBound用PAC-Bayes理论解释FOVER跨任务泛化,验证准确率达78.6%。
Amirul Rahman, Mohammed Sabih Alsharari
VeriBound用PAC-Bayes理论解释FOVER跨任务泛化,验证准确率达78.6%。
Amirul Rahman, Mohammed Sabih Alsharari
提出基于图灵奖励的强化学习方法Turing-RL,用于训练人类用户模拟器,显著优于传统匹配方法。
Yingshan Susan Wang, Cedegao E. Zhang, Linlu Qiu 等
通过范畴结构从论文知识图谱中挖掘可证伪的研究想法,过滤比率约17:1。
Yuchen Wang, Zhongzhi Luan
Dango为1.8B参数L1专用模型,采用过滤减少L2污染,用于研究日英二语习得转移。
Shiho Matta, Yin Jou Huang, Fei Cheng 等
通过数据配方和GRPO设置提升长上下文推理能力,平均提升7.2分。
Xiaoyue Xu, Sikui Zhang, Xiaorong Wang 等
RubricsTree构建了基于专家对100+临床验证布尔评分的层级分类体系,用于大规模、可演化的个人健康AI评估,显著优于行业基线。
Weizhi Zhang, Zechen Li, Hamid Palangi 等
OPD-Evolver以慢快循环和在策略蒸馏培养四种进化能力,9B模型在多项任务上超过超大模型。
Guibin Zhang, Xun Xu, Yanwei Yue 等
提出OneModel,将复杂业务逻辑内化为单一模型参数,显著提升金融系统效率。
Chang Liu, Chaoyang Ning, Dayi Jiang 等
本研究基于MetaSyn数据集,评估12种LLM管道在自然出版物元分析中的表现,揭示筛选瓶颈,最大召回率90.9%,实际检索覆盖不足52.7%。
Anzhe Xie, Weihang Su, Yujia Zhou 等
提出音频适应的上下文感知解码方法,提升语音对话系统的上下文遵循性。
Che Hyun Lee, Heeseung Kim, Sungroh Yoon
SAG采用SQL驱动的动态超边结构,提升多跳推理和结构化检索性能,达成MuSiQue 80% Recall@5。
Yuchao Wu, Junqin Li, XingCheng Liang 等
提出Ling-2.6和Ring-2.6,采用混合线性注意力和迁移预训练,提升长上下文效率与推理能力。
Ang Li, Ben Liu, Bin Han 等
本研究评估了在固定推理预算下,技能和记忆模块是否总值得投入代币,结果显示普通Actor在多数场景下表现优越。
Sina Hajimiri, Masih Aminbeidokhti, Jose Dolz 等
AC-GPT通过简单改造实现任意条件评估,保持左到右预测性能。
Yinhan Lu, Eric Elmoznino, Léo Gagnon 等
提出一种衡量AI生成故事中文化本地化的模板识别方法,发现仅9-17%的词汇决定文化差异。
Shaily Bhatt, Supriti Vijay, Jeremiah Milbauer 等
提出运算子框架Q,用于描述问答中的问题分解,结合操作一致性提升多步推理可靠性。
Nathaniel Bottman, Kyle Richardson
NTS-CoT通过链式思维减少新闻时间线总结中的幻觉,提升23.4%AR-1。
Feng Lyu, Huiqin Yan, Sijing Duan 等
SKIM框架压缩大语言模型中的程序性知识,保持任务性能,压缩率达30%-60%。
Changyue Wang, Weihang Su, Qingyao Ai 等
本研究评估Instruction-Tuned大模型中解码时真值性方法(层对比、干预、logit适配器)效果,发现严格控制下效果有限。
Ao Sun
H-SAL通过自我描述文本进行隐性去偏,优于显性标签去偏。
Shun Shao, Zheng Zhao, Anna Korhonen 等