Lean Workbook: A large-scale Lean problem set formalized from natural language math problems
Lean Workbook通过生成和过滤合成数据,将自然语言数学问题转化为Lean 4语句,提升LLM性能,数据集含57K对问题。
Huaiyuan Ying, Zijian Wu, Yihan Geng 等
Lean Workbook通过生成和过滤合成数据,将自然语言数学问题转化为Lean 4语句,提升LLM性能,数据集含57K对问题。
Huaiyuan Ying, Zijian Wu, Yihan Geng 等
ReST-MCTS*通过树搜索引导的自我训练,利用过程奖励自动推断高质量推理轨迹,提升LLM性能。
Dan Zhang, Sining Zhoubian, Ziniu Hu 等
提出OmegaPRM算法,利用自动化蒙特卡洛树搜索提升数学推理中的过程监督,显著改善大模型表现。
Liangchen Luo, Yinxiao Liu, Rosanne Liu 等
提出MediQ,结合主动提问的LLM临床推理基准,显著提升信息获取与诊断准确率。
Shuyue Stella Li, Vidhisha Balachandran, Shangbin Feng 等
提出四项错误识别与修正任务,构建1800例数据,GPT-4表现优异,提升47.9%。
Xiaoyuan Li, Wenjie Wang, Moxin Li 等
提出SWIF2T:基于多模型的科学写作焦点反馈生成系统,显著提升反馈的具体性和实用性。
Eric Chamoun, Michael Schlichktrull, Andreas Vlachos
提出一种基于后处理的DP文本重写增强方法,通过再次重写提升语义相似性和隐私保护,实验证明效果显著。
Stephen Meisenbacher, Florian Matthes
PathReasoner通过等价扩展建模推理路径,在逻辑问答中表现出色。
Fangzhi Xu, Qika Lin, Tianzhe Zhao 等
提出QUIRE算法,通过从问题中回忆额外信息提高CoT的有效性和忠实性,实验显示有效性提高2.4%,忠实性提高5.6%。
Jiachun Li, Pengfei Cao, Yubo Chen 等
提出基于严格正评分规则的语言生成方法,采用Brier和球面评分,提升模型性能。
Chenze Shao, Fandong Meng, Yijin Liu 等
大语言模型工具学习综述,分析工具学习的益处和实现方法。
Changle Qu, Sunhao Dai, Xiaochi Wei 等
KG-FIT通过LLM引导的层次结构微调知识图嵌入,提升预测准确率达14.4%。
Pengcheng Jiang, Lang Cao, Cao Xiao 等
COLT用协同学习提升工具检索完整性,BERT-mini(11M)优于BERT-large(340M)。
Changle Qu, Sunhao Dai, Xiaochi Wei 等
提出Representation Noising(RepNoise)防御机制,有效阻止有害微调,保留模型能力。
Domenic Rosati, Jan Wehner, Kai Williams 等
引入参数化世界知识模型(WKM)提升大语言模型在复杂任务中的全局与局部规划能力。
Shuofei Qiao, Runnan Fang, Ningyu Zhang 等
xFinder通过优化关键答案提取模块,提升LLM评估准确性,提取准确率达93.42%。
Qingchen Yu, Zifan Zheng, Shichao Song 等
Chameleon模型通过早期融合技术实现图像和文本的生成与理解,性能超越Llama-2。
Chameleon Team
提出CoRE系统,利用大语言模型作为自然语言程序的解释器,实现自然语言、伪代码与流程编程的统一。
Shuyuan Xu, Zelong Li, Kai Mei 等
利用Large Language Models(LLMs)自动生成模型与数据卡,提升责任AI的文档完整性。
Jiarui Liu, Wenkai Li, Zhijing Jin 等
本研究通过控制新知识比例,发现微调LLMs学习新知识缓慢,增加幻觉风险,支持预训练知识主导利用。
Zorik Gekhman, Gal Yona, Roee Aharoni 等