CMCTS: A Constrained Monte Carlo Tree Search Framework for Mathematical Reasoning in Large Language Model
CMCTS框架通过约束动作空间提升LLM数学推理能力,7B模型准确率83.4%。
Qingwen Lin, Boyan Xu, Guimin Hu 等
CMCTS框架通过约束动作空间提升LLM数学推理能力,7B模型准确率83.4%。
Qingwen Lin, Boyan Xu, Guimin Hu 等
SafeDialBench通过22个场景和7种攻击策略评估大型语言模型的安全性。
Hongye Cao, Sijia Jing, Yanming Wang 等
提出CiteCheck,基于两阶段人工标注的中文引文可信性检测数据集,结合LLM增强实现高效训练。
Ziyao Xu, Shaohang Wei, Zhuoheng Han 等
UniRoute通过特征向量实现动态路由,提升LLM推理效率,支持30+未见模型。
Wittawat Jitkrittum, Harikrishna Narasimhan, Ankit Singh Rawat 等
提出AMKOR框架,结合大模型与检索知识,优化多源多跳推理性能。
Jackson Coleman, Isaiah Lawrence, Benjamin Turner
LIMO模型通过精简数据实现复杂推理,AIME24准确率63.3%,MATH500达95.6%。
Yixin Ye, Zhen Huang, Yang Xiao 等
提出Token Assorted方法,通过混合潜在和文本Token,提升语言模型推理能力,平均推理长度减少17%,性能提升最高13.3%。
DiJia Su, Hanlin Zhu, Yingchen Xu 等
iVISPAR基于滑动拼图,评估VLM的空间推理能力,涉及3D、2D和文本输入。
Julius Mayer, Mohamad Ballout, Serwan Jassim 等
AStar以思维卡片免训练增强多模态推理,在MathVerse达53.9%。
Jinyang Wu, Mingkuan Feng, Guocheng Zhai 等
提出动态KL加权的扩散模型结合大语言模型提升文本到图像生成质量。
Julian Perry, Frank Sanders, Carter Scott
M+在MemoryLLM基础上引入长远记忆机制,实现160k以上的知识保持,显著提升长文本理解。
Yu Wang, Dmitry Krotov, Yuanzhe Hu 等
提出Reward-Guided Speculative Decoding(RSD),结合轻量模型与奖励机制提升LLM推理效率,最高节省4.4倍FLOPs。
Baohao Liao, Yuhui Xu, Hanze Dong 等
本研究系统分析了数据污染对1B和8B规模机器翻译模型的BLEU分数膨胀影响,发现污染显著高估性能。
Muhammed Yusuf Kocyigit, Eleftheria Briakou, Daniel Deutsch 等
提出LLM-AutoDiff,基于文本梯度的自动提示优化框架,支持多组件和循环结构,显著提升复杂LLM流程的准确性与效率。
Li Yin, Zhangyang Wang
Docling结合DocLayNet和TableFormer实现高效多格式文档解析,速度快且资源占用低。
Nikolaos Livathinos, Christoph Auer, Maksym Lysak 等
提出参数化检索增强生成(Parametric RAG),通过将外部知识直接注入模型参数,提升效率与效果。
Weihang Su, Yichen Tang, Qingyao Ai 等
本研究评估28个支持印地语等印地语系语言的LLMs性能,发现印度语表现差异显著。
Aatman Vaidya, Tarunima Prabhakar, Denny George 等
提出GUI-Bee利用自主探索和Q-ICRL优化环境特异数据,提升GUI动作定位在新环境中的表现。
Yue Fan, Handong Zhao, Ruiyi Zhang 等
提出基于评估头的高效提示压缩方法EHPC,显著降低长文本推理成本。
Weizhi Fei, Xueyan Niu, Guoqing Xie 等
提出基于大语言模型的平衡检索增强生成(Balanced RAG)框架,有效应对极端类别不平衡,提升虚假信息检测性能。
Nikos Kanakaris, Heng Ping, Xiongye Xiao 等