MobileIPL: Enhancing Mobile Agents Thinking Process via Iterative Preference Learning
提出Iterative Preference Learning(IPL)优化移动代理思考流程,显著提升GUI任务表现。
Kun Huang, Weikai Xu, Yuxuan Liu 等
提出Iterative Preference Learning(IPL)优化移动代理思考流程,显著提升GUI任务表现。
Kun Huang, Weikai Xu, Yuxuan Liu 等
CoLM以链式表示实现渐进扩展与弹性推理,CoLM-Air在1M上下文预填充中最高加速3倍。
Kaitao Song, Xiaohua Wang, Xu Tan 等
提出MedCaseReasoning数据集,结合临床报告评估LLMs诊断推理,显著提升模型性能。
Kevin Wu, Eric Wu, Rahul Thapa 等
提出Critique-Guided Distillation(CGD),通过利用教师批评实现模型推理能力提升,平均提升7%。
Berkcan Kapusuzoglu, Supriyo Chakraborty, Zain Sarwar 等
Time-R1通过三阶段RL微调,赋予3B参数模型理解、预测和创造性时间推理能力,超越200倍参数模型。
Zijia Liu, Peixuan Han, Haofei Yu 等
HAPO通过历史状态优化训练LLMs,显著提升回答简洁性,响应长度降低33-59%,准确率仅降2-5%。
Chengyu Huang, Zhengxin Zhang, Claire Cardie
MetaSPO通过元学习优化系统提示,在14个数据集上提升性能。
Yumin Choi, Jinheon Baek, Sung Ju Hwang
Qwen3结合思考与非思考模式,参数规模达235B,提升多语言、多任务性能。
An Yang, Anfeng Li, Baosong Yang 等
提出InForage,基于信息觅食理论的强化学习框架,优化动态检索与推理,提升复杂任务表现。
Hongjin Qian, Zheng Liu
本研究提出ChemRAG-Bench和ChemRAG-Toolkit,利用多源知识提升化学任务中的检索增强生成性能,平均提升17.4%。
Xianrui Zhong, Bowen Jin, Siru Ouyang 等
MiMo-7B通过三阶段数据混合和多Token预测提升推理能力,预训练25万亿Token,后训练130K验证问题,显著优于更大模型。
LLM-Core Xiaomi, :, Bingquan Xia 等
DynamicRAG通过强化学习动态调整文档排序与数量,提升知识问答性能。
Jiashuo Sun, Xianrui Zhong, Sizhe Zhou 等
提出衡量干扰效应的指标,通过生成和检索硬干扰句改善RAG性能,提升答案准确率7.5%。
Chen Amiraz, Florin Cuconasu, Simone Filice 等
提出clem:todd框架,通过多模型、多任务评测LLM任务导向对话系统,涵盖多架构和数据集,提供系统性性能分析。
Chalamalasetti Kranti, Sherzod Hakimov, David Schlangen
评估九个大语言模型在孟加拉语健康问答摘要中的零-shot性能,Mixtral表现优异。
Ajwad Abrar, Farzana Tabassum, Sabbir Ahmed
ZeroSearch通过模拟搜索提升LLM的搜索能力,14B模型超越真实搜索引擎。
Hao Sun, Zile Qiao, Jiayan Guo 等
通过奖励信号指导LLM行为,采用RLHF、RLAIF等技术,实现动态反馈学习。
Xiaobao Wu
RM-R1将奖励建模作为推理任务,通过链式推理和Rubrics机制提升性能,超越更大模型。
Xiusi Chen, Gaotang Li, Ziqi Wang 等
本研究分析LLMs在长文机器翻译评估中的长度偏差,提出FSP和微调策略改善其一致性。
Tobias Domhan, Dawei Zhu
提出DeepCritic两阶段框架,利用Qwen2.5-72B-Instruct增强数学推理批判能力,显著优于现有模型。
Wenkai Yang, Jingwen Chen, Yankai Lin 等