RE-Searcher: Robust Agentic Search with Goal-oriented Planning and Self-reflection
提出RE-Searcher,结合目标导向规划与自我反思,显著提升搜索鲁棒性与准确率。
Daocheng Fu, Jianbiao Mei, Licheng Wen 等
提出RE-Searcher,结合目标导向规划与自我反思,显著提升搜索鲁棒性与准确率。
Daocheng Fu, Jianbiao Mei, Licheng Wen 等
引入QFrBLiMP,基于人类标注的魁北克法语最小对比语法测试集,评估大模型的语法理解能力。
David Beauchemin, Pier-Luc Veilleux, Johanna-Pascale Roy 等
提出GCM模型,利用多模型历史预测提升校准性和泛化能力,超越自我预测。
Hanqi Xiao, Vaidehi Patil, Hyunji Lee 等
InfLLM-V2提出密稀切换注意力机制,优化长短序列处理效率,性能接近98%以上。
Weilin Zhao, Zihan Zhou, Zhou Su 等
Samiksha方法通过社区反馈在印度医疗领域评估LLM,提升多语言模型表现。
Hamna Hamna, Gayatri Bhat, Sourabrata Mukherjee 等
引入EvolveCast框架评估大模型在新信息下的预测更新能力,发现模型普遍保守且不够合理。
Zhangdie Yuan, Zifeng Ding, Andreas Vlachos
DocPruner通过自适应修剪patch级嵌入,降低多向量视觉文档检索存储成本50-60%。
Yibo Yan, Guangwei Xu, Xin Zou 等
双分布框架评估SFT/DPO法:未来泛化困难,DPO刷新最高提升7.6个百分点。
Janvijay Singh, Austin Xu, Yilun Zhou 等
提出几何框架利用信念集(credal sets)衡量大模型创意变异的校准差距,分析500个写作提示,模型校准最高仅达0.434。
Esteban Garces Arias, Julian Rodemann, Christian Heumann
采用n-gram新颖度评估文本创造力,发现其与专家评判存在偏差,强调多维度评价的重要性。
Arkadiy Saakyan, Najoung Kim, Smaranda Muresan 等
提出AMBS方法,在LLaMA-2-7B上提高HHH表现至56.5%,同时保持效率。
Gautam Siddharth Kashyap, Mark Dras, Usman Naseem
提出Representation Gradient Tracing(RepT)框架,精确追溯LLM不良行为的根源,提升样本和词级归因性能。
Zhe Li, Wei Zhao, Yige Li 等
研究发现语言模型中的句法-领域虚假相关性,影响性能。
Chantal Shaib, Vinith M. Suriyakumar, Levent Sagun 等
EmbeddingGemma为轻量级文本嵌入模型,参数300M,超越同类模型性能,适合低延迟场景。
Henrique Schechter Vera, Sahil Dua, Biao Zhang 等
Qwen3-Omni采用Thinker-Talker MoE架构,实现多模态(文本、图像、音频、视频)零性能损失的SOTA表现。
Jin Xu, Zhifang Guo, Hangrui Hu 等
DIWALI构建了涵盖印度17个文化面向的8,817个文化概念数据集,用于评估大语言模型的文化适应能力,采用自动与人工评估相结合的方法。
Pramit Sahoo, Maharaj Brahma, Maunendra Sankar Desarkar
提出SEGALE,扩展长文档机器翻译评估,处理任意长度文本,显著优于现有方案。
Kuang-Da Wang, Shuoyang Ding, Chao-Han Huck Yang 等
LiteLong通过结构化主题组织和多智能体辩论,资源高效生成长文本训练数据。
Junlong Jia, Xing Wu, Chaochen Gao 等
TextMineX通过本体引导的LLM管道提高人道主义排雷领域文本知识提取准确性44.2%。
Chenyue Zhou, Gürkan Solmaz, Flavio Cirillo 等
ShinkaEvolve利用父代采样、新颖性拒绝采样和多臂Bandit策略,实现样本高效的开源程序进化,解决传统方法样本低效问题。
Robert Tjarko Lange, Yuki Imajuku, Edoardo Cetin