UQ: Assessing Language Models on Unsolved Questions
提出UQ评估模型在未解决问题上的能力,涵盖500个多样化高难度题目,结合社区验证实现持续评估。
Fan Nie, Ken Ziyu Liu, Zihao Wang 等
提出UQ评估模型在未解决问题上的能力,涵盖500个多样化高难度题目,结合社区验证实现持续评估。
Fan Nie, Ken Ziyu Liu, Zihao Wang 等
CORE-RAG通过性能驱动的上下文压缩,在压缩比例仅3%的情况下,提升EM得分3.3点,超越全文使用。
Ziqiang Cui, Yunpeng Weng, Xing Tang 等
提出基于实体导向搜索的表理解方法,显著提升在WikiTableQuestions和TabFact上的性能。
Thi-Nhung Nguyen, Hoang Ngo, Dinh Phung 等
提出PING方法,通过前缀注入提升LLM在代理任务中的安全性,保持性能。
Dongyoon Hahm, Taywon Min, Woogyeol Jin 等
FineCE是一种基于监督学习的细粒度置信度估计方法,显著提升生成过程中的置信预测准确率。
Jinyi Han, Tingyun Li, Shisong Chen 等
采用Mistral 7B和mT5模型,创新性地提升捷克语现代与历史文本摘要性能,建立新基准。
Václav Tran, Jakub Šmíd, Jiří Martínek 等
IROTE通过自我反思优化,稳定引导大模型具有人类特质,超越表面模仿。
Yuzhuo Bai, Shitong Duan, Muhua Huang 等
研究表明,Unigram在复杂形态语言中优于BPE,尤其在泰卢固语中。
Saketh Reddy Vemula, Sandipan Dandapat, Dipti Misra Sharma 等
GLM-4.5采用MoE架构,355B参数,融合思维与响应模式,显著提升ARC任务性能。
GLM-4. 5 Team, :, Aohan Zeng 等
AURA利用过程奖励模型实现多层次逻辑与安全评估,提升LLM安全性。
Sayantan Adak, Pratyush Chatterjee, Somnath Banerjee 等
提出UrBLiMP基准,评估乌尔都语大模型的语法能力,涵盖10个核心句法现象,模型准确率最高94.73%。
Farah Adeeba, Brian Dillon, Hassan Sajjad 等
提出MAO-ARAG多智能体自适应RAG框架,结合强化学习优化流程,提升问答性能。
Yiqun Chen, Erhan Zhang, Lingyong Yan 等
提出多层注意力放大演示效果的机制,验证梯度流随层数增长而增强,创新性地利用梯度流进行演示选择,提升LLM性能。
Dingzirui Wang, Xuangliang Zhang, Keyan Xu 等
本研究构建孟加拉语多语言评测基准,分析10个开源大模型性能差异,发现模型大小与Token化效率影响表现。
Shimanto Bhowmik, Tawsif Tashwar Dipto, Md Sazzad Islam 等
ControlMed通过控制推理长度提高医疗语言模型效率,实验显示性能优于现有模型。
Sung-Min Lee, Siyoon Lee, Juyeon Kim 等
提出越南法律问答数据集VLQA,结合深度检索与生成模型,验证其在法律信息检索与问答中的有效性。
Tan-Minh Nguyen, Hoang-Trung Nguyen, Trong-Khoi Dao 等
MCIF基准评估多模态跨语指令跟随,涵盖4任务、3模态、4语言,揭示模型普遍挑战。
Sara Papi, Maike Züfle, Marco Gaido 等
GEPA通过反思性提示演化,平均提升6%,用少35倍样本超越GRPO。
Lakshya A Agrawal, Shangyin Tan, Dilara Soylu 等
提出Prune&Comp,通过迭代剪枝与幅值补偿,零训练成本显著提升层剪模型性能。
Xinrui Chen, Hongxing Zhang, Fanyi Zeng 等
提出层级式记忆架构H-MEM,提升LLM代理长远推理效率,显著优于五个基线方法。
Haoran Sun, Shaoning Zeng