Prune&Comp: Free Lunch for Layer-Pruned LLMs via Iterative Pruning with Magnitude Compensation
提出Prune&Comp,通过迭代剪枝与幅值补偿,零训练成本显著提升层剪模型性能。
Xinrui Chen, Hongxing Zhang, Fanyi Zeng 等
提出Prune&Comp,通过迭代剪枝与幅值补偿,零训练成本显著提升层剪模型性能。
Xinrui Chen, Hongxing Zhang, Fanyi Zeng 等
提出层级式记忆架构H-MEM,提升LLM代理长远推理效率,显著优于五个基线方法。
Haoran Sun, Shaoning Zeng
使用GRASP和IntPhys 2数据集评估多模态语言模型,发现视觉与语言信息整合不佳。
Mohamad Ballout, Serwan Jassim, Elia Bruni
提出一种确定性、模块化的框架,通过预编译策略守卫确保企业政策合规,应用于τ-bench航空领域。
Naama Zwerdling, David Boaz, Ella Rabinovich 等
QuestA通过引入部分解答增强RL训练中的问题难度调节,显著提升1.5B模型在数学推理任务中的性能。
Jiazheng Li, Hongzhou Lin, Hong Lu 等
Infherno利用LLM代理端到端生成符合FHIR标准的结构化临床资源。
Johann Frei, Nils Feldhus, Lisa Raithel 等
PoliAnalyzer系统通过NLP实现隐私政策个性化分析,F1得分达90-100%。
Rui Zhao, Vladyslav Melnychuk, Jun Zhao 等
提出Mixture-of-Recursions(MoR)框架,通过动态递归深度实现参数共享与自适应计算,显著降低验证困惑度。
Sangmin Bae, Yujin Kim, Reza Bayat 等
提出误归因框架与AttriData数据集,结合MisAttributionLLM实现多维错误诊断。
Zishan Xu, Shuyi Xie, Qingsong Lv 等
MIRIX为多模态多代理记忆系统,提升LLM记忆能力,达35%准确率提升。
Yu Wang, Xi Chen
SynthEHR-Eviction通过LLM增强合成数据,提升SDoH中驱逐状态检测,F1达88.8%。
Zonghai Yao, Youxia Zhao, Avijit Mitra 等
扩展70语言MorphScore,评估词形对齐与模型性能相关性极低。
Catherine Arnett, Marisa Hudspeth, Brendan O'Connor
Gemini 2.5 Pro结合长上下文、多模态和推理能力,达成SOTA性能。
Gheorghe Comanici, Eric Bieber, Mike Schaekermann 等
提出MemOS,基于系统资源管理的记忆操作系统,显著提升LLMs的长时记忆与个性化能力。
Zhiyu Li, Chenyang Xi, Chunyu Li 等
通过筛选多样且难度适中的推理轨迹,从强教师模型蒸馏出高质量自然思考数据,显著提升模型推理能力。
Yang Li, Youssef Emad, Karthik Padthe 等
本研究比较MLM与CLM预训练对文本表示的影响,发现MLM更优,但CLM更高效。
Hippolyte Gisserot-Boukhlef, Nicolas Boizard, Manuel Faysse 等
本研究比较了手工、模式和大语言模型生成的能力性问题(CQ),发现LLMs虽能快速生成,但需后续优化。
Reham Alharbi, Valentina Tamma, Terry R. Payne 等
AlignEvoSkill通过知识标记和任务对齐提升技能演化,性能提升34.7%。
Dingzirui Wang, Xuanliang Zhang, Keyan Xu 等
HERB基准测试揭示了RAG系统在异构企业数据上的检索瓶颈,平均得分32.96。
Prafulla Kumar Choubey, Xiangyu Peng, Shilpa Bhagavath 等
提出评分偏差定义,发现Rubric顺序、Score ID、参考答案评分引入偏差,构建量化框架。
Qingquan Li, Shaoyu Dou, Kailai Shao 等