Self-Policy Distillation via Capability-Selective Subspace Projection
提出自策略蒸馏(SPD),通过低秩子空间投影实现无外部信号的能力选择,提升模型性能13%。
Guangya Hao, Yitong Shang, Yunbo Long 等
提出自策略蒸馏(SPD),通过低秩子空间投影实现无外部信号的能力选择,提升模型性能13%。
Guangya Hao, Yitong Shang, Yunbo Long 等
SynAE通过多维指标评估合成数据的有效性、保真度和多样性,提升工具调用代理的评估质量。
Shuaiqi Wang, Aadyaa Maddi, Zinan Lin 等
RankJudge生成多轮对话基准,使用Bradley-Terry模型评估21个LLM裁判。
Zhenwei Tang, Zhaoyan Liu, Rasa Hosseinzadeh 等
Auto-Dreamer通过离线整合机制提升语言代理记忆效率,成功在ScienceWorld任务中提升7点成功率,内存缩减12倍。
Chongrui Ye, Yuxiang Liu, Yu Wang 等
ThoughtTrace通过收集用户自报思想,提升多轮人机交互理解与模型对齐,分析显示思想难以由模型推断,内容丰富。
Chuanyang Jin, Binze Li, Haopeng Xie 等
SkillsVote通过生命周期管理,提升大规模开源Agent Skills的推荐与演化,实验中显著改善代码基任务表现。
Hongyi Liu, Haoyan Yang, Tao Jiang 等
EPIC通过偏好对齐索引构建技术,显著降低存储需求并提升个性化检索精度,节省4044倍内存。
Changmin Lee, Jaemin Kim, Taesik Gong
DRIFT和SAPLMA在消除基准构建伪影后有效检测幻觉,AUROC达0.91。
Khizar Hussain, Murat Kantarcioglu
PSD通过并行推测解码提升扩散LLM的推理效率,达到每次前向传递5.5倍的token数。
Shengyin Sun, Yiming Li, Renxi Liu 等
LifeSentence利用预训练语言模型结合结构化生活事件,实现长周期人生轨迹预测与社会模式复现。
Samuel Liu, Muchen Xi, William Yeoh 等
ML-Embed结合3D-ML框架,通过MEL、MLL、MRL实现多语言文本嵌入的高效性与包容性。
Ziyin Zhang, Zihan Liao, Hang Yu 等
引入SciPaths,基于专家标注的路径,利用机器学习预测科学发现的依赖关系,模型F1仅0.189。
Eric Chamoun, Yizhou Chi, Yulong Chen 等
CDD方法提升RAG模型在知识冲突下的准确性,特别是在实体替换和逻辑矛盾上。
Yihang Chen, Pin Qian, Su Wang 等
提出MARS,采用三层记忆结构,提升推荐性能,HR@1提升26.4%。
Xiang Shen, Yuhang Zhou, Yifan Wu 等
CiteVQA通过严格归属准确性评估多模态大语言模型的证据归属能力,揭示答案仅评估的可靠性差距。
Dongsheng Ma, Jiayu Li, Zhengren Wang 等
LongMemEval-V2通过AgentRunbook-C实现72.5%的准确率,评估代理的长期记忆能力。
Di Wu, Zixiang Ji, Asmi Kawatkar 等
通过测试时LLM指导的任务自适应嵌入优化,提升零样本搜索和分类性能,提升达25%。
Ariel Gera, Shir Ashury-Tahan, Gal Bloch 等
通过计算社会科学框架,审计LLM生成的政治话语在九个危机事件中的表现,发现其情感更负面且结构更一致。
Gunjan, Sidahmed Benabderrahmane, Talal Rahwan
Q-DAPS方法通过计算候选答案的可信度熵来估计问题难度,在四个QA数据集上表现优异。
Jamshid Mozafari, Bhawna Piryani, Adam Jatowt
MedHopQA通过多跳推理评估生物医学问答,使用1,000个专家策划的问题对。
Rezarta Islamaj, Robert Leaman, Joey Chan 等