Cartridges: Lightweight and general-purpose long context representations via self-study
提出Cartridges,通过自我学习训练小型KV缓存,实现长文本上下文的高效表示,显著降低内存和计算成本。
Sabri Eyuboglu, Ryan Ehrlich, Simran Arora 等
提出Cartridges,通过自我学习训练小型KV缓存,实现长文本上下文的高效表示,显著降低内存和计算成本。
Sabri Eyuboglu, Ryan Ehrlich, Simran Arora 等
提出LLM幻觉的统一理论框架,分析根源与检测方法,强调数学基础与未来方向。
Chaozhuo Li, Pengbo Wang, Chenxu Wang 等
BioMol-MQA构建多模态药物交互问答数据集,结合知识图谱、文本与分子结构,提升LLM多模态推理能力。
Saptarshi Sengupta, Shuhua Yang, Paul Kwong Yu 等
提出MMSU基准,涵盖47任务,结合语音、语义、韵律等多层次特征,评估22个SpeechLLMs。
Dingdong Wang, Junan Li, Jincenzi Wu 等
R-Search通过多奖励强化学习提升LLM的推理与搜索能力,提升32.2%的性能。
Qingfei Zhao, Ruobing Wang, Dingling Xu 等
提出Pre³,基于DPDA优化LR(1)语法结构生成,提升解码效率40%。
Junyi Chen, Shihao Bai, Zaijun Wang 等
多智能体框架将方言问题标准化并由隐私专家复核,使GPT-4o-mini在PrivacyQA上由0.394升至0.601。
Đorđe Klisura, Astrid R Bernaga Torres, Anna Karen Gárate-Escamilla 等
通过微调OpenAI Whisper模型,利用少量MSA数据显著提升五大阿拉伯方言的ASR性能。
Ömer Tarik Özyilmaz, Matt Coler, Matias Valdenegro-Toro
STORYTELLER通过SVO节点和动态模块显著提升故事连贯性,达84.33%人类偏好率。
Jiaming Li, Yukun Chen, Ziqiang Liu 等
提出Common Corpus,约2万亿无版权或开源标注的多语种数据集,用于多模态预训练。
Pierre-Carl Langlais, Pavel Chizhov, Catherine Arnett 等
提出SealQA基准,评估搜索增强语言模型在噪声和冲突信息下的推理能力,表现极差。
Thinh Pham, Nguyen Nguyen, Pratibha Zunjare 等
AnnaAgent利用三级记忆和情感调节,实现心理咨询中 seekers动态演化与多会话记忆的逼真模拟。
Ming Wang, Peidong Wang, Lin Wu 等
提出TSGD-M,通过动态采样与动量机制扩展文本梯度,提升提示优化的规模与稳定性。
Zixin Ding, Junyuan Hong, Zhan Shi 等
ComposeRAG采用模块化设计,通过问句分解、检索决策、验证机制提升多跳问答性能,达成15%准确率提升。
Ruofan Wu, Youngwon Lee, Fan Shu 等
通过语音转换提高阿拉伯语方言识别的跨域鲁棒性,准确率提升34.1%。
Badr M. Abdullah, Matthew Baas, Bernd Möbius 等
提出SCRIPT编码方案,基于Unicode脚本与类别实现鲁棒多语预分词,优化BPE合并策略。
Sander Land, Catherine Arnett
提出跨层归因算法分析稀疏MoE模型的知识分配,揭示“中激活、后放大”模式,提升37%的层效率。
Junzhuo Li, Bo Wang, Xiuze Zhou 等
提出HARDTESTGEN,利用LLMs合成高质量测试用例,提升代码验证的精确率11.3%、召回17.5%。
Zhongmou He, Yee Man Choi, Kexun Zhang 等
DeepTheorem利用自然语言和强化学习提升LLM的数学推理能力,包含121K非正式定理数据集。
Ziyin Zhang, Jiahao Xu, Zhiwei He 等
Table-R1通过推理痕迹蒸馏和可验证奖励强化学习提升表格推理性能,使用7B参数模型超越GPT-4.1。
Zheyuan Yang, Lyuhao Chen, Arman Cohan 等