Mitigating Context-Memory Conflicts in LLMs through Dynamic Cognitive Reconciliation Decoding
动态认知调和解码(DCRD)通过预测和缓解上下文-记忆冲突,在六个QA数据集上实现了最先进的性能。
Yigeng Zhou, Wu Li, Yifan Lu 等
动态认知调和解码(DCRD)通过预测和缓解上下文-记忆冲突,在六个QA数据集上实现了最先进的性能。
Yigeng Zhou, Wu Li, Yifan Lu 等
SOMA通过小型语言模型实现高效的多轮对话服务,显著降低成本和延迟,同时保持高质量响应。
Xueqi Cheng, Qiong Wu, Zhengyi Zhou 等
提出DPUA框架,通过模型感知分歧与校准不确定性,提升主观性分析的可靠性。
Junyu Lu, Deyi Ji, Xuanyi Liu 等
SkillRAE采用两阶段技能图谱构建与紧凑上下文编译,提升任务执行效果11.7%。
Xiangcheng Meng, Shu Wang, Yixiang Fang
Scratchpad Patching方法在16字节补丁下,模型质量接近基线,计算效率提升16倍。
Lin Zheng, Vasilisa Bashlovkina, Timothy Dozat 等
预算化子集优化策略提高LLM研究创意的执行意识,MMR-k表现最佳。
Micah Zhang
DocScope通过四阶段评估协议验证长文档理解的可信推理,发现证据链完整率仅29%。
Xiang Feng, Jiawei Zhou, Zhangfeng Huang 等
SOD用步级重加权OPD,让0.6B模型在AIME 2025达26.13%。
Qiyong Zhong, Mao Zheng, Mingyang Song 等
提出统一架构-生命周期框架,提升CUA在实际环境中的可靠性,分析感知、决策、执行层级及创建、部署、运行、维护阶段。
Zejian Chen, Zhanyuan Liu, Chaozhuo Li 等
提出面向低资源口语方言的线性语义分割模型,显著优于基线,构建多语种标注数据。
Kirill Chirkunov, Younes Samih, Abed Alhakim Freihat 等
StoryAlign通过StoryRMB评估故事生成奖励模型,StoryReward在StoryRMB上达到66.3%的准确率。
Haotian Xia, Hao Peng, Yunjia Qi 等
MCJudgeBench基准评估多约束指令遵循中的判定可靠性,分析判别准确性与稳定性。
Jaeyun Lee, Junyoung Koh, Zeynel Tok 等
引入InfoLaw,结合质量加权混合数据与重复,建立信息规模定律,准确预测大模型性能。
Fengze Liu, Weidong Zhou, Binbin Liu 等
提出解耦探索-承诺范式,结合校准感知生成提升长文本事实性,最高提升13%。
Wen Luo, Guangyue Peng, Liang Wang 等
EPIC通过嵌入替代文本示范,提升LLMs作为文本编码器的性能,减少Token开销。
Ailiang Lin, Zhuoyun Li, Keyu Mao 等
构建MathArena平台,扩展范围至数学推理,模型在2026奥林匹克达98%,研究题74%。
Jasper Dekoninck, Nikola Jovanović, Tim Gehrunger 等
DriftBench评估多轮LLM科学创意中的约束遵循性,发现复杂性增加和约束违背现象。
Garvin Kruthof
提出uxWeb数据集与uxCUA模型,实现基于深度学习的GUI可用性自动评估,提升准确率25%。
Alice Gao, Weixi Tong, Rishab Vempati 等
通过多任务BiLSTM和AutoML对印尼电商评论进行情感和情绪分类,达到了高精度。
Hermawan Manurung, Ibrahim Al-Kahfi, Ahmad Rizqi 等
SeaEvo通过策略空间进化提升算法发现,系统优化任务中相对提升21%。
Sichun Luo, Yi Huang, Haochen Luo 等