Speculative Correction: Draft-then-Refine Decoding for Diffusion Language Models
提出了一种名为“推测性校正”的方法,提升了扩散语言模型的解码效率和准确性。
Brian K Chen, Chong Wu, Kenji Kawaguchi
提出了一种名为“推测性校正”的方法,提升了扩散语言模型的解码效率和准确性。
Brian K Chen, Chong Wu, Kenji Kawaguchi
研究表明多语言句子嵌入可替代翻译文本,用于LiRA可靠性审计,且恢复了因翻译失败被排除的响应。
Ummugul Bezirhan, Ji Yoon Jung, Matthias von Davier
本研究提出区分客观正确性(OC)与自我判断(SJ),发现SJ方向在跨域迁移中表现优于OC,揭示语义模糊性。
Yi-Long Lu
通过线性探测验证神经语言模型中语法性编码,显示模型能系统区分语法与非语法句子。
Jane Li, Najoung Kim
D-cut通过跨请求修剪和运行时自适应,提升高并发推理速度,最高达3倍。
Tianyu Liu, Yuhao Shen, Rui Cen 等
通过渐进式SFT和强化学习训练小语言模型,提升多代理检索的相关性,NDCG@10达0.918。
Gayathri V Kondapalli, Alexander Ng, Hirsh Pithadia 等
HarnessBank通过语义基因库搜索和门控验证实现代理工具自我进化,性能提升5.1%-15.4%。
Xiaotian Luo, Dizhan Xue, Fengxingyu Wang 等
提出MemCon,基于马尔可夫决策过程的自适应记忆管理框架,提升任务成功率15.2%,降低Token消耗20%。
Eric Hanchen Jiang, Zhi Zhang, Yuchen Wu 等
GSM-Plus-BN通过扰动的孟加拉语数学推理数据集评估LLM,GPT-OSS-20B在标准提示下达96.08%准确率。
Bidyarthi Paul, Nahida Jannat Mayouree, Md. Asif Karim 等
ESFP基准测试测量大语言模型在不同提示下的认知立场灵活性。
Binwen Liu, Yilin Ren
EcoSpec通过考虑专家激活成本优化MoE模型的推理效率,提升了1.62倍的解码速度。
Jincheng Xie, Runheng Liu, Heyan Huang 等
RefineEvo通过规划引导的启发式演化和双向经验池显著提升组合优化性能。
Yang Wu, Junran Pan, Yifan Zhang 等
ProgramTab利用Python代码引导LLMs进行表格预处理,显著提升表格推理性能。
Pei Guo, Enjie Liu, Yunzhi Tan 等
提出QFES任务与QFESum数据集,结合RAT与SHC框架实现事件焦点摘要,性能优于基线。
Chenyu Hu, Bang Wang
提出QIMG-7基准和SATR方法,提升多模态RAG在污染环境下的可靠性,平衡得分提升11.7分。
Saadeldine Eletter, Owais Aijaz, Preslav Nakov
通过渐进树草拟解锁自回归语言模型的并行性,提升2倍解码速度。
Zipeng Gao, Zhi Zheng, Qingrong Xia 等
ReAct检索与微调集成系统在404笔交易上取得0.151类平衡Brier分数,优于市场、XGBoost及前沿模型。
Hinal Jajal, Michal Mucha, Charles Sweat 等
测试时扩展(TTS)显著提升小型视觉语言模型在多语言视觉选择题上的推理能力,最佳配置达84.1%。
Spiros Baxevanakis, Peng-Jian Yang
提出Procrustes条件联合端到端Top-K稀疏自编码器,实现跨随机种子模型的通用特征提取。
Bendegúz Váradi, Zoltán Kmetty
DeepSearch-Evolve在DeepSearch-World中实现自蒸馏,HotpotQA上达到93.4%。
Xinyu Geng, Xuanhua He, Sixiang Chen 等