LFQA-HP-1M: A Large-Scale Human Preference Dataset for Long-Form Question Answering
提出LFQA-HP-1M数据集,基于九项评分指标评估长文问答质量,模型表现与人类偏好相当。
Rafid Ishrak Jahan, Fahmid Shahriar Iqbal, Sagnik Ray Choudhury
提出LFQA-HP-1M数据集,基于九项评分指标评估长文问答质量,模型表现与人类偏好相当。
Rafid Ishrak Jahan, Fahmid Shahriar Iqbal, Sagnik Ray Choudhury
通过跨学科策略框架,提升说服对话代理的成功率,特别是对低意图用户。
Shinnosuke Nozue, Yuto Nakano, Yotaro Watanabe 等
LARFT通过长度感知强化微调,提升模型长度指令遵循,平均提升20.92分。
Wei Zhang, Lintong Du, Yuanhe Zhang 等
本研究评估8个前沿大模型在因果发现算法性能预测中的校准能力,发现普遍存在算法盲视。
Sohan Venkatesh, Ashish Mahendran Kurapath, Tejas Melkote
提出Token-Selective Dual Knowledge Distillation(TSD-KD),在10个基准上提升准确率达54.4%。
Minsang Kim, Seung Jun Baek
SibylSense通过记忆调优和对抗探测生成自适应评分标准,提升RL性能。
Yifei Xu, Guilherme Potje, Shivam Shandilya 等
Yor-Sarc是首个用于约鲁巴语讽刺检测的金标准数据集,包含436条标注实例,Fleiss' κ达0.766。
Toheeb Aduramomi Jimoh, Tabea De Wille, Nikola S. Nikolov
VIRAASAT使用Symbolic Chain-of-Manipulation提升印度文化推理能力,性能提升达20%。
Harshul Raj Surana, Arijit Maji, Aryan Vats 等
提出X-Value基准测试,评估大语言模型跨语言价值判断能力,包含4750个QA对。
Yukun Chen, Xinyu Zhang, Boyi Deng 等
MemoryArena评估多会话任务中记忆体的表现,揭示现有评估的不足。
Zexue He, Yu Wang, Churan Zhi 等
提出Query-as-Anchor框架,通过层次编码和对比自回归优化实现场景自适应用户表示,提升工业应用性能。
Jiahao Yuan, Yike Xu, Jinyong Wen 等
提出知识剖面框架,发现大模型编码几近饱和但召回仍是瓶颈,思考机制显著提升召回率。
Nitay Calderon, Eyal Ben-David, Zorik Gekhman 等
提出PACED-RL,利用分区函数作为在线准确率信号,提升LLM分布匹配训练效率。
Dohyung Kim, Minbeom Kim, Jeonghye Kim 等
提出On-Policy Context Distillation(OPCD),通过自我生成轨迹最小化反向KL,提升模型知识内化,适用于数学推理和任务迁移。
Tianzhu Ye, Li Dong, Xun Wu 等
通过轨迹自蒸馏实现少步扩散语言模型,提升推理任务表现。
Tunyu Zhang, Xinxi Zhang, Ligong Han 等
提出Composition-RL,通过自动组合多题提升LLM推理能力,实验显示在4B到30B模型中显著优于原始RL。
Xin Xu, Clive Bai, Kai Yang 等
提出GRU-Mem框架,用于长上下文推理,性能提升达400%,解决记忆爆炸及无退出机制问题。
Leheng Sheng, Yongtao Zhang, Wenchang Ma 等
LEMUR构建多语法律语料库,利用对比学习微调多语言法律嵌入模型以提升检索性能。
Narges Baba Ahmadi, Jan Strich, Martin Semmann 等
LycheeMemory通过压缩记忆和选择性回忆实现长上下文推理,GPU内存使用减少2倍,推理速度提高6倍。
Zhuoen Chen, Dongfang Li, Meishan Zhang 等
通过文档重构实现可扩展长上下文RLVR,提升RULER和LongBench v2性能。
Yao Xiao, Lei Wang, Yue Deng 等