Training Language Model to Critique for Better Refinement
提出RCO框架,通过 refinement信号训练批评模型,显著提升多任务评价性能。
Tianshu Yu, Chao Xiang, Mingchuan Yang 等
提出RCO框架,通过 refinement信号训练批评模型,显著提升多任务评价性能。
Tianshu Yu, Chao Xiang, Mingchuan Yang 等
提出FineWeb2数据管线,支持任何语言的预训练数据自动过滤与去重,提升多语模型性能。
Guilherme Penedo, Hynek Kydlíček, Vinko Sabolčec 等
认知模型揭示语言模型中的价值权衡,使用RSA模型分析礼貌言语。
Sonia K. Murthy, Rosie Zhao, Jennifer Hu 等
提出多视角软标签模型,提升NLP中主观任务的包容性与性能。
Benedetta Muscato, Lucia Passaro, Gizem Gezici 等
IndexTTS2实现了基于自回归模型的精确时长控制与情感表达的零样本语音合成。
Siyi Zhou, Yiquan Zhou, Yi He 等
本研究系统评估17个印度语言的多语种分词,发现脚本归一化和Unigram LM优于BPE。
Maharaj Brahma, N J Karthika, Rajat Verma 等
研究揭示多语言语音数据集的质量问题,强调社会语言学意识和主动语言规划的重要性。
Mingfei Lau, Qian Chen, Yeming Fang 等
提出MemBench,结合多场景多层级记忆评估LLM代理的效果、效率与容量。
Haoran Tan, Zeyu Zhang, Chen Ma 等
引入自回归U-Net,学习字节级嵌入,支持多尺度序列建模,提升低资源语言处理能力。
Mathurin Videau, Badr Youbi Idrissi, Alessandro Leite 等
AgentSynth通过链式生成子任务,构建超6000个多样化高质量任务,显著提升数据规模与复杂性。
Jingxu Xie, Dylan Xu, Xuandong Zhao 等
VL-GenRM通过视觉专家和迭代训练提升视觉语言验证,显著提高多模态推理能力。
Jipeng Zhang, Kehao Miao, Renjie Pi 等
MiniMax-M1结合混合专家架构与Lightning Attention,实现长文本推理高效扩展,参数4560亿,支持百万级上下文。
MiniMax, :, Aili Chen 等
Konooz语料库覆盖16种阿拉伯方言和10个领域,揭示NER模型跨领域性能下降38%。
Nagham Hamad, Mohammed Khalilia, Mustafa Jarrar
DeepResearch Bench提供100个博士级任务,评估深度研究代理的报告生成和信息检索能力。
Mingxuan Du, Benfeng Xu, Chiwei Zhu 等
提出ClaimSpect,基于检索增强的层次化分析框架,有效解构复杂主张,识别多角度证据。
Priyanka Kargupta, Runchu Tian, Jiawei Han
PersonaLens通过多任务、多域用户画像和LLM代理,系统评估个性化在任务导向对话中的表现。
Zheng Zhao, Clara Vania, Subhradeep Kayal 等
本文分析40种LLM不确定性量化方法,指出评估偏离真实场景,强调以人为本改进方向。
Siddartha Devic, Tejas Srinivasan, Jesse Thomason 等
基于Mistral-7B的指令式文本嵌入框架,结合软监督与硬负样本挖掘,提升多任务表现。
Jooyoung Choi, Hyun Kim, Hansol Jang 等
Lingshu:面向医学多模态理解的通用基础模型,融合丰富医学知识。
LASA Team, Weiwen Xu, Hou Pong Chan 等
提出五维区分AI智能体与LLM聊天机器人,基于演化视角分析评估框架。
Jiachen Zhu, Menghui Zhu, Renting Rui 等