Magic, Madness, Heaven, Sin: LLM Output Diversity is Everything, Everywhere, All at Once
提出“魔、狂、天、罪”框架,模型输出多样性依任务目标而定,分析四类场景。
Harnoor Dhingra
提出“魔、狂、天、罪”框架,模型输出多样性依任务目标而定,分析四类场景。
Harnoor Dhingra
使用Qwen3:30b等LLM标注PersuasionForGood语料库,发现“内疚诱导”策略显著降低捐赠率(下降23个百分点)。
Tatiana Petrova, Stanislav Sokol, Radu State
提出Exons-Detect,通过隐藏状态差异识别关键“外显子”Token,提升AI文本检测鲁棒性。
Xiaowei Zhu, Yubing Ren, Fang Fang 等
研究发现,RAG系统的检索改进未必提升问答性能,尤其在AI政策分析中。
Saahil Mathur, Ryan David Rittner, Vedant Ajit Thakur 等
MARCH框架通过多智能体强化自检显著减少LLM幻觉,提升8B参数模型的事实一致性。
Zhuo Li, Yupeng Zhang, Pengyu Cheng 等
自蒸馏在数学推理中可能降低LLM性能,因抑制不确定性表达。
Jeonghye Kim, Xufang Luo, Minbeom Kim 等
CAPITU利用巴西文学经典文本,设计59个可自动验证的指令类型,评估大模型在葡萄牙语中的指令遵循能力。
Giovana Kerche Bonás, Roseval Malaquias Junior, Marcos Piau 等
TiCo方法通过语音时间标记显著提高对话模型的时间控制能力,MAE降至4.54秒。
Kai-Wei Chang, Wei-Chih Chen, En-Pei Hu 等
MemDLM通过双层优化嵌入模拟去噪过程,提升DLM训练效率和长文本理解能力。
Zehua Pei, Hui-Ling Zhen, Weizhe Lin 等
TableLong方法通过表格数据提升长上下文推理能力,平均提高8.24%。
Huaibing Xie, Guoliang Zhao, Yang Liu 等
提出VARS框架,通过在线弱奖励学习用户双向向量,提升多会话个性化交互效率。
Yuren Hao, Shuhaib Mehri, ChengXiang Zhai 等
PUPPET框架预测LLM对人类信念的影响,相关性达r=0.3-0.5,揭示模型偏差。
Jocelyn Shen, Amina Luvsanchultem, Jessica Kim 等
语义标记聚类(STC)方法实现大语言模型中高效的不确定性量化,显著降低计算开销。
Qi Cao, Andrew Gambardella, Takeshi Kojima 等
研究SFT-DPO在小型语言模型中的交互,发现全参数微调优于LoRA。
Yuming Feng, Christy Yang
提出Recoding-Decoding(RD)算法,增强大模型的持续创造性与多样性,超越模态解码限制。
Queenie Luo, Gary King, Michael Puett 等
F2LLM-v2通过两阶段训练和套娃学习,提供高效多语言嵌入,支持200多种语言。
Ziyin Zhang, Zihan Liao, Hang Yu 等
Nemotron-Cascade 2通过级联RL和多域策略蒸馏在30B MoE模型中实现了顶级推理能力。
Zhuolin Yang, Zihan Liu, Yang Chen 等
VEPO通过可验证奖励的强化学习提升低资源语言模型的翻译质量和分词效率。
Chonghan Liu, Yimin Du, Qi An 等
提出MoRI框架,利用强化学习结合信息增益与语义对比提升科学创意深度与合理性。
Chenyang Gu, Jiahao Cheng, Meicong Zhang 等
RADIUS通过排名和分布两个维度评估LLM模拟问卷的对齐效果,结合统计显著性检验。
Weronika Łajewska, Paul Missault, George Davidson 等