SocialReasonBench: A Video-QA Benchmark for Social Reasoning with Counterfactual Narrative Videos
SocialReasonBench通过分支叙事视频评估社交推理能力,揭示LMMs在反事实推理上的不足。
Zheyu Huang, Zijing Shi, Haozhe Luo 等
SocialReasonBench通过分支叙事视频评估社交推理能力,揭示LMMs在反事实推理上的不足。
Zheyu Huang, Zijing Shi, Haozhe Luo 等
S2GE通过采样和对齐提升图增强LLM的解码器可用性,显著提高准确率。
Xiaoyu Guo, Pengcheng Chen, Jiong Yu 等
提出认知边界用户模拟器(CBUS),通过限制工作记忆模拟儿童阅读行为,显著缩小与真实学生的差距。
Krisztian Balog, Arild Michel Bakken
Qwen3-14B序列级蒸馏以ARCscore显著提升小模型法律论证覆盖率。
Mohamed Elaraby, Ahmed Elhady, Diane Litman
EVAR框架提高了长篇叙事推理的证据忠实度和任务表现,同时控制推理成本。
Peilin Liu, Zhiquan Ji, Jinglong Ping
ACTD通过词汇和序列对齐,结合残差正则化,实现跨分词器知识蒸馏,提升五项推理任务性能。
Huiyi Zhang, Zijian Li, Xiaocheng Feng 等
MUDDLE通过分离干扰项和长度效应评估文档理解,提升了gpt-5-mini的准确性。
Jason Luo, Saibilila Abudukelimu, Judy Song 等
通过解释性形式特征检测和指导LLM生成韩诗,检测AUC-ROC达83.60。
Keunhyeung Park, Seunguk Yu, YoungBin Kim
本文以信息论分析语言理解的极限,提出表示意图的不可逾越界限。
Emily Cheng, Ryan Cotterell
本研究比较序贯与并行采样在大规模语言模型翻译中的性能,发现序贯采样在有限预算下表现更优。
Di Wu, Sergey Troshin, Christof Monz 等
NL2AGBench评估大模型将英语几何问题自动转化为AlphaGeometry形式的能力。
Samuel Xiao, Judy Song, Rory Hu 等
ElephantBench利用图结构检测LLMs对长尾事实多源账户的记忆完整性,揭示模型偏向主流答案。
Zhuoshi Pan, Junru Lu, Yan Qian 等
本研究系统分析了对话中角色身份信息可见性在训练、推理和评估三个阶段的影响,揭示了信息泄露机制。
Daniela Occhipinti, Malvina Nissim, Marco Guerini
本研究提出基于诊断的后训练策略,通过 acquire、repair、preserve 三步显著提升小模型对话游戏表现,最终得分从10.67提升至38.92。
Nan Li
本文提出滑动窗口注意力(SWA)在无需后训练的情况下,性能优于线性注意力,适合长文本推理。
Alexia Jolicoeur-Martineau, Rhea Sanjay Sukthanker, Pashmina Cameron 等
提出弱模型引导的RLVR方法,通过外部前缀增强探索,提升推理覆盖率和多样性。
Xingyu Shen, Huishuai Zhang, Peng Li 等
本文比较三种融合范式(Merge、Mix RL、MOPD),在多领域RLVR中表现差异不大,但在单一任务上差距达8.6分,提供实用指导。
Siye Wu, Kai Yang, Yuchen Cai 等
提出DocTalkBN,包含557.63小时真实低资源语言医学对话数据,支持三项下游任务。
Anik Saha, Fahmida Sultana Naznin, Sadatul Islam Sadi 等
级联批量提示法通过解耦复杂推理与符号定位,提高性能并加速推理。
Sho Hoshino, Peinan Zhang
KinyaEmbed通过四阶段课程训练,提升基尼亚卢旺达语句子嵌入性能,Spearman相关系数达0.7298。
Ireddi Rakshitha, Devavarapu Yashwanth, Ntakirutimana Pierre