PosIR: Position-Aware Heterogeneous Information Retrieval Benchmark
PosIR通过长度控制和精确参考跨度,系统诊断多语言多领域中的位置偏差,揭示模型在长文本中的偏好。
Ziyang Zeng, Dun Zhang, Yu Yan 等
PosIR通过长度控制和精确参考跨度,系统诊断多语言多领域中的位置偏差,揭示模型在长文本中的偏好。
Ziyang Zeng, Dun Zhang, Yu Yan 等
提出一种PAC-Bayesian框架,通过各向异性高斯后验优化提高泛化界紧度。
Xinping Yi, Gaojie Jin, Xiaowei Huang 等
JudgeFlow通过块级责任评分优化LLM工作流,提升效率和可解释性。
Zihan Ma, Zhikai Zhao, Chuanbo Hua 等
利用Kummer定理和素数分解,构建无限多满足对数间隙的阶乘可整除性实例。
Nat Sothanaphan
本文证明SFT与RL在后训练中不可解耦,RL会加剧SFT损失。
Xueyan Niu, Bo Bai, Wei Han 等
提出语义生命周期框架,结合基础模型提升语义获取、表示与存储能力,显著增强多模态语义处理。
Shuai Chen, Hao Chen, Yuanchen Bei 等
提出NoisyBench评估模型鲁棒性,发现最先进模型在噪声环境下性能下降达80%。
Seongyun Lee, Yongrae Jo, Minju Seo 等
PALM通过交互中心的可供性推理和进展预测,提升长时序机器人操控成功率至91.8%。
Yuanzhe Liu, Jingyuan Zhu, Yuchen Mo 等
Dr. Zero通过自我进化和HRPO算法,在无训练数据下实现了与监督学习相媲美的搜索能力。
Zhenrui Yue, Kartikeya Upasani, Xianjun Yang 等
提出基于原子任务分解与融合的算法,提升LLMs在智能合约重入漏洞检测中的泛化能力,准确率达98.2%。
Ying Zhou, Jiacheng Wei, Yu Qi 等
提出基于性格的强化学习框架,结合D3QN模型和P4G数据集,提升劝说对话效果。
Donghuo Zeng, Roberto Legaspi, Kazushi Ikeda
SpatialNav以空间场景图增强零样本导航,R2R成功率57.7%,R2R-CE达64.0%。
Jiwen Zhang, Zejun Li, Siyuan Wang 等
提出基于超球面对比学习的情感圆环模型,增强情感表示的可解释性与心理一致性。
Yusuke Yamauchi, Akiko Aizawa
提出归因技术管控RAG系统中的幻觉,涵盖四模块,显著提升回答可信度。
Yuqing Zhao, Ziyao Liu, Yongsen Zheng 等
采用机制可解释性分析Diffusion Transformers中空间关系生成的电路机制,揭示随机与预训练文本编码器下的不同电路结构。
Binxu Wang, Jingxuan Fan, Xu Pan
TAGRPO通过直接轨迹对齐提升GRPO在图像到视频生成中的表现,显著提高奖励。
Jin Wang, Jianxiang Lu, Guangzheng Xu 等
提出自进化分布式存储架构,实现跨层协同内存管理,提升AI系统效率。
Zixuan Li, Chuanzhen Wang, Haotian Sun
提出任务级级联框架,通过操作、文档部分变化优化大模型调用,成本降低36%。
Shreya Shankar, Sepanta Zeighami, Aditya Parameswaran
ALVGL通过稀疏低秩分解提升因果发现的效率与准确性,适用于高维与潜在混杂场景。
Pingchuan Ma, Qixin Zhang, Shuai Wang 等
DafnyPro利用LLM增强验证注释生成,结合差异检测、剪枝和策略检索,显著提升Dafny程序验证准确率。
Debangshu Banerjee, Olivier Bouissou, Stefan Zetzsche