Optimal Transport for LLM Reward Modeling from Noisy Preference
提出SelectiveRM,基于最优传输的噪声偏好数据去噪框架,显著优于SOTA方法。
Licheng Pan, Haochen Yang, Haoxuan Li 等
提出SelectiveRM,基于最优传输的噪声偏好数据去噪框架,显著优于SOTA方法。
Licheng Pan, Haochen Yang, Haoxuan Li 等
提出DiBA(对角与二值矩阵逼近),通过三对角矩阵和两二值矩阵实现神经网络权重压缩,提升存储效率。
Nobutaka Ono
SkillRet是一个包含17810个技能的长文检索基准,采用结构化标签提升LLM技能检索效果。
Hongcheol Cho, Ryangkyung Kang, Youngeun Kim
提出利用知识图谱路径作为中间监督,改进自演化搜索代理的问答生成与解答能力,平均提升多跳问答准确率7.3%。
Huyu Wu, Jun Liu, Xiaochi Wei 等
基于信息理论与几何框架,分析LVLM中注意力与FFN的功能解耦,揭示“迷失于注意力”的现象。
Gongli Xi, Ye Tian, Mengyu Yang 等
提出OTAD,结合残差黎曼度量适配器和熵正则Sinkhorn OT,改善音频距离评估。
Wonwoo Jeong
提出SPARK框架,通过知识图谱实现科学文献中的关系推理,显著优于无结构方法。
Hyobin Park, Taeseop Kim, Dong-Geol Choi
提出线性约束条件下的扩散模型采样方法,结合Langevin混合与信息论保证,提升图像修复效果。
Ahmad Aghapour, Erhan Bayraktar, Asaf Cohen
StageCF提出兴趣衰减扩散;在Yelp2018等三数据集上优于生成式与扩散基线。
Yifang Qin, Zhaobin Li, Arisa Watanabe 等
LineRides通过线引导强化学习,实现自行车机器人多样特技,无需示范或时间信息。
Seungeun Rho, Shamel Fahmi, Jeonghwan Kim 等
研究流行与爵士混合比率对和弦生成的影响,使用Music Transformer,流行准确率84.21%,爵士提升至75.05%。
Jinju Lee
EIG框架通过可学习的编辑和提交机制提升多智能体科学创意生成,AI Idea Bench 2025上表现优异。
Jiangwen Dong, Bo Li, Wanyu Lin
StoryAlign通过StoryRMB评估故事生成奖励模型,StoryReward在StoryRMB上达到66.3%的准确率。
Haotian Xia, Hao Peng, Yunjia Qi 等
提出知识无关的相关协议(KFCA),用于在无真实标签的情况下激励联邦学习。
Leon Witt, Togrul Abbasli, Kentaroh Toyoda 等
SEI-SHIELD结合自监督对比预训练与迭代样本修复,有效抗噪提升无线设备识别准确率。
Ruixiang Zhang, Zinan Zhou, Yezhuo Zhang 等
本文系统研究了视觉-语言-动作模型中的潜在动作监督,比较了图像和动作两类潜在表示的四种整合策略。
Yihan Lin, Haoyang Li, Yang Li 等
提出InfoCoordiBridge,结合多传感器信息协调与符号推理,提升自主驾驶场景理解的可靠性。
Shuo Liu, Lei Shi, Haowen Liu 等
提出在线自然语言反馈优化语言模型,利用ICL和微调实现样本效率提升,Qwen3-8B达35%性能恢复。
Christine Ye, Joe Benton
将自然语言规则转化为信号时序逻辑(STL),结合VLM实现无人机安全导航。
Kristy Sakano, Kalonji Harrington, Mumu Xu
Jordan-RoPE通过复数Jordan块实现非半单相对位置编码,在WikiText-103上表现优于RoPE。
Yaobo Zhang