Breaking Entropy Bounds: Accelerating RL Training via MTP with Rejection Sampling
提出Bebop,通过TV损失和拒绝采样显著提升RL训练中MTP接受率,达95%并实现1.8倍加速。
Yucheng Li, Huiqiang Jiang, Yang Xu 等
提出Bebop,通过TV损失和拒绝采样显著提升RL训练中MTP接受率,达95%并实现1.8倍加速。
Yucheng Li, Huiqiang Jiang, Yang Xu 等
本研究比较xLSTM、Mamba-2和Gated DeltaNet三种子二次架构,验证xLSTM在复杂任务中的优越性,核心在于其稳健的状态追踪与记忆累积。
Anamaria-Roberta Hartl, Levente Zólyomi, David Stap 等
提出Latent World Recovery(LWR)框架,有效应对多模态数据中的缺失问题,通过模态特定嵌入在共享潜在空间中对齐,实现缺失模态的鲁棒预测。
Hui Wang, Tianyu Ren, Joseph Butler 等
基于MARUS的虚拟海试框架,通过命令-执行追溯实现IMO/ITTC标准的USV转向性能数据采集与系统识别。
Paria Rezayan
Fourier特征将点云映射至多频空间,使模仿策略更精确;真实任务归一化得分由14.8%升至40.2%。
Balázs Gyenes, Emiliyan Gospodinov, Jan Frieling 等
ExtremeWhenBench基准测试表明,长视频的自然语言时间定位是一个搜索问题,检索-定位混合方法性能提升6.7倍。
Sukmin Seo, Geewook Kim
使用因果影响图(CID)证明无法通过反馈训练AI诚实报告潜在知识。
Korbinian Friedl, Francis Rhys Ward, Paul Yushin Rapoport 等
提出数据中介模型解决AI市场中的创作激励与模型性能双重失灵问题,结合静态与动态分析,优化激励机制。
Yan Dai, Maryam Farboodi, Negin Golrezaei 等
提出RankGuard,基于用户私有点击历史的去中心化OLTR防御机制,确保模型收敛且抗污染。
Marcel Gregoriadis, Martijn de Vos, Sayan Biswas 等
AGRA通过对齐视频特征与语义表示,提升机器人操作模型的动作准确性,ID成功率80%。
Lu Qiu, Yizhuo Li, Yi Chen 等
SKIM框架压缩大语言模型中的程序性知识,保持任务性能,压缩率达30%-60%。
Changyue Wang, Weihang Su, Qingyao Ai 等
本研究评估Instruction-Tuned大模型中解码时真值性方法(层对比、干预、logit适配器)效果,发现严格控制下效果有限。
Ao Sun
提出ZOMA框架,结合多种零阶估计器与加速技术,实现去中心化极小极大优化。
Haoyuan Cai, Yike Zhao, Aleksandar Armacki 等
提出ISAP-3D,通过显式身份槽对齐实现稳定的3D部件生成,显著提升结构一致性。
Junlin Hao, Haoshuai Fu, Xibin Song 等
H-SAL通过自我描述文本进行隐性去偏,优于显性标签去偏。
Shun Shao, Zheng Zhao, Anna Korhonen 等
本论文提出基于元数据感知的多提示推理框架,用于零样本监控视频事故理解,显著提升CVPR基准的综合评分。
Tarandeep Singh, Soumyanetra Pal, Soham Biswas 等
本文从机器学习视角分析动力系统中的不确定性,区分了内在随机性(aleatoric)与知识缺乏(epistemic),并探讨其在不同任务中的作用。
Yusuf Sale, Christopher Bülte, Felix Czaja 等
提出神经关系程序(NRPs),融合关系查询与神经计算,扩展Datalog规则处理嵌入向量。
Arie Soeteman, Balder ten Cate, Maurice Funk 等
提出Arbor框架,通过假设树细化实现自主研究,显著提升多任务性能。
Jiajie Jin, Yuyang Hu, Kai Qiu 等
StreamMUSE实现实时音乐伴奏生成,优化同步性能。
Bowen Zheng, Andrew H. Yang, Jiaqi Ruan 等