Bellman Calibration for Marginalized Importance Weighting in Offline Reinforcement Learning
提出Bellman校准方法,利用单维单调变换减少离线强化学习中的占用比偏差。
Lars van der Laan, Nathan Kallus
提出Bellman校准方法,利用单维单调变换减少离线强化学习中的占用比偏差。
Lars van der Laan, Nathan Kallus
提出几何框架分析邻域公平审计的鲁棒性,验证邻域结构稳定性与扰动关系。
Binita Maity
ELR(有效学习率)主导语言模型预训练中的损失动态,匹配ELR实现轨迹崩溃。
Zihan Liu, Ruiheng Zheng, Shaobo Zhang 等
OPDVR方法结合OPD和RLVR,在六个推理基准上表现优异。
Wenze Lin, Jiale Zhao, Xitai Jiang 等
PhysicsBench统一评估生成与预测模型在工程设计中的几何与物理场表现。
Sang Won Lee, Hyogu Jeong, Namwoo Kang
本研究通过控制实验分析RL后训练中基础模型分布、奖励稀疏性与提示多样性对模型性能的影响。
Donovan Clay, Saket Gollapudi, Sankar Harilal 等
提出了一种基于离群去噪器的自适应采样方法,减少了采样复杂度。
Daniil Dmitriev, Zhihan Huang, Yuting Wei
ProxyFormer通过代理架构实现超长上下文和高分辨率生成,提升了序列长度和检索准确率。
Zhongpan Tang
提出因果测量与闭环调度,提升生成式搜索中的证据利用与上下文分配,模型规模达32B参数。
Peiyang Liu, Xi Wang, Di Liang 等
提出一种轻量级审计方法,成功定位192个因果关系破坏层。
Taebong Kim, Youngsik Hong, Minsik Kim 等
DSSM-CRF在IEMOCAP上达到75.81% UA,解决对话情感识别中的跨说话者影响。
Guan-Hua Wen, Hou-Chiang Tseng, Kuan-Yu Chen
ARCHER利用傅里叶空间信息实现零样本蛋白质晶体姿态估计,误差5.0°。
Nhan D. Nguyen, Bao Pham
提出了一种用于稀疏数据分析的随机交替最小二乘算法,应用于果蝇连接组数据。
Lawrence K. Saul, Ningyuan Huang, Dennis Bollweg 等
本研究首次系统分析了自我细化流程中生成器、批评者和修正器的模型容量分配,发现生成器和修正器模型越大越优,批评者模型对性能影响较小。
Zhuoyi Yang, Ian G. Harris, Salar Hashemitaheri 等
提出跨设计不确定性分析,利用模拟价格轨迹分解估计误差的两个组成部分。
Pedro Cadahia Delgado
SPARCL通过谱分区冻结旧类特征,解决分析型持续学习中的谱干扰问题。
James Hartley, Zeropy Surio, Daniel Whitmore 等
TRACE-C是一种基于秩校准的多流遥测异常检测方法,结合三通道残差分析,提升联合异常识别能力。
Matthew Faucher
引入自由概率核实现零滚动超参数选择,有效避免大量仿真,提升Reservoir Computing性能。
Sara Malacarne, Andrea Ceni, Claudio Gallicchio
通过统计分析揭示空间无关线性模型在多变量时序预测中的竞争优势,质疑现有基准数据集的判别能力。
Kenneth Martin, Simon Heilig, Asja Fischer 等
提出高斯桥一致性(GBC)框架,通过构建类条件高斯特征桥,改善长尾半监督学习中的特征对齐与泛化。
Hongyang He, Xinyuan Song, Yan Zhong 等