Score Centering Stabilizes Off-policy Reinforcement Learning
得分中心化稳定了离策略强化学习,显著减少训练-推理偏差。
Martin Marek, Max Ryabinin
得分中心化稳定了离策略强化学习,显著减少训练-推理偏差。
Martin Marek, Max Ryabinin
PosteriorBench评估生成逆解算器的分布准确性,揭示神经算子提高分辨率鲁棒性。
Jiachen Yao, Zi-Siang Hsu, Xi Deng 等
使用1D CNN在异构协议干扰下进行RF指纹识别,准确率高达97%。
Tariq Abdul-Quddoos, Xiangfang Li, Lijun Qian
ActObs方法通过监督观察改变RL中的探索,提升了Qwen3模型在Terminal-Bench 2.0上的表现。
Juzheng Zhang, Disha Makhija, Manoj Ghuhan Arivazhagan 等
通过DAGMA算法识别因果图,验证了在混合数据集上边缘方向的可识别性。
Sambit Mishra, Yingying Wang, Christine K. Johnson 等
研究对比了三种扩散语言模型的并行性,发现高斯和均匀扩散在某些条件下更优。
Sitan Chen, Liye Wang
研究非线性双时间尺度随机逼近在常数步长下的偏差,提供均方误差上界。
Djamel Rassem Lamouri, Dorian Baudry, Nicolas Gast
Impute-EM使用原生混合状态扩散模型实现异构数据插补,显著提升分布保真度。
Sergei Kholkin, Kirill Sokolov, Dmitry Baranchuk 等
VAST方法在冷启动半监督学习中,通过几何推断提升了准确率,显著优于现有基线。
Itai David, Daphna Weinshall
研究提出小睡范式,通过比例权重缩放和连续随机膜活动,优化递归脉冲神经网络。
Andreas Massey, Stefano Nichele, Aliaksandr Hubin
研究表明,合规数据不能直接用于AI系统的有效性评估。
Hung-Yu Lin, Xingran Huang, Qiming Guo 等
物理状态引导扩散采样(PSG)在OpenFWI数据集上实现了更高的地质结构恢复精度。
Chen Min, Haowen Jiang, Zheng Ma 等
利用IQP量子电路生成特征,将Logistic回归F1从0.462提升至0.517,超越Kernel PCA。
Menachem Finkelstein, Diana Legziel Levy, Zohar Yakhini 等
提出协方差神经网络(VNN),结合PCA与图学习,提升多尺度数据的稳定性与可迁移性。
Saurabh Sihag, Andrea Cavallo, Elvin Isufi 等
提出Semigroup-JEPA模型,通过递归潜变量预测实现零样本物理泛化,提升预测精度34%,控制成功率提升至23.3%。
Andy Zeyi Liu, Haoran Sun, Lucas Baker 等
FOM-UL通过选择性更新Transformer层实现高效遗忘,在8/4位量化下保持模型效用和隐私安全。
Ravi Ranjan, Olivera Kotevska, Agoritsa Polyzou
BatchNorm在机器学习忘却评估中的假象:BN运行统计影响忘却准确性。
Aaryaman Kalani, Murari Mandal, Dhruv Kumar 等
Kalman Delta Networks通过显式不确定性建模改进线性注意力,提升了750M和1.3B参数模型的困惑度和准确率。
Ngoc Bui, Tinglin Huang, Rex Ying
Online Draft Co-Training结合Zigzag Ring与TapChannel,实现最高1.88倍端到端加速。
Zili Wang, Zhaopeng Qiu, Yuekai Zhang 等
提出了一种新的理论框架分析Masked Pretraining (MPT),解决了维度坍塌问题。
Qi Zhang, Runyu Zhou, Yifei Wang 等