Score Centering Stabilizes Off-policy Reinforcement Learning
得分中心化稳定了离策略强化学习,显著减少训练-推理偏差。
Martin Marek, Max Ryabinin
得分中心化稳定了离策略强化学习,显著减少训练-推理偏差。
Martin Marek, Max Ryabinin
PosteriorBench评估生成逆解算器的分布准确性,揭示神经算子提高分辨率鲁棒性。
Jiachen Yao, Zi-Siang Hsu, Xi Deng 等
使用1D CNN在异构协议干扰下进行RF指纹识别,准确率高达97%。
Tariq Abdul-Quddoos, Xiangfang Li, Lijun Qian
ActObs方法通过监督观察改变RL中的探索,提升了Qwen3模型在Terminal-Bench 2.0上的表现。
Juzheng Zhang, Disha Makhija, Manoj Ghuhan Arivazhagan 等
通过DAGMA算法识别因果图,验证了在混合数据集上边缘方向的可识别性。
Sambit Mishra, Yingying Wang, Christine K. Johnson 等
研究对比了三种扩散语言模型的并行性,发现高斯和均匀扩散在某些条件下更优。
Sitan Chen, Liye Wang
研究非线性双时间尺度随机逼近在常数步长下的偏差,提供均方误差上界。
Djamel Rassem Lamouri, Dorian Baudry, Nicolas Gast
VAST方法在冷启动半监督学习中,通过几何推断提升了准确率,显著优于现有基线。
Itai David, Daphna Weinshall
物理状态引导扩散采样(PSG)在OpenFWI数据集上实现了更高的地质结构恢复精度。
Chen Min, Haowen Jiang, Zheng Ma 等
利用IQP量子电路生成特征,将Logistic回归F1从0.462提升至0.517,超越Kernel PCA。
Menachem Finkelstein, Diana Legziel Levy, Zohar Yakhini 等
提出协方差神经网络(VNN),结合PCA与图学习,提升多尺度数据的稳定性与可迁移性。
Saurabh Sihag, Andrea Cavallo, Elvin Isufi 等
提出Semigroup-JEPA模型,通过递归潜变量预测实现零样本物理泛化,提升预测精度34%,控制成功率提升至23.3%。
Andy Zeyi Liu, Haoran Sun, Lucas Baker 等
FOM-UL通过选择性更新Transformer层实现高效遗忘,在8/4位量化下保持模型效用和隐私安全。
Ravi Ranjan, Olivera Kotevska, Agoritsa Polyzou
Online Draft Co-Training结合Zigzag Ring与TapChannel,实现最高1.88倍端到端加速。
Zili Wang, Zhaopeng Qiu, Yuekai Zhang 等
提出了一种新的理论框架分析Masked Pretraining (MPT),解决了维度坍塌问题。
Qi Zhang, Runyu Zhou, Yifei Wang 等
RegionFed通过梯度冲突分析实现个性化查询理解,达到92.27%准确率。
Quoc H. Nguyen, Ali Lafzi, Abhijeet Phatak 等
提出一种两级框架,通过推理蒸馏和产品类型测试时训练提升推荐系统的可扩展性,学生模型AUC达0.924。
Siliang Liu, Mohammad Ghasemi, Sapan Patel 等
提出了一种基于Hessian的变分延续方法,自动化寻找双摆周期轨道。
Leo Yao, Ziming Liu, Max Tegmark
EGF通过学习连续嵌入生成分类图,在QM9上FCD为0.150。
Ethan Ma, Zihan Wang, Chris Siu Yeung Chow 等
研究优化信息聚合速度,提出M²/D误差率,适用于线性回归和逻辑分类。
MohammadHossein Bateni, Zahra Hadizadeh, MohammadTaghi Hajiaghayi 等