Empirical Analysis of the Hessian of Over-Parametrized Neural Networks
通过Hessian矩阵分析过参数化神经网络的损失面,揭示谱的两部分结构。
Levent Sagun, Utku Evci, V. Ugur Guney 等
通过Hessian矩阵分析过参数化神经网络的损失面,揭示谱的两部分结构。
Levent Sagun, Utku Evci, V. Ugur Guney 等
提出SmoothGrad,通过加入噪声平滑梯度图,显著提升深度模型敏感性图的清晰度。
Daniel Smilkov, Nikhil Thorat, Been Kim 等
提出多智能体演员-评论家算法(MADDPG),解决非平稳性和高方差问题,提升合作与竞争环境中的策略学习。
Ryan Lowe, Yi Wu, Aviv Tamar 等
采用Gumbel-softmax和强化学习训练多智能体符号序列通信协议,展现出类自然语言的组合性与多样性。
Serhii Havrylov, Ivan Titov
提出Cramér距离解决Wasserstein梯度偏差问题,提升生成模型性能。
Marc G. Bellemare, Ivo Danihelka, Will Dabney 等
通过“恒等映射”结构,分析两层ReLU神经网络SGD收敛性,证明在高维高斯输入下能在多项式步数内达到全局最优。
Yuanzhi Li, Yang Yuan
提出MMD GAN,通过对抗核学习提升GMMN性能,实现高效深度生成。
Chun-Liang Li, Wei-Cheng Chang, Yu Cheng 等
利用投影梯度法学习ReLU,样本数达最优,线性收敛。
Mahdi Soltanolkotabi
基于ODE稳定性分析,提出三种确保深度神经网络稳定的前向传播架构。
Eldad Haber, Lars Ruthotto
提出了一种结合图卷积神经网络和循环神经网络的几何矩阵补全方法,在多个数据集上表现优异。
Federico Monti, Michael M. Bronstein, Xavier Bresson
提出原型网络用于少样本分类,通过学习类别的均值作为原型,利用欧几里得距离实现高效分类,达成SOTA性能。
Jake Snell, Kevin Swersky, Richard S. Zemel
提出超梯度下降(Hypergradient Descent)动态调整学习率,显著减少调参需求。
Atilim Gunes Baydin, Robert Cornish, David Martinez Rubio 等
提出集成梯度(Integrated Gradients)方法,满足敏感性和实现不变性,用于深度网络特征归因。
Mukund Sundararajan, Ankur Taly, Qiqi Yan
Perturbed梯度下降实现高效逃离鞍点,达成近似二阶驻点。
Chi Jin, Rong Ge, Praneeth Netrapalli 等
本研究证明SGD在多层网络中能以多项式时间学习与网络共轭核空间内函数。
Amit Daniely
提出深能量模型的软Q学习算法,提升连续空间中的探索与技能迁移能力。
Tuomas Haarnoja, Haoran Tang, Pieter Abbeel 等
本文证明在高斯输入下,带ReLU的卷积神经网络通过梯度下降可在多项式时间内达到全局最优。
Alon Brutzkus, Amir Globerson
本研究证明组合赌博中最优遗憾增长为\(\widetilde{\Theta}(k^{3/2}\sqrt{dT})\),反驳了此前的猜想。
Alon Cohen, Tamir Hazan, Tomer Koren
提出SiLU和dSiLU激活函数,结合TD(λ)和Sarsa(λ),在强化学习中实现超越DQN的性能。
Stefan Elfwing, Eiji Uchibe, Kenji Doya
提出稀疏门控专家混合层(MoE),实现模型容量提升超1000倍,参数达1370亿,显著优于现有技术。
Noam Shazeer, Azalia Mirhoseini, Krzysztof Maziarz 等