排序: 最新 热门 引用
stat.ML 1503.02531

Distilling the Knowledge in a Neural Network

提出知识蒸馏技术,将集成模型的知识压缩成单一模型,显著提升MNIST和语音识别性能。

Geoffrey Hinton, Oriol Vinyals, Jeff Dean

2015-03-09 25922 引用 54
cs.LG 1502.07073

Strongly Adaptive Online Learning

提出强适应性在线学习算法,将低遗憾算法转化为在任意时间段表现接近最优。

Amit Daniely, Alon Gonen, Shai Shalev-Shwartz

2015-02-25 37
cs.LG 1502.05477

Trust Region Policy Optimization

TRPO(信赖域策略优化)通过近似理论保证单调提升,优化深层神经网络策略,实验显示在机器人控制和Atari游戏中表现优异。

John Schulman, Sergey Levine, Philipp Moritz 等

2015-02-19 8275 引用 48