From Bandits to Experts: A Tale of Domination and Independence
提出Exp3-DOM算法,基于支配集实现有向观察图的最优遗憾界(不超过50字)
Noga Alon, Nicolò Cesa-Bianchi, Claudio Gentile 等
提出Exp3-DOM算法,基于支配集实现有向观察图的最优遗憾界(不超过50字)
Noga Alon, Nicolò Cesa-Bianchi, Claudio Gentile 等
提出Black-Box算法BOLD和QPM-D,解决延迟反馈下的在线学习,理论界和实践均有突破。
Pooria Joulani, András György, Csaba Szepesvári
提出GP-UCB-PE算法,结合UCB与纯探索,批量优化高效,理论界限优于单步方法。
Emile Contal, David Buffoni, Alexandre Robicquet 等
提出面向带切换成本和其他适应性对手的在线学习新界,获得Bandit反馈下的Ω(T^{2/3})下界。
Nicolo Cesa-Bianchi, Ofer Dekel, Ohad Shamir
使用深度学习检测机器人抓取,成功率达84%和89%。
Ian Lenz, Honglak Lee, Ashutosh Saxena
提出加权平均技术实现Projected Stochastic Subgradient的O(1/t)收敛,方法简单易行。
Simon Lacoste-Julien, Mark Schmidt, Francis Bach
通过正则化重建误差,自动编码器学习数据分布的局部特性,估计分布的梯度和Hessian矩阵。
Guillaume Alain, Yoshua Bengio
Vovk用归纳式保序预测器实现多种条件有效性,并证明精确对象条件有效性通常会导致无效的大预测集。
Vladimir Vovk
利用最优传输距离估计支持流形中的概率测度,结合量化和学习理论,提出新界限。
Guillermo D. Canas, Lorenzo Rosasco
研究因果学习对半监督学习的影响,提出假设并验证。
Bernhard Schoelkopf, Dominik Janzing, Jonas Peters 等
深度学习中的表示学习,利用自动编码器和概率模型实现特征抽取,提升模型泛化能力。
Yoshua Bengio, Aaron Courville, Pascal Vincent
提出基于RKHS嵌入的非参数MDP转移动态建模方法,避免密度估计,提升策略优化性能。
Steffen Grunewalder, Guy Lever, Luca Baldassarre 等
提出一种基于训练数据学习专家集的在线序列预测算法,有效提升短序列预测性能。
Elad Eban, Aharon Birnbaum, Shai Shalev-Shwartz 等
提出条件均值嵌入的等价性,将其视为向量值回归,显著提升收敛速率至O(log(n)/n),实现稀疏化与理论保证。
Steffen Grünewälder, Guy Lever, Luca Baldassarre 等
本文系统分析了随机与非随机多臂赌博机的遗憾界限,提出UCB和Exp3算法的性能保证。
Sébastien Bubeck, Nicolò Cesa-Bianchi
Scikit-learn是Python中的机器学习库,集成支持向量机、PCA等算法,强调易用性和性能。
Fabian Pedregosa, Gaël Varoquaux, Alexandre Gramfort 等
利用大规模无监督学习训练9层稀疏自编码器,实现面部等高层特征检测,提升ImageNet识别率70%。
Quoc V. Le, Marc'Aurelio Ranzato, Rajat Monga 等
本研究分析0-1损失在噪声容忍中的优势,显示其在非均匀噪声下的稳健性。
Naresh Manwani, P. S. Sastry
提出一种基于加权的模型无关风险敏感强化学习算法,用于满足约束条件的控制任务。
P. Geibel, F. Wysotzki
提出基于线性模型的Gossip学习,结合模型随机游走与集成,保证分布式数据隐私与低通信成本。
Róbert Ormándi, István Hegedüs, Márk Jelasity