Modelling transition dynamics in MDPs with RKHS embeddings
提出基于RKHS嵌入的非参数MDP转移动态建模方法,避免密度估计,提升策略优化性能。
Steffen Grunewalder, Guy Lever, Luca Baldassarre 等
提出基于RKHS嵌入的非参数MDP转移动态建模方法,避免密度估计,提升策略优化性能。
Steffen Grunewalder, Guy Lever, Luca Baldassarre 等
提出一种基于训练数据学习专家集的在线序列预测算法,有效提升短序列预测性能。
Elad Eban, Aharon Birnbaum, Shai Shalev-Shwartz 等
提出条件均值嵌入的等价性,将其视为向量值回归,显著提升收敛速率至O(log(n)/n),实现稀疏化与理论保证。
Steffen Grünewälder, Guy Lever, Luca Baldassarre 等
本文系统分析了随机与非随机多臂赌博机的遗憾界限,提出UCB和Exp3算法的性能保证。
Sébastien Bubeck, Nicolò Cesa-Bianchi
Scikit-learn是Python中的机器学习库,集成支持向量机、PCA等算法,强调易用性和性能。
Fabian Pedregosa, Gaël Varoquaux, Alexandre Gramfort 等
利用大规模无监督学习训练9层稀疏自编码器,实现面部等高层特征检测,提升ImageNet识别率70%。
Quoc V. Le, Marc'Aurelio Ranzato, Rajat Monga 等
本研究分析0-1损失在噪声容忍中的优势,显示其在非均匀噪声下的稳健性。
Naresh Manwani, P. S. Sastry
提出一种基于加权的模型无关风险敏感强化学习算法,用于满足约束条件的控制任务。
P. Geibel, F. Wysotzki
提出基于线性模型的Gossip学习,结合模型随机游走与集成,保证分布式数据隐私与低通信成本。
Róbert Ormándi, István Hegedüs, Márk Jelasity
提出统一神经网络架构,利用大量无标注数据实现多项NLP任务,无需任务特定工程。
Ronan Collobert, Jason Weston, Leon Bottou 等
贝叶斯优化通过高效采样策略在昂贵目标函数中找到最大值,结合高斯过程模型。
Eric Brochu, Vlad M. Cora, Nando de Freitas
提出基于上下文的Bandit算法LinUCB,用于个性化新闻推荐,提升点击率12.5%。
Lihong Li, Wei Chu, John Langford 等
Exp4.P算法在上下文赌博机问题中实现了监督学习级别的保证,显著降低了遗憾。
Alina Beygelzimer, John Langford, Lihong Li 等
提出基于谱方法的矩阵补全算法,能用O(rn)样本实现低误差重建。
Raghunandan H. Keshavan, Andrea Montanari, Sewoong Oh
线性参数化的bandit算法通过探索与利用交替策略实现Θ(r√T)的累积后悔与贝叶斯风险。
Paat Rusmevichientong, John N. Tsitsiklis
提出基于核方法的两样本检验框架(MMD),实现高效分布差异检测。
Arthur Gretton, Karsten Borgwardt, Malte J. Rasch 等
符合预测(Conformal Prediction)利用历史数据提供误差概率为ε的可信预测集,适用于多种模型。
Glenn Shafer, Vladimir Vovk