Towards Resolving Unidentifiability in Inverse Reinforcement Learning
提出一种算法,通过在多个环境中观察行为,解决逆强化学习中的不可识别性问题。
Kareem Amin, Satinder Singh
提出一种算法,通过在多个环境中观察行为,解决逆强化学习中的不可识别性问题。
Kareem Amin, Satinder Singh
Numenta异常检测基准(NAB)提供实时流数据异常检测的标准化评估框架。
Alexander Lavin, Subutai Ahmad
MAP-Elites通过多维特征空间映射高性能解,揭示搜索空间分布。
Jean-Baptiste Mouret, Jeff Clune
提出一套基础问答任务评估AI理解能力,扩展Memory Networks模型,揭示模型在推理任务中的不足。
Jason Weston, Antoine Bordes, Sumit Chopra 等
提出基于多核并行的高维因果发现PC算法,有效缩短运行时间。
Thuc Duy Le, Tao Hoang, Jiuyong Li 等
Falling Rule Lists是一种分类模型,使用有序的if-then规则列表,成功概率单调递减。
Fulton Wang, Cynthia Rudin
记忆网络结合推理与长期记忆,提升问答任务表现。
Jason Weston, Sumit Chopra, Antoine Bordes
本文提出了用于树搜索的Bandit算法,改进了UCT算法的过于乐观问题。
Pierre-Arnuad Coquelin, Remi Munos
本综述提出多目标序贯决策的三类场景,分类算法并分析其最优解特性。
Diederik Marijn Roijers, Peter Vamplew, Shimon Whiteson 等
基于集合概率的贝叶斯更新与时间一致性分析,强调矩形性条件的重要性
Peter D Grunwald, Joseph Y Halpern
提出一种在潜变量和选择偏差条件下的因果推断方法,基于条件独立性关系进行可靠推断。
Peter L. Spirtes, Christopher Meek, Thomas S. Richardson
提出基于背景知识的因果推断算法,解决因果解释存在性与共通性问题。
Christopher Meek
提出一种基于等价类的贝叶斯网络结构搜索空间,提升贪心算法性能。
David Maxwell Chickering
提出期望传播(EP)算法,结合ADF与loopy belief propagation,用于混合贝叶斯网络,优于Laplace、变分贝叶斯与蒙特卡洛。
Thomas P. Minka
提出ALE平台,评估通用AI,涵盖55+游戏,结合强化学习与规划技术。
Marc G. Bellemare, Yavar Naddaf, Joel Veness 等
提出保守PC(CPC)算法,仅依赖邻接忠实性,提升因果推断的准确性。
Joseph Ramsey, Jiji Zhang, Peter L. Spirtes
SATzilla利用经验硬度模型实现SAT实例的动态算法组合,显著提升性能。
Lin Xu, Frank Hutter, Holger H. Hoos 等
Perseus:随机点基值迭代算法,提升大规模POMDP性能
M. T. J. Spaan, N. Vlassis
Grounded Semantic Composition:Bishop任务59%正确率
P. Gorniak, D. Roy
SMOTE:合成少数类过采样技术,通过生成合成样本提升不平衡数据分类性能,显著改善AUC指标。
N. V. Chawla, K. W. Bowyer, L. O. Hall 等