Talk2Car: Taking Control of Your Self-Driving Car
提出Talk2Car数据集,结合自然语言指令与城市场景,评估多模型识别目标的性能。
Thierry Deruyttere, Simon Vandenhende, Dusan Grujicic 等
提出Talk2Car数据集,结合自然语言指令与城市场景,评估多模型识别目标的性能。
Thierry Deruyttere, Simon Vandenhende, Dusan Grujicic 等
引入Jericho环境,研究互动小说游戏中语言代理的表现,提升10.7%得分。
Matthew Hausknecht, Prithviraj Ammanabrolu, Marc-Alexandre Côté 等
DeepProbLog结合神经网络与概率逻辑,支持符号与子符号推理,端到端训练,创新融合深度学习与逻辑推理。
Robin Manhaeve, Sebastijan Dumančić, Angelika Kimmig 等
提出Attainable Utility Preservation (AUP)方法,通过保持多目标优化能力降低奖励错设风险。
Alexander Matt Turner, Dylan Hadfield-Menell, Prasad Tadepalli
提出基于假设-保证推理的深度学习自主系统形式验证方法,结合聚类分析实现DNN区域安全性保证。
Corina S. Pasareanu, Divya Gopinath, Huafeng Yu
BabyAI以MiniGrid、行为克隆和PPO评估语言组合学习;仅IL也需8.4k–409k示范。
Maxime Chevalier-Boisvert, Dzmitry Bahdanau, Salem Lahlou 等
提出CURIOUS算法,结合模块化UVFA和内在学习进展驱动的自我调节,提升多目标自主学习能力。
Cédric Colas, Pierre Fournier, Olivier Sigaud 等
本文提出了SPL指标,统一化导航任务评估,促进三维环境中的智能体研究。
Peter Anderson, Angel Chang, Devendra Singh Chaplot 等
提出低秩多模态融合方法,在情感分析等任务中显著降低计算复杂度。
Zhun Liu, Ying Shen, Varun Bharadhwaj Lakshminarasimhan 等
提出TD3算法,基于双Q学习减少连续控制中的函数逼近误差,显著提升OpenAI gym性能。
Scott Fujimoto, Herke van Hoof, David Meger
提出Workflow-Guided Exploration(WGE)提升网页任务RL样本效率,成功率超100倍,采用DOMNET架构。
Evan Zheran Liu, Kelvin Guu, Panupong Pasupat 等
PDDLStream结合符号规划与黑盒采样,通过优化自适应策略提升复杂机器人任务求解效率。
Caelan Reed Garrett, Tomás Lozano-Pérez, Leslie Pack Kaelbling
综述SRL:AE/E2C/ICM等在低维状态上提升控制与RL效率
Timothée Lesort, Natalia Díaz-Rodríguez, Jean-François Goudou 等
DeepMind控制套件提供标准化连续控制任务,用于强化学习性能评测,基于MuJoCo引擎,涵盖多领域。
Yuval Tassa, Yotam Doron, Alistair Muldal 等
AlphaZero通过自我对弈,基于深度神经网络和蒙特卡洛树搜索,在24小时内超越人类顶尖水平,涵盖国际象棋、将棋和围棋。
David Silver, Thomas Hubert, Julian Schrittwieser 等
提出基于压缩的宏动作发现框架,通过样本轨迹生成、评估与多样性筛选,提升RL在相关任务中的学习效率。
Francisco M. Garcia, Bruno C. da Silva, Philip S. Thomas
通过自我对弈训练多智能体,生成复杂行为,超越环境复杂度。
Trapit Bansal, Jakub Pachocki, Szymon Sidor 等
提出混合精度训练技术,采用FP16存储,结合FP32主权重和损失缩放,确保模型精度。
Paulius Micikevicius, Sharan Narang, Jonah Alben 等
提出端到端学习模型用于多轮谈判,结合对话滚动规划显著提升表现。
Mike Lewis, Denis Yarats, Yann N. Dauphin 等
提出低影响AI定义,通过偏差函数和世界粗粒化确保AI影响有限,兼顾有用性。
Stuart Armstrong, Benjamin Levinstein