RLTF: Reinforcement Learning from Unit Test Feedback
RLTF通过多粒度单元测试反馈在线优化大语言模型,提升代码生成性能。
Jiate Liu, Yiqin Zhu, Kaiwen Xiao 等
RLTF通过多粒度单元测试反馈在线优化大语言模型,提升代码生成性能。
Jiate Liu, Yiqin Zhu, Kaiwen Xiao 等
提出人机共进化(Human-AI Coevolution)概念,分析推荐系统中的反馈机制及其社会影响。
Dino Pedreschi, Luca Pappalardo, Emanuele Ferragina 等
提出TaskMatrix.AI,通过连接基础模型与数百万API实现多任务协作。
Yaobo Liang, Chenfei Wu, Ting Song 等
Reflexion通过语言反馈强化LLMs,无需微调,显著提升代码和推理任务表现。
Noah Shinn, Federico Cassano, Edward Berman 等
提出安全评估框架,涵盖偏好测试、对抗攻击和风险检测,提升大模型安全性。
Jiawen Deng, Jiale Cheng, Hao Sun 等
提出基于文本引导的视频生成的通用策略,利用Diffusion模型实现多任务和长远规划,显著提升泛化能力。
Yilun Du, Mengjiao Yang, Bo Dai 等
Flan-T5通过混合提示设置提升性能,超越现有方法3-17%。
Shayne Longpre, Le Hou, Tu Vu 等
本文提出基于扩散模型的行为模仿方法,能有效捕捉人类行为的多模态分布,实验在机器人和游戏环境中表现优异。
Tim Pearce, Tabish Rashid, Anssi Kanervisto 等
LMM-Planner利用少量示例实现 grounded 高级规划,达成竞争性表现。
Chan Hee Song, Jiaman Wu, Clayton Washington 等
LaCAM是一种基于搜索的多智能体路径规划算法,能在短时间内解决数百个智能体的冲突避免问题。
Keisuke Okumura
采用强化学习(如DQN、UCB)优化语音识别和自然语言任务,提升模型适应性和效率。
Baihan Lin
提出以人为中心的AI鲁棒性框架,结合方法分类和评估体系,强调人类在提升鲁棒性中的关键作用。
Andrea Tocchetti, Lorenzo Corti, Agathe Balayn 等
基于因果模型的定性 harm 定义,利用对比因果和默认效用解决 harm 复杂例子。
Sander Beckers, Hana Chockler, Joseph Y. Halpern
提出量化伤害的新定义,结合因果模型和决策理论,评估单人和社会层面伤害。
Sander Beckers, Hana Chockler, Joseph Y. Halpern
提出基于选择-推理链的可信多步推理模型,显著提升逻辑推导和科学问答的准确率。
Antonia Creswell, Murray Shanahan
基于深度学习的对齐问题,分析AGI潜在的目标偏差与风险。
Richard Ngo, Lawrence Chan, Sören Mindermann
提出基于问答对的知识库(QEDB),结合问答生成与实体链接,提升复杂查询能力。
Wenhu Chen, William W. Cohen, Michiel De Jong 等
ProcTHOR通过程序生成虚拟环境,训练无映射、无监督模型在6项基准测试中实现SOTA。
Matt Deitke, Eli VanderBilt, Alvaro Herrasti 等
提出基于蒙特卡洛树搜索的符号物理学习器(SPL),可从有限数据中发现非线性动力学的数学表达式。
Fangzheng Sun, Yang Liu, Jian-Xun Wang 等
提出“由易到难”提示策略,结合问题分解与逐步求解,显著提升大模型复杂推理能力。
Denny Zhou, Nathanael Schärli, Le Hou 等