AgentTuning: Enabling Generalized Agent Abilities for LLMs
AgentTuning提升LLM的通用代理能力,AgentLM-70B在未见任务上与GPT-3.5-turbo相当。
Aohan Zeng, Mingdao Liu, Rui Lu 等
AgentTuning提升LLM的通用代理能力,AgentLM-70B在未见任务上与GPT-3.5-turbo相当。
Aohan Zeng, Mingdao Liu, Rui Lu 等
本研究提出多头注意力的优化与泛化分析,证明多头机制在训练收敛和泛化中具有优势。
Puneesh Deora, Rouzbeh Ghaderi, Hossein Taheri 等
提出Safety-Gymnasium环境套件与SafePO算法库,推动安全强化学习发展。
Jiaming Ji, Borong Zhang, Jiayi Zhou 等
提出CAT框架,通过环境增强和概率分解实现安全端到端驾驶的闭环对抗训练,提升安全性。
Linrui Zhang, Zhenghao Peng, Quanyi Li 等
本研究系统分析GPT-4在图着色问题中的迭代提示效果,发现其自我批评能力有限。
Kaya Stechly, Matthew Marquez, Subbarao Kambhampati
本研究利用可解释性方法分析指令微调模型中的性别偏见,提出少样本引导去偏策略,显著改善翻译中的性别公平。
Giuseppe Attanasio, Flor Miriam Plaza-del-Arco, Debora Nozza 等
SPEED通过推测执行加速Transformer解码,显著减少延迟。
Coleman Hooper, Sehoon Kim, Hiva Mohammadzadeh 等
DynamiCrafter以视频扩散先验和双重图像条件生成开放域动画,但所给文本未报告具体数值。
Jinbo Xing, Menghan Xia, Yong Zhang 等
提出PoDS架构,提升Cityscapes-OOD和BDD100K-OOD数据集的POD-Q指标。
Rohit Mohan, Kiran Kumaraswamy, Juana Valeria Hurtado 等
提出Dual Bank Normalization(DBNORM)框架,有效缓解跨模态检索中的中心性问题,提升性能。
Yimu Wang, Xiangru Jian, Bo Xue
DIP-3D利用稀疏三维点云和人体姿态实现潜水员指向目标的三维定位,提升多目标识别能力。
Chelsey Edge, Demetrious Kutzke, Megdalia Bromhal 等
Self-RAG通过自我反思实现检索、生成与批评,显著提升事实准确性和多样性。
Akari Asai, Zeqiu Wu, Yizhong Wang 等
提出一种基于k-NN的非参数条件独立性检验新方法,增强混合连续与类别变量的依赖检测鲁棒性。
Oana-Iuliana Popescu, Andreas Gerhardus, Jakob Runge
ReMax基于REINFORCE,无需价值模型,显著降低GPU内存和训练时间,达7B模型SOTA。
Ziniu Li, Tian Xu, Yushun Zhang 等
NeMo Guardrails工具包通过可编程轨道实现LLM应用的可控性和安全性。
Traian Rebedea, Razvan Dinu, Makesh Sreedhar 等
提出PerCo模型,利用迭代扩散模型实现超低比特率图像无损还原,压缩率达0.003比特/像素。
Marlène Careil, Matthew J. Muckley, Jakob Verbeek 等
CLIN利用持续记忆和因果抽象实现无参数更新的任务快速适应与迁移,性能超越SOTA。
Bodhisattwa Prasad Majumder, Bhavana Dalvi Mishra, Peter Jansen 等
提出衡量大模型偏好冗长回答的指标,发现GPT-4偏好更长答案。
Keita Saito, Akifumi Wachi, Koki Wataoka 等
DaROL方法通过数据正则化解决PDE逆问题,提升求解效率。
Ke Chen, Chunmei Wang, Haizhao Yang
大语言模型遗忘技术,通过梯度上升减少不良行为,计算效率高。
Yuanshun Yao, Xiaojun Xu, Yang Liu