排序: 最新 热门 引用
cs.CL 2401.10020

Self-Rewarding Language Models

提出自我奖励语言模型,通过迭代DPO训练,Llama 2 70B在AlpacaEval 2.0中超越Claude 2、Gemini Pro和GPT-4 0613。

Weizhe Yuan, Richard Yuanzhe Pang, Kyunghyun Cho 等

2024-01-18 693 引用 27