Kimi k1.5: Scaling Reinforcement Learning with LLMs

TL;DR

Kimi k1.5通过强化学习扩展LLM,取得77.5分AIME等领先成绩。

cs.AI 🔴 高级 2025-01-22 29 次浏览
Kimi Team Angang Du Bofei Gao Bowei Xing Changjiu Jiang Cheng Chen Cheng Li Chenjun Xiao Chenzhuang Du Chonghua Liao Chuning Tang Congcong Wang Dehao Zhang Enming Yuan Enzhe Lu Fengxiang Tang Flood Sung Guangda Wei Guokun Lai Haiqing Guo Han Zhu Hao Ding Hao Hu Hao Yang Hao Zhang Haotian Yao Haotian Zhao Haoyu Lu Haoze Li Haozhen Yu Hongcheng Gao Huabin Zheng Huan Yuan Jia Chen Jianhang Guo Jianlin Su Jianzhou Wang Jie Zhao Jin Zhang Jingyuan Liu Junjie Yan Junyan Wu Lidong Shi Ling Ye Longhui Yu Mengnan Dong Neo Zhang Ningchen Ma Qiwei Pan Qucheng Gong Shaowei Liu Shengling Ma Shupeng Wei Sihan Cao Siying Huang Tao Jiang Weihao Gao Weimin Xiong Weiran He Weixiao Huang Weixin Xu Wenhao Wu Wenyang He Xianghui Wei Xianqing Jia Xingzhe Wu Xinran Xu Xinxing Zu Xinyu Zhou Xuehai Pan Y. Charles Yang Li Yangyang Hu Yangyang Liu Yanru Chen Yejie Wang Yibo Liu Yidao Qin Yifeng Liu Ying Yang Yiping Bao Yulun Du Yuxin Wu Yuzhi Wang Zaida Zhou Zhaoji Wang Zhaowei Li Zhen Zhu Zheng Zhang Zhexu Wang Zhilin Yang Zhiqi Huang Zihao Huang Ziyao Xu Zonghan Yang Zongyu Lin
强化学习 大语言模型 多模态 长上下文 策略优化

核心发现

方法论

Kimi k1.5采用强化学习结合长上下文扩展,使用在线镜像下降进行策略优化。通过多模态数据训练,模型在文本和视觉任务中表现出色。关键在于不依赖复杂技术如蒙特卡洛树搜索,而是通过长上下文和策略优化提升性能。

关键结果

  • 在AIME上取得77.5分,MATH 500上96.2分,Codeforces上达到94百分位,MathVista上74.9分,均与OpenAI o1相当。
  • 短链推理模型在AIME上60.8分,MATH500上94.6分,LiveCodeBench上47.3分,超越GPT-4o和Claude Sonnet 3.5。
  • 长链推理技术提升短链推理模型性能,显著提高推理能力。

研究意义

研究展示了通过强化学习扩展大语言模型的潜力,突破了传统数据集限制。其在多模态任务中的成功应用,标志着AI在复杂推理任务中的新进展,为学术界和工业界提供了新的研究方向。

技术贡献

Kimi k1.5引入了长上下文扩展和改进的策略优化方法,简化了强化学习框架。通过多模态数据训练,模型在多个基准测试中达到领先水平,提供了新的工程可能性。

新颖性

首次将长上下文扩展应用于LLM的强化学习,简化了复杂技术的需求,提供了一种有效的策略优化方法,与现有方法相比具有显著创新。

局限性

  • 模型在特定任务上可能表现不佳,尤其是需要精细化推理的任务。
  • 长上下文处理需要较高的计算资源,可能限制实际应用。

未来方向

未来研究可探索更高效的上下文处理方法,进一步优化策略算法,并扩展至更多模态和任务。

AI 总览摘要

Kimi k1.5通过强化学习扩展大语言模型,解决了传统方法受限于静态数据集的问题。通过长上下文扩展和多模态数据训练,模型在多个基准测试中取得了领先成绩,展示了其在复杂推理任务中的潜力。

该方法采用在线镜像下降进行策略优化,结合长上下文扩展,简化了传统复杂技术的需求,如蒙特卡洛树搜索和价值函数。通过多模态训练,模型在文本和视觉任务中表现出色。

尽管取得了显著进展,Kimi k1.5仍面临计算资源需求高和特定任务表现不佳的挑战。未来研究将致力于优化上下文处理和策略算法,以扩展其应用范围。

深度分析

研究背景

近年来,大语言模型(LLM)的发展迅速,但其训练通常依赖于大量高质量数据集。传统方法如下一个词预测在计算扩展上有效,但受限于数据集的可用性。强化学习提供了新的扩展途径,通过奖励机制引导模型探索,从而突破数据集限制。

核心问题

传统LLM训练受限于静态数据集,无法充分利用动态环境中的信息。如何在不依赖复杂技术的情况下,通过强化学习扩展LLM的能力,成为亟待解决的问题。

核心创新

Kimi k1.5的核心创新在于长上下文扩展和改进的策略优化方法。通过长上下文窗口,模型能够更有效地进行推理和规划,而在线镜像下降算法则提供了稳健的策略优化。多模态数据训练进一步提升了模型的适应性。

方法详解

  • �� 长上下文扩展:将上下文窗口扩展至128k,提高推理效率。
  • �� 改进的策略优化:使用在线镜像下降算法,结合有效的采样策略和长度惩罚。
  • �� 多模态数据训练:结合文本和视觉数据,提升模型的综合推理能力。

实验设计

实验使用多个基准数据集,包括AIME、MATH 500和Codeforces。模型在这些数据集上均取得了领先成绩,验证了方法的有效性。关键超参数包括上下文窗口大小和策略优化步长。

结果分析

Kimi k1.5在多个基准测试中取得了显著成绩,如AIME上77.5分,MATH 500上96.2分,Codeforces上94百分位,展示了其在复杂推理任务中的潜力。

应用场景

该方法可应用于需要复杂推理的任务,如数学竞赛题解和代码生成。其多模态能力使其在文本和视觉任务中均表现出色。

局限与展望

尽管取得了显著进展,Kimi k1.5在特定任务上仍可能表现不佳,且长上下文处理需要较高的计算资源。未来研究将致力于优化这些方面。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。Kimi k1.5就像一个聪明的厨师助手,它不仅能记住食谱,还能根据你的口味调整菜谱。通过强化学习,它学会了在不同的食材和工具之间做出最佳选择,就像在不同的任务中找到最佳解决方案。长上下文就像它的记忆力,帮助它记住更多的步骤和细节,而策略优化则是它不断改进烹饪技巧的方法。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的游戏,Kimi k1.5就是你的游戏助手。它不仅能帮你记住游戏规则,还能根据你的游戏风格给出建议。通过强化学习,它学会了如何在不同的关卡中找到最佳策略,就像在不同的任务中找到最佳解决方案。长上下文就像它的记忆力,帮助它记住更多的游戏细节,而策略优化则是它不断改进游戏技巧的方法。

术语表

强化学习 (Reinforcement Learning)

一种通过奖励机制引导模型学习的机器学习方法。

用于扩展大语言模型的训练数据。

长上下文 (Long Context)

扩展模型的上下文窗口以提高推理能力的方法。

用于提高Kimi k1.5的推理效率。

策略优化 (Policy Optimization)

改进模型决策能力的算法。

通过在线镜像下降实现。

多模态 (Multimodal)

结合多种数据类型进行训练的方法。

用于提升模型在文本和视觉任务中的表现。

在线镜像下降 (Online Mirror Descent)

一种用于策略优化的算法。

用于改进Kimi k1.5的策略优化。

开放问题 这项研究留下的未解疑问

  • 1 如何在不增加计算资源的情况下进一步扩展上下文窗口?
  • 2 如何提高模型在特定任务上的表现?

应用场景

近期应用

数学竞赛题解

通过强化学习提升模型在数学题解上的表现,适用于竞赛和教育领域。

代码生成

利用多模态能力,提升模型在代码生成任务中的表现,适用于软件开发。

远期愿景

通用人工智能

通过不断优化策略和上下文处理,推动通用人工智能的发展。

原文摘要

Language model pretraining with next token prediction has proved effective for scaling compute but is limited to the amount of available training data. Scaling reinforcement learning (RL) unlocks a new axis for the continued improvement of artificial intelligence, with the promise that large language models (LLMs) can scale their training data by learning to explore with rewards. However, prior published work has not produced competitive results. In light of this, we report on the training practice of Kimi k1.5, our latest multi-modal LLM trained with RL, including its RL training techniques, multi-modal data recipes, and infrastructure optimization. Long context scaling and improved policy optimization methods are key ingredients of our approach, which establishes a simplistic, effective RL framework without relying on more complex techniques such as Monte Carlo tree search, value functions, and process reward models. Notably, our system achieves state-of-the-art reasoning performance across multiple benchmarks and modalities -- e.g., 77.5 on AIME, 96.2 on MATH 500, 94-th percentile on Codeforces, 74.9 on MathVista -- matching OpenAI's o1. Moreover, we present effective long2short methods that use long-CoT techniques to improve short-CoT models, yielding state-of-the-art short-CoT reasoning results -- e.g., 60.8 on AIME, 94.6 on MATH500, 47.3 on LiveCodeBench -- outperforming existing short-CoT models such as GPT-4o and Claude Sonnet 3.5 by a large margin (up to +550%).

cs.AI cs.LG