外观
DeepSeek-R1 (2025) - 强化学习激发大模型推理能力详解
约 2288 字大约 8 分钟
论文DeepSeekDeepSeek-R1推理模型
论文基本信息
- 标题: DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- 作者: DeepSeek-AI et al.
- 年份: 2025
- 发表: arXiv:2501.12948;Nature 2025
- 论文链接: arXiv论文
- Nature版本: DeepSeek-R1 incentivizes reasoning in LLMs through reinforcement learning
- 官方代码与模型: DeepSeek-R1 GitHub
为什么值得读
DeepSeek-R1 是 2025 年最值得沉淀的一篇推理模型论文。它的重要性不只在于模型效果,而在于把一个关键问题推到了台前:大模型复杂推理能力是否可以主要通过强化学习激发出来,而不是完全依赖人工标注的推理轨迹?
这篇论文给出了两个层次的答案:
- DeepSeek-R1-Zero:从基础模型出发,直接使用大规模强化学习训练,不先做监督微调,观察到自我反思、验证、策略调整等推理行为自然涌现。
- DeepSeek-R1:在 R1-Zero 的基础上加入冷启动数据、多阶段训练、拒绝采样和后续对齐,解决可读性、语言混杂和通用能力退化等问题。
核心贡献
- 验证纯强化学习路线的潜力:R1-Zero 展示了只用强化学习也能显著提升复杂推理能力。
- 提出可落地的多阶段推理模型训练管线:冷启动、推理强化学习、拒绝采样、监督微调和再强化学习组合成完整流程。
- 推动开源推理模型普及:开放 DeepSeek-R1-Zero、DeepSeek-R1,以及基于 Qwen / Llama 蒸馏出的多个小模型。
- 证明推理能力可以被蒸馏:大型推理模型生成的推理数据,可以迁移到 1.5B 到 70B 级别的稠密模型上。
训练路线总览
| 阶段 | 目标 | 产物 |
|---|---|---|
| 基础模型 | 以 DeepSeek-V3-Base 为起点 | 可继续后训练的 base 模型 |
| R1-Zero | 直接用强化学习验证推理涌现 | DeepSeek-R1-Zero |
| 冷启动 | 改善推理格式、可读性和语言一致性 | 初始推理 SFT 模型 |
| 推理 RL | 强化数学、代码、逻辑任务表现 | 更强的推理模型 |
| 拒绝采样 | 生成并筛选高质量推理数据 | 新的监督数据 |
| 通用对齐 | 混入写作、问答、安全等数据 | 能力更均衡的模型 |
| 最终 RL | 兼顾推理正确性和人类偏好 | DeepSeek-R1 |
| 蒸馏 | 把推理能力迁移到小模型 | Qwen / Llama 蒸馏模型 |
DeepSeek-R1-Zero:先看能力边界
R1-Zero 的目标是验证一个极端设定:不先提供人工书写的推理示范,直接用强化学习奖励去拉动模型能力。论文观察到几个重要现象:
- 模型会逐步生成更长、更结构化的推理过程。
- 在复杂数学和代码任务上,模型会出现自我检查与反思行为。
- 纯 RL 训练能提升推理,但输出可读性和语言一致性不稳定。
这一步的价值在于:它证明了结果奖励本身就能诱导部分推理策略。但它还不是直接可用的产品化训练方案。
DeepSeek-R1:把能力做成可用系统
R1 在 R1-Zero 的发现上补齐工程化训练链路:
- 冷启动数据:先让模型学会更清晰、可读的推理格式。
- 面向推理的强化学习:继续强化数学、代码、逻辑任务表现。
- 拒绝采样:用中间模型生成候选答案,再筛掉低质量样本。
- 通用能力补齐:混入写作、问答、安全和语言一致性数据。
- 最终强化学习:兼顾推理正确性、可读性和人类偏好。
GRPO 的直觉
论文采用的核心 RL 框架是 GRPO(Group Relative Policy Optimization)。可以把它理解成 PPO 的轻量替代思路:同一个问题采样一组答案,用组内相对分数估计优势,而不是额外训练一个价值模型。
一个简化流程是:
- 对同一个问题采样多个回答。
- 用规则奖励或模型奖励给每个回答打分。
- 在组内归一化分数,得到相对优势。
- 用相对优势更新策略模型。
它适合数学、代码这类任务,因为这些任务更容易设计可验证奖励:
- 数学题可以检查最终答案是否正确。
- 代码题可以跑测试用例。
- 格式奖励可以约束模型输出推理和答案的结构。
奖励设计
R1 的奖励不是简单地要求回答更像人类,而是尽量把任务结果变成可检查信号。
准确性奖励
对数学题,检查最终答案是否与标准答案一致。对代码题,运行测试用例并根据通过情况打分。
def accuracy_reward(sample):
"""
示意代码:真实训练会处理答案抽取、等价判断、测试隔离等细节。
"""
if sample.task_type == "math":
return float(normalize(sample.answer) == normalize(sample.ground_truth))
if sample.task_type == "code":
return run_unit_tests(sample.generated_code, sample.tests)
return 0.0格式奖励
格式奖励约束模型把推理过程和最终答案分开,避免输出不可解析。
def format_reward(text: str) -> float:
has_reasoning = "<think>" in text and "</think>" in text
has_answer = "<answer>" in text and "</answer>" in text
return 1.0 if has_reasoning and has_answer else 0.0这个奖励本身不判断内容对错,但它降低了训练和评估成本:只要结构稳定,后续答案抽取、自动评分和蒸馏都会更可靠。
关键启发
1. 推理能力可以被结果奖励激发
过去常见假设是:要训练模型推理,就需要大量人工标注的推理链。R1-Zero 的实验说明,至少在可验证任务上,模型可以从结果奖励中学出中间推理策略。
这并不意味着监督推理数据不重要。R1 的最终路线仍然使用冷启动和监督数据。更准确的结论是:监督数据负责稳定格式和行为,强化学习负责向更高能力边界推进。
2. 推理模型训练要区分能力和可用性
R1-Zero 有能力突破,但不够可用;R1 通过多阶段训练把能力变成更稳定的系统。对实际项目来说,这个区分很重要:
- 能力训练关注难题正确率。
- 产品可用性关注语言一致性、输出格式、安全和通用问答。
- 蒸馏关注把昂贵推理迁移到低成本模型。
3. 可验证任务是推理 RL 的入口
数学、代码、逻辑证明等任务天然适合强化学习,因为奖励更明确。开放域问答、创意写作、安全偏好则更难用纯规则定义,需要偏好模型或人工评估补充。
与现有论文的关系
- Attention Is All You Need:提供 Transformer 架构基础。
- GPT-2:展示生成式预训练和零样本能力。
- DPO:代表偏好对齐的轻量化路线。
- DeepSeek V3.2:代表高效大模型架构和训练规模。
- DeepSeek-R1:把重点转向推理时计算、结果奖励和多阶段后训练。
实践落地建议
如果要在自己的模型或业务场景里借鉴 R1,优先考虑以下路径:
- 先找可验证任务:数学、SQL、代码生成、配置生成、规则推理都适合。
- 设计稳定答案抽取:没有可靠抽取,就没有可靠奖励。
- 从 SFT 冷启动开始:先教格式,再做强化学习。
- 用拒绝采样扩数据:让强模型生成多个候选,再筛选高质量样本。
- 小模型优先蒸馏:业务落地通常更需要成本可控的模型,而不是最大模型。
局限性
- 奖励覆盖有限:可验证任务容易做,开放任务仍然困难。
- 推理长度成本高:更长推理通常带来更高推理成本,不总是划算。
- 格式可能被奖励投机:模型可能学会形式正确但内容空洞的输出。
- 安全与偏好仍需补齐:强推理能力不等于行为一定安全。
- 复现实验成本高:完整训练链路涉及大规模模型、采样和评估基础设施。
一句话总结
DeepSeek-R1 的核心意义是:它把大模型后训练从“让模型更会聊天”推进到“用可验证奖励系统性激发复杂推理能力”,是理解 2025 年推理模型浪潮绕不开的一篇论文。
资源链接
更新日志
2026/7/24 14:15
查看所有更新日志
1a4c1-docs: 更新论文板块与更新日志于
版权所有
版权归属:huanghx02