22 强化学习与 RLHF
学习理念:这本书实际覆盖三大块——经典 RL、RLHF(LLM 对齐)、多模态。对 Agent 开发而言,RLHF 部分(DPO/PPO-RLHF/GRPO)是核心,经典 RL 了解概念即可,多模态后面有需要再回来看。
全文阅读路线:README(5min)→ 基础概念(15min)→ PPO/GRPO 原理(15min)→ RLHF 深入(25min)→ GRPO 实战(15min)→ 多模态概览(10min)
本节 AI 替代率:~80% | 人工干预率:~20%
| 角色 | 能力范围 |
|---|---|
| 🤖 AI 擅长 | 解释 RL 基础概念、生成 PPO/GRPO 代码骨架 |
| 👤 人类需理解 | RLHF 为什么需要三个模型(Actor/Reference/Reward)、PPO 裁剪目标的动机 |
全书结构总览
Part I 强化学习基础(Ch1-6) → 🟡 理解概念
Part II RLHF:LLM 对齐(Ch7-10) → 🔴 必须深入
Part III 多模态(Ch11-18) → 🟢 了解即可学习路径
| 优先级 | 时间 | 文档 | 说明 |
|---|---|---|---|
| 🔥 | 5 min | 📄 READEME.md 通读 | 决定哪些跳过 |
| 🟡 | 15 min | 📄 强化学习基础与策略梯度法 | 🟡 了解概念即可 |
| 🟡 | 15 min | 📄 PPO 与 GRPO 原理 | 🟡 理解核心思想 |
| 🔥 | 25 min | 📄 RLHF:DPO 与 PPO-RLHF | 🔴 面试常考,重点看 PPO 在 LLM 里的应用 |
| 🔥 | 15 min | 📄 GRPO 与 DeepSeek-R1 | 🔴 DeepSeek 热门话题 |
| 🟢 | 10 min | 📄 多模态基础 | 🟢 了解有什么技术即可 |
代码文件索引
| 优先级 | 文件 | 路径 | 内容 |
|---|---|---|---|
| 🟢 P2 | 01~05_reinforce*.py | 3.代码/rl_codes/ | CartPole 策略梯度法——经典 RL,了解概念 |
| 🟡 P1 | 06_actor_critic.py | 3.代码/rl_codes/ | Actor-Critic 框架——RLHF 的前置知识 |
| 🔥 P0 | 07_ppo_basic.py | 3.代码/rl_codes/ | PPO 实现——理解 clip 机制 |
| 🔥 P0 | 08_ppo_train.py | 3.代码/rl_codes/ | PPO 完整训练——RLHF 核心 |
| 🔥 P0 | 09_grpo_demo.py | 3.代码/rl_codes/ | GRPO 演示——DeepSeek-R1 基础 |