Skip to content

22 强化学习与 RLHF

学习理念:这本书实际覆盖三大块——经典 RL、RLHF(LLM 对齐)、多模态。对 Agent 开发而言,RLHF 部分(DPO/PPO-RLHF/GRPO)是核心,经典 RL 了解概念即可,多模态后面有需要再回来看。

全文阅读路线:README(5min)→ 基础概念(15min)→ PPO/GRPO 原理(15min)→ RLHF 深入(25min)→ GRPO 实战(15min)→ 多模态概览(10min)

本节 AI 替代率:~80% | 人工干预率:~20%

角色能力范围
🤖 AI 擅长解释 RL 基础概念、生成 PPO/GRPO 代码骨架
👤 人类需理解RLHF 为什么需要三个模型(Actor/Reference/Reward)、PPO 裁剪目标的动机

全书结构总览

Part I  强化学习基础(Ch1-6)     → 🟡 理解概念
Part II  RLHF:LLM 对齐(Ch7-10) → 🔴 必须深入
Part III 多模态(Ch11-18)        → 🟢 了解即可

学习路径

优先级时间文档说明
🔥5 min📄 READEME.md 通读决定哪些跳过
🟡15 min📄 强化学习基础与策略梯度法🟡 了解概念即可
🟡15 min📄 PPO 与 GRPO 原理🟡 理解核心思想
🔥25 min📄 RLHF:DPO 与 PPO-RLHF🔴 面试常考,重点看 PPO 在 LLM 里的应用
🔥15 min📄 GRPO 与 DeepSeek-R1🔴 DeepSeek 热门话题
🟢10 min📄 多模态基础🟢 了解有什么技术即可

代码文件索引

优先级文件路径内容
🟢 P201~05_reinforce*.py3.代码/rl_codes/CartPole 策略梯度法——经典 RL,了解概念
🟡 P106_actor_critic.py3.代码/rl_codes/Actor-Critic 框架——RLHF 的前置知识
🔥 P007_ppo_basic.py3.代码/rl_codes/PPO 实现——理解 clip 机制
🔥 P008_ppo_train.py3.代码/rl_codes/PPO 完整训练——RLHF 核心
🔥 P009_grpo_demo.py3.代码/rl_codes/GRPO 演示——DeepSeek-R1 基础

OPC 超级个体实战指南