21 尚硅谷大模型技术之 LLM
学习理念:这是整门课程理论最深的章节,没有之一。6 天课程覆盖了从 GPT-1 到 ChatGPT 的完整演进、Transformer 架构的每个组件演进路线(MHA→GQA、ReLU→SwiGLU、PostNorm→PreNorm、RoPE)、手写 GPT2/Qwen3 完整代码、SFT/DPO 微调实现、以及 vLLM 推理优化。建议按"理论 → 代码 → 微调 → 推理"的顺序阅读,遇到数学推导(RoPE、DPO loss)可以直接跳过,不影响理解代码。
全文阅读路线:README(5min)→ 01 理论基础(30min)→ 02 代码解读(30min)→ 03 SFT(20min)→ 04 DPO+优化(20min)→ 05 框架实战(15min)→ 06 推理(10min)
本节 AI 替代率:~80% | 人工干预率:~20%
| 角色 | 能力范围 |
|---|---|
| 🤖 AI 擅长 | 解释 Transformer 组件原理、生成训练代码骨架、对比微调方案选型 |
| 👤 人类需理解 | RoPE 的数学动机(相对位置编码 vs 绝对位置编码)、DPO 损失函数的设计意图、ZeRO 的内存分布策略 |
零、课程全景
一、知识重复标记
| 知识点 | 首次出现 | 第几次学 | 建议 |
|---|---|---|---|
| Transformer 结构 | Ch08 | 🟢 第 2 次 | 只看架构差异,不重复基础 |
| 自注意力机制 | Ch08/Ch11 | 🔵 第 3 次 | 理解即可,重点看 KV Cache |
| 位置编码 | Ch08 | 🔵 第 3 次 | 重点看 RoPE 的旋转矩阵 |
| GPT-2 结构 | Ch08 | 🟢 第 2 次 | 对照 Ch08 代码看差异 |
| MoE 机制 | Ch09 | 🟢 第 2 次 | 了解即可 |
| SFT 微调 | 🔥 全新 | 🔴 第 1 次 | 完整学——本章最大增量 |
| DPO 偏好优化 | 🔥 全新 | 🔴 第 1 次 | 完整学——面试常考 |
| LoRA/QLoRA | 🔥 全新 | 🔴 第 1 次 | 完整学——实战必备 |
| vLLM 推理 | 🔥 全新 | 🔴 第 1 次 | 了解思想即可 |
二、学习路径
| 优先级 | 时间 | 内容 | 说明 |
|---|---|---|---|
| 🔥 | 5 min | 📄 README.md 通读 | 决定哪些重点、哪些跳过 |
| 🔥 | 20 min | 📄 01_LLM理论基础.md | 🔴 RoPE / GQA / SwiGLU 是面试常考 |
| 🔥 | 30 min | 📄 02_模型结构代码解读.md | 🔴 看完能独立手写 GPT2/Qwen3 |
| 🔥 | 20 min | 📄 03_监督微调SFT.md | 🔴 理解 loss mask + 训练循环 |
| 🟡 | 15 min | 📄 04_DPO与训练优化.md | ⚠️ DPO loss 推导可跳过 |
| 🟠 | 15 min | 📄 05_微调框架实战.md | 🔵 实际使用再看 |
| 🟠 | 10 min | 📄 06_推理优化vLLM.md | 🔵 了解Continuous Batching 思想 |
| 🔴 | — | 所有视频 | 跳过 |
三、AI 协作指南
本文档看完后,以下问题直接问 AI:
Q: "RoPE 旋转位置编码的旋转矩阵是怎么推导的?给出手算过程"
Q: "帮我生成一个 GPT2 风格的 MultiHeadAttention 实现,带 KV Cache"
Q: "SFT 训练中 answer mask 是怎么工作的?为什么只计算 assistant 部分的 loss?"
Q: "DPO 和 RLHF 有什么区别?DPO 为什么不需要单独训练 reward model?"
Q: "LoRA 的 r 和 alpha 参数怎么选?不同值的实际效果差异"
Q: "vLLM 的 Continuous Batching 和传统 Static Batching 有什么区别?"
AI 能做的:
- 手写完整 GPT2/Qwen3 模型代码
- 解释 RoPE、GQA、SwiGLU 的数学原理
- 生成 SFT/DPO 训练脚本骨架
- 推荐针对特定显存大小的微调方案四、附录:原始资料索引
| 对应课程 | 网盘路径 |
|---|---|
| day01(理论基础+代码) | E:\...\21_LLM技术\4.视频\day01\ |
| day02(SFT微调) | E:\...\21_LLM技术\4.视频\day02\ |
| day03(DPO+优化) | E:\...\21_LLM技术\4.视频\day03\ |
| day04(TRL+LoRA) | E:\...\21_LLM技术\4.视频\day04\ |
| day05(QLoRA+框架) | E:\...\21_LLM技术\4.视频\day05\ |
| day06(vLLM推理) | E:\...\21_LLM技术\4.视频\day06\ |
| 代码 | E:\...\21_LLM技术\3.代码\fine_tune_proj\ |
| 笔记 | E:\...\21_LLM技术\1.笔记\尚硅谷大模型技术之LLM-V1.1.md |