Skip to content

21 尚硅谷大模型技术之 LLM

学习理念:这是整门课程理论最深的章节,没有之一。6 天课程覆盖了从 GPT-1 到 ChatGPT 的完整演进、Transformer 架构的每个组件演进路线(MHA→GQA、ReLU→SwiGLU、PostNorm→PreNorm、RoPE)、手写 GPT2/Qwen3 完整代码、SFT/DPO 微调实现、以及 vLLM 推理优化。建议按"理论 → 代码 → 微调 → 推理"的顺序阅读,遇到数学推导(RoPE、DPO loss)可以直接跳过,不影响理解代码。

全文阅读路线:README(5min)→ 01 理论基础(30min)→ 02 代码解读(30min)→ 03 SFT(20min)→ 04 DPO+优化(20min)→ 05 框架实战(15min)→ 06 推理(10min)

本节 AI 替代率:~80% | 人工干预率:~20%

角色能力范围
🤖 AI 擅长解释 Transformer 组件原理、生成训练代码骨架、对比微调方案选型
👤 人类需理解RoPE 的数学动机(相对位置编码 vs 绝对位置编码)、DPO 损失函数的设计意图、ZeRO 的内存分布策略

零、课程全景


一、知识重复标记

知识点首次出现第几次学建议
Transformer 结构Ch08🟢 第 2 次只看架构差异,不重复基础
自注意力机制Ch08/Ch11🔵 第 3 次理解即可,重点看 KV Cache
位置编码Ch08🔵 第 3 次重点看 RoPE 的旋转矩阵
GPT-2 结构Ch08🟢 第 2 次对照 Ch08 代码看差异
MoE 机制Ch09🟢 第 2 次了解即可
SFT 微调🔥 全新🔴 第 1 次完整学——本章最大增量
DPO 偏好优化🔥 全新🔴 第 1 次完整学——面试常考
LoRA/QLoRA🔥 全新🔴 第 1 次完整学——实战必备
vLLM 推理🔥 全新🔴 第 1 次了解思想即可

二、学习路径

优先级时间内容说明
🔥5 min📄 README.md 通读决定哪些重点、哪些跳过
🔥20 min📄 01_LLM理论基础.md🔴 RoPE / GQA / SwiGLU 是面试常考
🔥30 min📄 02_模型结构代码解读.md🔴 看完能独立手写 GPT2/Qwen3
🔥20 min📄 03_监督微调SFT.md🔴 理解 loss mask + 训练循环
🟡15 min📄 04_DPO与训练优化.md⚠️ DPO loss 推导可跳过
🟠15 min📄 05_微调框架实战.md🔵 实际使用再看
🟠10 min📄 06_推理优化vLLM.md🔵 了解Continuous Batching 思想
🔴所有视频跳过

三、AI 协作指南

本文档看完后,以下问题直接问 AI:

Q: "RoPE 旋转位置编码的旋转矩阵是怎么推导的?给出手算过程"
Q: "帮我生成一个 GPT2 风格的 MultiHeadAttention 实现,带 KV Cache"
Q: "SFT 训练中 answer mask 是怎么工作的?为什么只计算 assistant 部分的 loss?"
Q: "DPO 和 RLHF 有什么区别?DPO 为什么不需要单独训练 reward model?"
Q: "LoRA 的 r 和 alpha 参数怎么选?不同值的实际效果差异"
Q: "vLLM 的 Continuous Batching 和传统 Static Batching 有什么区别?"

AI 能做的:
  - 手写完整 GPT2/Qwen3 模型代码
  - 解释 RoPE、GQA、SwiGLU 的数学原理
  - 生成 SFT/DPO 训练脚本骨架
  - 推荐针对特定显存大小的微调方案

四、附录:原始资料索引

对应课程网盘路径
day01(理论基础+代码)E:\...\21_LLM技术\4.视频\day01\
day02(SFT微调)E:\...\21_LLM技术\4.视频\day02\
day03(DPO+优化)E:\...\21_LLM技术\4.视频\day03\
day04(TRL+LoRA)E:\...\21_LLM技术\4.视频\day04\
day05(QLoRA+框架)E:\...\21_LLM技术\4.视频\day05\
day06(vLLM推理)E:\...\21_LLM技术\4.视频\day06\
代码E:\...\21_LLM技术\3.代码\fine_tune_proj\
笔记E:\...\21_LLM技术\1.笔记\尚硅谷大模型技术之LLM-V1.1.md

OPC 超级个体实战指南