14 大模型概述 — LLM 共识词汇表
学习理念:这是整个课程的"地图章节"——不写代码,只建立一套共同语言。后面所有 LangChain/Agent/微调 的内容都基于这里的术语体系。目标是看完后能听懂工程师之间的日常对话:"7B 参数、Decoder-Only、预训练→SFT→RLHF、KV-Cache、RAG、MCP……"
本章不提供实操指引(纯理论模块,无可运行的代码)。
本节 AI 替代率:~85% | 人工干预率:~15%
| 角色 | 能力范围 |
|---|---|
| 🤖 AI 擅长 | 解释所有概念、做对比表格、画出架构图 |
| 👤 人类需理解 | 不同技术路线的选型判断(什么时候用 RAG 而不是微调) |
一、开篇:一图看懂 LLM 全景
词汇 → 对应后续章节:
| 术语 | 详细展开在 |
|---|---|
| 预训练 → SFT → RLHF | 本章 §二 + 第 21 章 LLM |
| RAG | 本章 §五 + 第 16 章 LangChain |
| Agent / Function Call / MCP | 本章 §五 + 第 18 章 LangGraph |
| 微调 / LoRA | 本章 §五 + 第 21 章 LLM |
| LangChain / LangGraph 工程实现 | 第 16 / 18 章 |
二、🟢 训练范式:预训练 → SFT → RLHF
这是理解 LLM 如何诞生的核心框架。
| 阶段 | 做什么 | 数据 | 产出 | 比喻 |
|---|---|---|---|---|
| 预训练 | 从海量文本学习语言规律(词语接龙) | 万亿 token 互联网文本 | 基础模型(Base Model) | 让一个婴儿听海量语言,学会"语法感觉" |
| SFT | 学会对话和指令遵循 | 高质量对话数据(<10 万条) | 对话模型(Chat Model) | 教婴儿"别人问你什么,你就回答什么" |
| RLHF | 对齐人类偏好(安全、有用) | 人类反馈数据 | 对齐模型 | 教婴儿"什么话能说、什么话不能说" |
给程序员的比喻:预训练 =
pip install了一个巨大的基础库。SFT = 按你的业务写了个 wrapper。RLHF = 加了一堆 try-catch 防止异常输出。
三、🟢 LLM 架构:为什么是 Decoder-Only?
Transformer 有三种架构路线,目前大模型几乎全部采用 Decoder-Only。
三种架构对比
| 架构 | 代表模型 | 适合 | 不适合 | 2026 年状态 |
|---|---|---|---|---|
| Encoder-Only | BERT | 文本分类、NER、句子理解 | 文本生成 | ⚠️ 仅用于 Embedding |
| Encoder-Decoder | T5、BART | 翻译、摘要 | 多轮对话 | 🟢 特定场景在用 |
| Decoder-Only | GPT、LLaMA、Claude、Qwen | 续写、对话、代码生成 | — | 🔥 绝对主流 |
为什么 Decoder-Only 赢了?
一句话:Encoder-Decoder 像翻译官——听完一句话,再翻译成另一句话。Decoder-Only 像即兴演讲——边想边说,天然适合对话。
三个核心原因:
| 原因 | 解释 |
|---|---|
| 参数利用率高 | Encoder-Decoder 的参数分散在编码器和解码器两套网络中,Decoder-Only 所有参数都用来生成 |
| 天然适合多轮对话 | 不需要把"输入"和"输出"切分开,所有历史对话都是"上文",继续往下接就行 |
| 可扩展性好 | 堆更多层、更多参数,训练稳定 |
四、🔥 工程实现全景(这章最有价值的部分)
实际工作中,你面对的是一道选择题:
五种技术一句话定位
| 技术 | 一句话 | 什么时候用 |
|---|---|---|
| 提示词工程 | 优化输入输出格式 | 模型本身没问题,但回答质量不够好 |
| RAG | 给模型配一个"知识库" | 需要访问训练数据之外的最新/私有信息 |
| 微调 | 让模型学会特定的输出风格 | 指令遵循不足,输出格式/风格不满足要求 |
| 续训 | 让模型学会新的领域知识 | 模型系统性缺乏某个领域的知识(专业术语听不懂) |
| Agent | 让模型能调用外部工具 | 需要复杂推理、多步骤执行、访问实时数据 |
五、🔥 各技术详解
5.1 提示词工程
五要素:
| 要素 | 说明 | 示例 |
|---|---|---|
| 角色/任务 | 告诉模型它是什么身份 | "你是一个资深后端工程师" |
| 输出要求 | 规定输出的格式 | "用 JSON 格式输出,包含 code 和 message 字段" |
| 输入 | 需要处理的数据 | "以下是用户报错的日志:……" |
| 上下文 | 背景信息 | "我们的系统使用 Python 3.12 + FastAPI" |
| 约束 | 限制条件 | "不要解释,只输出结果" |
多轮对话消息结构:
System: 系统提示词(稳定不变的部分)
User: 用户的每次输入
Assistant: 模型的每次回复
Tool: 工具调用结果(Function Call 时出现)5.2 RAG(Retrieval-Augmented Generation)
用户提问 → 向量数据库检索相关文档 → 文档 + 问题 一起喂给 LLM → 生成回答
↑
这是第 10 章学过的内容什么时候需要 RAG: 一切需要访问训练数据之外的知识的场景——公司内部文档、实时数据、私有知识库。
5.3 微调(Fine-Tuning)
| 方式 | 更新参数 | 所需数据 | 显存 |
|---|---|---|---|
| 全参微调 | 全部参数 | 多 | 大(7B 模型 ~60GB) |
| LoRA | 只更新小部分参数 | 少 | 小(7B 模型 ~16GB) |
LoRA 的核心思想:冻结原始权重,在旁边加一个小矩阵,只训练这个小矩阵。效果接近全参微调,但资源消耗降低 70%。
5.4 续训(Continued Pre-Training)
什么时候需要续训:只有当模型系统性缺失某个领域的知识时——比如医学领域的专业术语模型完全不懂。
5.5 Agent(Function Call vs MCP)
| 对比 | Function Call | MCP |
|---|---|---|
| 提出者 | OpenAI | Anthropic |
| 工具定义 | 写在代码里 | MCP Server 独立维护 |
| 模型适配 | 每家模型协议不同 | 统一协议 |
| 共享性 | 不能共享 | 即插即用,社区共享 |
| 稳定性 | 各自实现,质量不一 | 经过社区检验 |
给程序员的比喻:Function Call = 每个人都自己实现一个 HTTP 客户端。MCP = 所有人都用
requests库。MCP 把"工具定义"和"模型适配"解耦了——n×m 的问题变成了 m+n。
学习路径
| 优先级 | 内容 | 时间 | 说明 |
|---|---|---|---|
| 🔥 | 训练范式(预训练→SFT→RLHF) | 5 min | 理解 LLM 的"生产流程" |
| 🔥 | 工程实现选型决策树 | 5 min | 工作中每天都在用 |
| 🟢 | Decoder-Only vs 其他架构 | 3 min | 面试常问 |
| 🟢 | Agent: Function Call vs MCP | 5 min | 当前最热话题 |
| 🟢 | 微调 vs RAG vs 续训 选型 | 5 min | 架构设计能力 |
| 🟠 | 算力基础/计量单位 | 3 min | 知道 B/T 含义即可 |
AI 协作指南
看完本文档后,以下问题直接问 AI 插件:
Q: "预训练和续训的区别具体是什么?能举个例子吗?"
Q: "我有一个场景 [描述场景],应该用 RAG 还是微调?"
Q: "LoRA 的原理是什么?为什么能省显存?"
Q: "MCP 和 Function Call 在架构上到底有什么区别?"
AI 能做的:
- 根据你的具体场景给出工程选型建议
- 画出任意概念的 Mermaid 图
- 用比喻讲清楚任何 LLM 术语附录:原始资料处理说明
| 原始文件 | 处理方式 |
|---|---|
大模型概述v1.1.7.docx | 内容已整合到本文档 |
大模型概述总结.txt | 结构已被采用作为章节框架 |
Cherry-Studio 安装包 | 提示词工程调试工具,按需使用 |
| 视频(29 个) | 跳过 |
修复情况:
- ✅ 技术栈健康度标签(OPC 7.4)
- ✅ 🟢🟡🟠🔴 优先级颜色
- ✅ Mermaid 全景图 + 选型决策树 + 训练流程图
- ✅ 训练范式三阶段对比表
- ✅ 三种 Transformer 架构对比表
- ✅ 五种工程实现技术的选型表格
- ✅ Function Call vs MCP 对比表
- ✅ 明确标注"本章在后续哪一章会被用到"
- ✅ AI 问答指引
- ✅ 学习路径表(最短 26 分钟)