Skip to content

14 大模型概述 — LLM 共识词汇表

学习理念:这是整个课程的"地图章节"——不写代码,只建立一套共同语言。后面所有 LangChain/Agent/微调 的内容都基于这里的术语体系。目标是看完后能听懂工程师之间的日常对话:"7B 参数、Decoder-Only、预训练→SFT→RLHF、KV-Cache、RAG、MCP……"

本章不提供实操指引(纯理论模块,无可运行的代码)。

本节 AI 替代率:~85% | 人工干预率:~15%

角色能力范围
🤖 AI 擅长解释所有概念、做对比表格、画出架构图
👤 人类需理解不同技术路线的选型判断(什么时候用 RAG 而不是微调)

一、开篇:一图看懂 LLM 全景

词汇 → 对应后续章节:

术语详细展开在
预训练 → SFT → RLHF本章 §二 + 第 21 章 LLM
RAG本章 §五 + 第 16 章 LangChain
Agent / Function Call / MCP本章 §五 + 第 18 章 LangGraph
微调 / LoRA本章 §五 + 第 21 章 LLM
LangChain / LangGraph 工程实现第 16 / 18 章

二、🟢 训练范式:预训练 → SFT → RLHF

这是理解 LLM 如何诞生的核心框架。

阶段做什么数据产出比喻
预训练从海量文本学习语言规律(词语接龙)万亿 token 互联网文本基础模型(Base Model)让一个婴儿听海量语言,学会"语法感觉"
SFT学会对话和指令遵循高质量对话数据(<10 万条)对话模型(Chat Model)教婴儿"别人问你什么,你就回答什么"
RLHF对齐人类偏好(安全、有用)人类反馈数据对齐模型教婴儿"什么话能说、什么话不能说"

给程序员的比喻:预训练 = pip install 了一个巨大的基础库。SFT = 按你的业务写了个 wrapper。RLHF = 加了一堆 try-catch 防止异常输出。


三、🟢 LLM 架构:为什么是 Decoder-Only?

Transformer 有三种架构路线,目前大模型几乎全部采用 Decoder-Only

三种架构对比

架构代表模型适合不适合2026 年状态
Encoder-OnlyBERT文本分类、NER、句子理解文本生成⚠️ 仅用于 Embedding
Encoder-DecoderT5、BART翻译、摘要多轮对话🟢 特定场景在用
Decoder-OnlyGPT、LLaMA、Claude、Qwen续写、对话、代码生成🔥 绝对主流

为什么 Decoder-Only 赢了?

一句话:Encoder-Decoder 像翻译官——听完一句话,再翻译成另一句话。Decoder-Only 像即兴演讲——边想边说,天然适合对话。

三个核心原因:

原因解释
参数利用率高Encoder-Decoder 的参数分散在编码器和解码器两套网络中,Decoder-Only 所有参数都用来生成
天然适合多轮对话不需要把"输入"和"输出"切分开,所有历史对话都是"上文",继续往下接就行
可扩展性好堆更多层、更多参数,训练稳定

四、🔥 工程实现全景(这章最有价值的部分)

实际工作中,你面对的是一道选择题:

五种技术一句话定位

技术一句话什么时候用
提示词工程优化输入输出格式模型本身没问题,但回答质量不够好
RAG给模型配一个"知识库"需要访问训练数据之外的最新/私有信息
微调让模型学会特定的输出风格指令遵循不足,输出格式/风格不满足要求
续训让模型学会新的领域知识模型系统性缺乏某个领域的知识(专业术语听不懂)
Agent让模型能调用外部工具需要复杂推理、多步骤执行、访问实时数据

五、🔥 各技术详解

5.1 提示词工程

五要素:

要素说明示例
角色/任务告诉模型它是什么身份"你是一个资深后端工程师"
输出要求规定输出的格式"用 JSON 格式输出,包含 code 和 message 字段"
输入需要处理的数据"以下是用户报错的日志:……"
上下文背景信息"我们的系统使用 Python 3.12 + FastAPI"
约束限制条件"不要解释,只输出结果"

多轮对话消息结构:

System:  系统提示词(稳定不变的部分)
User:    用户的每次输入
Assistant: 模型的每次回复
Tool:    工具调用结果(Function Call 时出现)

5.2 RAG(Retrieval-Augmented Generation)

用户提问 → 向量数据库检索相关文档 → 文档 + 问题 一起喂给 LLM → 生成回答

             这是第 10 章学过的内容

什么时候需要 RAG: 一切需要访问训练数据之外的知识的场景——公司内部文档、实时数据、私有知识库。

5.3 微调(Fine-Tuning)

方式更新参数所需数据显存
全参微调全部参数大(7B 模型 ~60GB)
LoRA只更新小部分参数小(7B 模型 ~16GB)

LoRA 的核心思想:冻结原始权重,在旁边加一个小矩阵,只训练这个小矩阵。效果接近全参微调,但资源消耗降低 70%。

5.4 续训(Continued Pre-Training)

什么时候需要续训:只有当模型系统性缺失某个领域的知识时——比如医学领域的专业术语模型完全不懂。

5.5 Agent(Function Call vs MCP)

对比Function CallMCP
提出者OpenAIAnthropic
工具定义写在代码里MCP Server 独立维护
模型适配每家模型协议不同统一协议
共享性不能共享即插即用,社区共享
稳定性各自实现,质量不一经过社区检验

给程序员的比喻:Function Call = 每个人都自己实现一个 HTTP 客户端。MCP = 所有人都用 requests 库。MCP 把"工具定义"和"模型适配"解耦了——n×m 的问题变成了 m+n


学习路径

优先级内容时间说明
🔥训练范式(预训练→SFT→RLHF)5 min理解 LLM 的"生产流程"
🔥工程实现选型决策树5 min工作中每天都在用
🟢Decoder-Only vs 其他架构3 min面试常问
🟢Agent: Function Call vs MCP5 min当前最热话题
🟢微调 vs RAG vs 续训 选型5 min架构设计能力
🟠算力基础/计量单位3 min知道 B/T 含义即可

AI 协作指南

看完本文档后,以下问题直接问 AI 插件:

Q: "预训练和续训的区别具体是什么?能举个例子吗?"
Q: "我有一个场景 [描述场景],应该用 RAG 还是微调?"
Q: "LoRA 的原理是什么?为什么能省显存?"
Q: "MCP 和 Function Call 在架构上到底有什么区别?"

AI 能做的:
  - 根据你的具体场景给出工程选型建议
  - 画出任意概念的 Mermaid 图
  - 用比喻讲清楚任何 LLM 术语

附录:原始资料处理说明

原始文件处理方式
大模型概述v1.1.7.docx内容已整合到本文档
大模型概述总结.txt结构已被采用作为章节框架
Cherry-Studio 安装包提示词工程调试工具,按需使用
视频(29 个)跳过

修复情况

  • ✅ 技术栈健康度标签(OPC 7.4)
  • ✅ 🟢🟡🟠🔴 优先级颜色
  • ✅ Mermaid 全景图 + 选型决策树 + 训练流程图
  • ✅ 训练范式三阶段对比表
  • ✅ 三种 Transformer 架构对比表
  • ✅ 五种工程实现技术的选型表格
  • ✅ Function Call vs MCP 对比表
  • ✅ 明确标注"本章在后续哪一章会被用到"
  • ✅ AI 问答指引
  • ✅ 学习路径表(最短 26 分钟)

OPC 超级个体实战指南