🧠
LLM TRAINING GUIDE
从"读书"到"做人" 大语言模型训练全揭秘
预训练 → 监督微调 → 强化学习 一文读懂大模型是如何"炼"成的
2026年8月 · 技术深度解读
为什么同一个模型,有的只会"接话茬",有的却能写代码、做客服?
答案藏在它的"教育经历"里。就像一个人从小学、中学到大学的教育路径一样,现代大语言模型(LLM)的训练也遵循一条清晰的三段式流水线。每一段都在前一段的基础上,解决一个更具体、更贴近实际应用的问题。
本文将从最底层的预训练 讲起,逐步深入到监督微调(SFT) 和强化学习(RLHF) ,再梳理模型训练与模型调用的关系,最后解释当下最热门的RAG(检索增强生成) 与大语言模型的关系。读完本文,你将建立起对大模型训练体系的完整认知框架。
一、一张图看懂训练全流程
1
预训练
海量文本上学习语言规律 预测下一个词 产出:Base 模型
→
2
监督微调 SFT
人工标注指令-回复对 模仿标准答案 产出:Instruct 模型
→
3
强化学习 RLHF
人类偏好排序打分 奖励最大化 产出:Aligned 模型
Base 模型(会说话)→ Instruct 模型(会答题)→ Aligned 模型(答得好)→ 生产级 AI 应用
核心比喻: 预训练 = 通识教育(读万卷书);SFT = 职业培训(学答题套路);RL = 价值观塑造(学什么答案是"好答案")。
二、预训练(Pre-training)—— 通识教育
预训练是大语言模型训练的第一阶段,也是最"烧钱"的阶段。它的目标非常朴素:让模型在海量无标注文本上学会语言的统计规律、语法结构、事实知识和世界常识。
核心机制:预测下一个词
预训练采用自监督学习 范式,最核心的训练目标是Next Token Prediction(预测下一个词) 。模型看到"今天天气真",需要预测下一个词可能是"好"、"不错"、"糟糕"等。通过数万亿个这样的预测任务,模型逐渐掌握了语言的深层规律。
for text in trillions_of_documents:
tokens = tokenize(text)
for i in range(len(tokens) - 1 ):
input = tokens[:i]
target = tokens[i+1 ]
loss = model(input).cross_entropy(target)
loss.backward()
预训练关键参数一览
维度 说明
目标 让模型掌握语言规律、语法、事实知识和世界常识
数据 海量无标注文本(互联网语料、书籍、论文、代码)
方法 自监督学习,核心是预测下一个词(Next Token Prediction)
产出 Base 模型 (基座模型)
能力 能续写句子、完成填空,但不会遵循指令
成本 极高(数千张 GPU,训练数周~数月,数百万到上亿美元)
代表模型 GPT-3(原始版)、LLaMA-3 Base、Qwen2.5 Base
打个比方: 让一个学生读完了图书馆里所有的书。他知识渊博,但你问他"帮我写封邮件",他只会接着"帮我写封邮件"这几个字往下续写,而不是真正帮你写。
三、监督微调 SFT(Supervised Fine-Tuning)—— 职业培训
预训练产出的 Base 模型虽然"满腹经纶",但它不会按照人类的意图去回答问题。SFT 阶段就是为了解决这个问题——通过大量人工标注的"指令-回复"对,教会模型如何理解人类指令并给出合适的回答。
核心机制:模仿学习
SFT 使用有监督学习 方法,本质上是让模型模仿标准答案 。训练数据通常由人工标注员编写,格式如下:
{
"instruction" : "帮我写一封请假邮件" ,
"input" : "明天需要去医院体检,请假一天" ,
"output" : "尊敬的领导:\n\n您好!明天我需要前往医院进行年度体检..."
}
{
"instruction" : "将以下英文翻译成中文" ,
"input" : "The quick brown fox jumps over the lazy dog" ,
"output" : "敏捷的棕色狐狸跳过了懒惰的狗"
}
SFT 关键参数一览
维度 说明
目标 让模型学会遵循人类指令 ,进行对话、问答、翻译等任务
数据 人工标注的高质量"指令-回复"对(Instruction-Response Pairs)
方法 有监督学习,本质是模仿标准答案
产出 Instruct 模型 / Chat 模型
能力 能理解"帮我写封邮件"并给出完整回复
成本 中等(数千 GPU 小时,数据标注是主要瓶颈)
代表模型 GPT-3.5 Instruct、LLaMA-3-Instruct、ChatGLM3
打个比方: 那个读了很多书的学生,现在开始按照老师给的"标准答案"练习如何回答特定类型的问题。老师问"写一封请假邮件",他学会了标准格式和语气。
💡 实操提示: 你在 Ollama 里看到的模型,带 instruct 或 chat 后缀的,就是完成了 SFT 的版本。日常使用请优先选这类模型 。
四、强化学习 RLHF —— 价值观塑造
SFT 让模型学会了"标准答案",但真实世界的问题千变万化,没有标准答案。有些回答虽然语法正确,但可能不够有用、不够安全、或者不够诚实。RLHF(Reinforcement Learning from Human Feedback)阶段就是为了让模型在面对开放式问题时,能自主判断什么样的回答更"好"。
核心机制:奖励驱动的自我优化
RLHF 分为三个关键步骤:
步骤一:训练奖励模型(Reward Model) —— 让人类标注员对同一个问题的多个模型回答进行排序打分 ,然后用这些数据训练一个"裁判"模型
步骤二:强化学习优化(PPO) —— 模型生成回答,奖励模型打分,通过 PPO(近端策略优化)算法不断调整模型参数以最大化奖励分数
步骤三:安全对齐 —— 额外加入安全性、无害性约束,确保模型不会输出有害内容
reward_model = train_on_human_preferences(sft_model)
for iteration in range(max_iterations):
prompt = sample_from_dataset()
response = policy_model.generate(prompt)
reward = reward_model.score(prompt, response)
loss = -reward + kl_penalty(policy_model, sft_model)
policy_model.update(loss)
RLHF 关键参数一览
维度 说明
目标 让模型生成更符合人类偏好 的答案(更有用、更无害、更诚实)
数据 人类对模型多个输出的排序/评分 (A 比 B 好)
方法 强化学习,典型算法为 PPO (近端策略优化)
产出 Aligned 模型 (对齐模型)
能力 不仅答对,还答得得体、安全、有条理
成本 较高(需反复采样、评估、更新)
代表模型 GPT-4、Claude 3、Gemini Pro
打个比方: 学生不仅学会了答题套路,还通过老师的批改和反馈,明白了什么样的答案才是"好答案"——逻辑清晰、重点突出、语气得体、不会胡说八道。
五、模型分类全景图
下面这张思维导图梳理了从 Base 模型到最终生产应用的完整分类体系,帮助你在面对不同场景时快速选择合适的模型类型。
大语言模型 LLM
按训练阶段分
Base 模型
Instruct 模型
Aligned 模型
按模型架构分
Decoder-only (GPT)
Encoder-Decoder (T5)
Encoder-only (BERT)
按应用场景分
通用对话助手
垂直领域模型
Agent / 工具调用
增强手段叠加
+ RAG 检索
+ 持续训练
+ 工具调用
部署调用方式
Web UI 界面
API 接口
本地推理框架
🚀 生产级 AI 应用
模型选型速查表
需求场景 推荐模型类型 典型代表
文本续写 / 灵感激发 Base 模型 LLaMA-3 Base、Qwen2.5 Base
日常对话 / 通用助手 Instruct 模型 LLaMA-3-Instruct、ChatGLM3
安全敏感 / 商业产品 Aligned 模型 GPT-4o、Claude 3.5、Gemini Pro
本地部署 / 隐私保护 开源 Instruct Qwen2.5-72B、Llama-3.1-70B
垂直领域(医疗/法律) Aligned + 持续训练/RAG 各垂直行业定制模型
六、模型训练 vs 模型调用:别搞混了
这是两个完全不同的阶段,很多人容易混淆。简单来说,训练是"造模型",调用是"用模型" 。绝大多数开发者和企业只需要关注调用阶段。
🔧 模型训练阶段(离线)
预训练 → SFT → RLHF → 持续训练
产出:一个 .gguf / .safetensors 权重文件
耗时数周~数月
烧钱数百万~上亿美元
需数千~数万张 GPU
由 OpenAI、Meta、阿里等大厂完成
类比:培养一个大学生(4年)
⚡ 模型调用阶段(在线)
加载模型 → 接收输入 → 推理生成 → 返回结果
产出:一段文本/代码/翻译结果
毫秒~秒级响应
每次调用成本极低(几分钱或免费)
一张消费级 GPU 即可(7B~13B 模型)
由开发者和终端用户完成
类比:向毕业生提问,他即时回答
调用方式全景
调用方式 适用场景 技术栈
网页界面 直接使用,零代码 ChatGPT / Open WebUI
API 接口 应用集成、自动化 OpenAI API / Ollama API
SDK 集成 Python/JS 项目内嵌 openai SDK / langchain
本地推理框架 隐私保护、离线环境 Ollama / vLLM / llama.cpp
模型训练(离线)
预训练 → SFT → RLHF
↓
产出 .gguf 权重文件
耗时数周~月 | 耗资百万~亿
模型文件
模型调用(在线)
加载 → 推理 → 输出
↓
返回文本/代码/分析结果
毫秒~秒级 | 每次几分钱
应用
AI 应用
聊天机器人
智能客服
文档分析
代码助手
核心结论: 作为应用开发者,你几乎不需要关心训练过程 。你的工作是在调用阶段,通过 Prompt Engineering、RAG、Agent 编排等方式,把已有模型的能力发挥到最大。
七、RAG 与大语言模型的关系
RAG(Retrieval-Augmented Generation,检索增强生成)是当前最热门的 LLM 应用范式。理解它与模型训练的关系,是构建生产级 AI 应用的关键。
一句话说清: 模型训练是"把知识写进大脑",RAG 是"允许模型在回答前先翻书"。它们是正交 的两种增强手段——一个改模型内部参数,一个在模型外部加检索模块。
RAG 工作原理
用户提问
问题理解
Embedding
向量检索
向量数据库
上下文注入
拼入 Prompt
LLM 生成
结合知识回答
📚 知识库/文档
RAG vs 训练增强 对比
维度 🔍 RAG(外部增强) 🔧 持续训练(内部增强)
知识更新 实时 更新数据库即可慢 需重新训练
成本 低 向量库 + API 调用高 GPU 集群 + 数据标注
可解释性 高 能追溯引用来源低 黑盒参数
知识精度 高 直接引用原文可能"记错"或产生幻觉
适用场景 企业知识库、客服、文档问答 通用能力提升、新语言/领域适配
延迟 稍高(多一步检索) 低 纯推理
八、实战:RAG 增强的 LLM 应用架构
结合前面搭建的 Open WebUI + Ollama 环境,一个完整的 RAG 应用架构如下所示:
RAG 增强的 LLM 应用架构
用户提问
检索模块
Embedding
向量数据库
企业文档/网页
LLM 推理引擎
Ollama / OpenAI
(.gguf 模型文件)
最终回答
Open WebUI
Web 交互界面
Embedding 模型
nomic-embed-text
向量数据库
Chroma / Milvus
API / SDK 调用层
REST API / Python SDK
实际开发中的典型组合
组件 推荐方案(你已有的 / 可选)
LLM 推理引擎 Ollama(本地) / OpenAI API(云端)
Web 交互界面 Open WebUI
向量数据库 Open WebUI 内置(Chroma) / 外接 Milvus
Embedding 模型 nomic-embed-text(Ollama 可拉取)
文档解析 Open WebUI 自带 PDF/Word/TXT 解析
九、全文总结:五句话记住一切
🔑 核心要点速记
预训练 让模型"会说话",SFT 让模型"会答题",RL 让模型"答得好"
训练 是离线的、昂贵的、由大厂完成的;调用 是在线的、便宜的、你每天在做的事
RAG 不改模型 ,它在模型外面加了一层"翻书"能力,是应用层的最强武器
日常开发优先用 Instruct / Aligned 模型 + RAG ,不要碰 Base 模型
你搭的 Ollama + Open WebUI 组合,已具备完整的"模型调用 + RAG 增强"能力
完整关系总图
大语言模型全生命周期
① 预训练
通识教育 → Base 模型
会说话
② 监督微调 SFT
职业培训 → Instruct 模型
会答题
③ 强化学习 RLHF
价值观塑造 → Aligned 模型
答得好
持续训练
领域专家模型
+ RAG 增强
外挂知识库
模型文件 (.gguf)
训练阶段产物
🚀 生产级 AI 应用
本文涵盖预训练、SFT、RLHF、模型调用、RAG 五大核心概念及其关系
适合作为大语言模型技术全景的入门与速查参考