🧠
LLM TRAINING GUIDE
从"读书"到"做人"
大语言模型训练全揭秘
预训练 → 监督微调 → 强化学习
一文读懂大模型是如何"炼"成的
2026年8月 · 技术深度解读

为什么同一个模型,有的只会"接话茬",有的却能写代码、做客服?

答案藏在它的"教育经历"里。就像一个人从小学、中学到大学的教育路径一样,现代大语言模型(LLM)的训练也遵循一条清晰的三段式流水线。每一段都在前一段的基础上,解决一个更具体、更贴近实际应用的问题。

本文将从最底层的预训练讲起,逐步深入到监督微调(SFT)强化学习(RLHF),再梳理模型训练与模型调用的关系,最后解释当下最热门的RAG(检索增强生成)与大语言模型的关系。读完本文,你将建立起对大模型训练体系的完整认知框架。

一、一张图看懂训练全流程

1
预训练
海量文本上学习语言规律
预测下一个词
产出:Base 模型
2
监督微调 SFT
人工标注指令-回复对
模仿标准答案
产出:Instruct 模型
3
强化学习 RLHF
人类偏好排序打分
奖励最大化
产出:Aligned 模型
Base 模型(会说话)→ Instruct 模型(会答题)→ Aligned 模型(答得好)→ 生产级 AI 应用
核心比喻:预训练 = 通识教育(读万卷书);SFT = 职业培训(学答题套路);RL = 价值观塑造(学什么答案是"好答案")。

二、预训练(Pre-training)—— 通识教育

预训练是大语言模型训练的第一阶段,也是最"烧钱"的阶段。它的目标非常朴素:让模型在海量无标注文本上学会语言的统计规律、语法结构、事实知识和世界常识。

核心机制:预测下一个词

预训练采用自监督学习范式,最核心的训练目标是Next Token Prediction(预测下一个词)。模型看到"今天天气真",需要预测下一个词可能是"好"、"不错"、"糟糕"等。通过数万亿个这样的预测任务,模型逐渐掌握了语言的深层规律。

# 预训练的核心逻辑(简化伪代码) for text in trillions_of_documents: tokens = tokenize(text) # 分词 for i in range(len(tokens) - 1): input = tokens[:i] # 输入上下文 target = tokens[i+1] # 预测目标 loss = model(input).cross_entropy(target) loss.backward() # 反向传播更新参数

预训练关键参数一览

维度说明
目标让模型掌握语言规律、语法、事实知识和世界常识
数据海量无标注文本(互联网语料、书籍、论文、代码)
方法自监督学习,核心是预测下一个词(Next Token Prediction)
产出Base 模型(基座模型)
能力能续写句子、完成填空,但不会遵循指令
成本极高(数千张 GPU,训练数周~数月,数百万到上亿美元)
代表模型GPT-3(原始版)、LLaMA-3 Base、Qwen2.5 Base
打个比方:让一个学生读完了图书馆里所有的书。他知识渊博,但你问他"帮我写封邮件",他只会接着"帮我写封邮件"这几个字往下续写,而不是真正帮你写。

三、监督微调 SFT(Supervised Fine-Tuning)—— 职业培训

预训练产出的 Base 模型虽然"满腹经纶",但它不会按照人类的意图去回答问题。SFT 阶段就是为了解决这个问题——通过大量人工标注的"指令-回复"对,教会模型如何理解人类指令并给出合适的回答。

核心机制:模仿学习

SFT 使用有监督学习方法,本质上是让模型模仿标准答案。训练数据通常由人工标注员编写,格式如下:

# SFT 训练数据格式示例(指令-回复对) { "instruction": "帮我写一封请假邮件", "input": "明天需要去医院体检,请假一天", "output": "尊敬的领导:\n\n您好!明天我需要前往医院进行年度体检..." } { "instruction": "将以下英文翻译成中文", "input": "The quick brown fox jumps over the lazy dog", "output": "敏捷的棕色狐狸跳过了懒惰的狗" }

SFT 关键参数一览

维度说明
目标让模型学会遵循人类指令,进行对话、问答、翻译等任务
数据人工标注的高质量"指令-回复"对(Instruction-Response Pairs)
方法有监督学习,本质是模仿标准答案
产出Instruct 模型 / Chat 模型
能力能理解"帮我写封邮件"并给出完整回复
成本中等(数千 GPU 小时,数据标注是主要瓶颈)
代表模型GPT-3.5 Instruct、LLaMA-3-Instruct、ChatGLM3
打个比方:那个读了很多书的学生,现在开始按照老师给的"标准答案"练习如何回答特定类型的问题。老师问"写一封请假邮件",他学会了标准格式和语气。

💡 实操提示:你在 Ollama 里看到的模型,带 instructchat 后缀的,就是完成了 SFT 的版本。日常使用请优先选这类模型

四、强化学习 RLHF —— 价值观塑造

SFT 让模型学会了"标准答案",但真实世界的问题千变万化,没有标准答案。有些回答虽然语法正确,但可能不够有用、不够安全、或者不够诚实。RLHF(Reinforcement Learning from Human Feedback)阶段就是为了让模型在面对开放式问题时,能自主判断什么样的回答更"好"。

核心机制:奖励驱动的自我优化

RLHF 分为三个关键步骤:

# RLHF 核心循环(简化伪代码) reward_model = train_on_human_preferences(sft_model) for iteration in range(max_iterations): prompt = sample_from_dataset() response = policy_model.generate(prompt) # 模型生成回答 reward = reward_model.score(prompt, response) # 裁判打分 # PPO 更新:最大化奖励,同时约束不要偏离 SFT 模型太远 loss = -reward + kl_penalty(policy_model, sft_model) policy_model.update(loss)

RLHF 关键参数一览

维度说明
目标让模型生成更符合人类偏好的答案(更有用、更无害、更诚实)
数据人类对模型多个输出的排序/评分(A 比 B 好)
方法强化学习,典型算法为 PPO(近端策略优化)
产出Aligned 模型(对齐模型)
能力不仅答对,还答得得体、安全、有条理
成本较高(需反复采样、评估、更新)
代表模型GPT-4、Claude 3、Gemini Pro
打个比方:学生不仅学会了答题套路,还通过老师的批改和反馈,明白了什么样的答案才是"好答案"——逻辑清晰、重点突出、语气得体、不会胡说八道。

五、模型分类全景图

下面这张思维导图梳理了从 Base 模型到最终生产应用的完整分类体系,帮助你在面对不同场景时快速选择合适的模型类型。

大语言模型 LLM 按训练阶段分 Base 模型 Instruct 模型 Aligned 模型 按模型架构分 Decoder-only (GPT) Encoder-Decoder (T5) Encoder-only (BERT) 按应用场景分 通用对话助手 垂直领域模型 Agent / 工具调用 增强手段叠加 + RAG 检索 + 持续训练 + 工具调用 部署调用方式 Web UI 界面 API 接口 本地推理框架 🚀 生产级 AI 应用

模型选型速查表

需求场景推荐模型类型典型代表
文本续写 / 灵感激发Base 模型LLaMA-3 Base、Qwen2.5 Base
日常对话 / 通用助手Instruct 模型LLaMA-3-Instruct、ChatGLM3
安全敏感 / 商业产品Aligned 模型GPT-4o、Claude 3.5、Gemini Pro
本地部署 / 隐私保护开源 InstructQwen2.5-72B、Llama-3.1-70B
垂直领域(医疗/法律)Aligned + 持续训练/RAG各垂直行业定制模型

六、模型训练 vs 模型调用:别搞混了

这是两个完全不同的阶段,很多人容易混淆。简单来说,训练是"造模型",调用是"用模型"。绝大多数开发者和企业只需要关注调用阶段。

🔧 模型训练阶段(离线)

  • 预训练 → SFT → RLHF → 持续训练
  • 产出:一个 .gguf / .safetensors 权重文件
  • 耗时数周~数月
  • 烧钱数百万~上亿美元
  • 需数千~数万张 GPU
  • 由 OpenAI、Meta、阿里等大厂完成
  • 类比:培养一个大学生(4年)

⚡ 模型调用阶段(在线)

  • 加载模型 → 接收输入 → 推理生成 → 返回结果
  • 产出:一段文本/代码/翻译结果
  • 毫秒~秒级响应
  • 每次调用成本极低(几分钱或免费)
  • 一张消费级 GPU 即可(7B~13B 模型)
  • 由开发者和终端用户完成
  • 类比:向毕业生提问,他即时回答

调用方式全景

调用方式适用场景技术栈
网页界面直接使用,零代码ChatGPT / Open WebUI
API 接口应用集成、自动化OpenAI API / Ollama API
SDK 集成Python/JS 项目内嵌openai SDK / langchain
本地推理框架隐私保护、离线环境Ollama / vLLM / llama.cpp
模型训练(离线) 预训练 → SFT → RLHF 产出 .gguf 权重文件 耗时数周~月 | 耗资百万~亿 模型文件 模型调用(在线) 加载 → 推理 → 输出 返回文本/代码/分析结果 毫秒~秒级 | 每次几分钱 应用 AI 应用 聊天机器人 智能客服 文档分析 代码助手
核心结论:作为应用开发者,你几乎不需要关心训练过程。你的工作是在调用阶段,通过 Prompt Engineering、RAG、Agent 编排等方式,把已有模型的能力发挥到最大。

七、RAG 与大语言模型的关系

RAG(Retrieval-Augmented Generation,检索增强生成)是当前最热门的 LLM 应用范式。理解它与模型训练的关系,是构建生产级 AI 应用的关键。

一句话说清:模型训练是"把知识写进大脑",RAG 是"允许模型在回答前先翻书"。它们是正交的两种增强手段——一个改模型内部参数,一个在模型外部加检索模块。

RAG 工作原理

用户提问 问题理解 Embedding 向量检索 向量数据库 上下文注入 拼入 Prompt LLM 生成 结合知识回答 📚 知识库/文档

RAG vs 训练增强 对比

维度🔍 RAG(外部增强)🔧 持续训练(内部增强)
知识更新实时 更新数据库即可 需重新训练
成本 向量库 + API 调用 GPU 集群 + 数据标注
可解释性 能追溯引用来源 黑盒参数
知识精度 直接引用原文可能"记错"或产生幻觉
适用场景企业知识库、客服、文档问答通用能力提升、新语言/领域适配
延迟稍高(多一步检索) 纯推理

八、实战:RAG 增强的 LLM 应用架构

结合前面搭建的 Open WebUI + Ollama 环境,一个完整的 RAG 应用架构如下所示:

RAG 增强的 LLM 应用架构 用户提问 检索模块 Embedding 向量数据库 企业文档/网页 LLM 推理引擎 Ollama / OpenAI (.gguf 模型文件) 最终回答 Open WebUI Web 交互界面 Embedding 模型 nomic-embed-text 向量数据库 Chroma / Milvus API / SDK 调用层 REST API / Python SDK

实际开发中的典型组合

组件推荐方案(你已有的 / 可选)
LLM 推理引擎Ollama(本地) / OpenAI API(云端)
Web 交互界面Open WebUI
向量数据库Open WebUI 内置(Chroma) / 外接 Milvus
Embedding 模型nomic-embed-text(Ollama 可拉取)
文档解析Open WebUI 自带 PDF/Word/TXT 解析

九、全文总结:五句话记住一切

🔑 核心要点速记

完整关系总图

大语言模型全生命周期 ① 预训练 通识教育 → Base 模型 会说话 ② 监督微调 SFT 职业培训 → Instruct 模型 会答题 ③ 强化学习 RLHF 价值观塑造 → Aligned 模型 答得好 持续训练 领域专家模型 + RAG 增强 外挂知识库 模型文件 (.gguf) 训练阶段产物 🚀 生产级 AI 应用

本文涵盖预训练、SFT、RLHF、模型调用、RAG 五大核心概念及其关系
适合作为大语言模型技术全景的入门与速查参考