LLM 是怎么工作的
14 节全景:本质是 next-token 预测器
原文 14 节串成一条线。一句话核心论点:LLM 本质是"预测下一个 token"的机器,它表现出的"智能"是海量训练 + 后训练对齐叠加出来的。确
全景
一张图看清 LLM 全流程
从输入到输出,三个大阶段。
① 定位
01AI 家族树:LLM 在哪
把 LLM 放进 AI/ML 谱系——从规则系统到深度学习到 Transformer。
AI ├─ 规则系统(专家系统)
├─ 传统机器学习(SVM、决策树…)
└─ 深度学习
├─ CNN(图像)/ RNN(序列)
└─ Transformer → LLM(GPT/Llama/…)
② 基础
02神经网络 101
最小单元是神经元:输入 × 权重,求和,过激活函数,输出。前馈架构把神经元层层连起来。
激活函数引入非线性,没有它再多层也等价于一个线性变换。常见:
| 函数 | 特点 |
ReLU | 简单高效,负数归零 |
Sigmoid | 压到 (0,1),易梯度消失 |
Tanh | 压到 (−1,1) |
GeLU | Transformer 常用,平滑的 ReLU |
③ 表示
03向量空间:词变成可计算的向量
词嵌入把词映射成高维向量,语义相近的词向量也相近。向量算术能"做减法"。
king−man+woman≈queen
相似度用余弦相似度衡量(向量夹角)。这让"语义"变成可计算的几何关系。
④ 学习
04损失与梯度下降:模型怎么学
- 交叉熵损失:衡量预测分布与真实分布的差距
- 梯度下降:算损失对每个权重的梯度,朝损失下降方向调权重
- 学习率:每步走多大——太大震荡,太小太慢
- 训练循环:前向算损失 → 反向算梯度 → 更新权重 → 重复
⑤ 概率
05概率:LLM 的语言就是概率
LLM 输出的不是"答案",是"下一个 token 的概率分布"。
- 条件概率链:P(tokenₙ | token₁…tokenₙ₋₁),每个 token 依赖前面所有
- 熵:分布的不确定度
- 困惑度(perplexity):衡量模型对文本的"困惑程度",越低越好
⑥⑫⑬ 推理
06·12·13大图景 → next-token → 推理管线
这三节合在一起就是"模型怎么吐字"。详见推理管线专篇,这里给骨架:
- 大图景:请求 → 预填充 → 解码 → 输出
- next-token 预测:自回归生成,预填充 vs 解码两阶段,KV-cache 机制
- 推理管线:TTFT ~200–500ms,解码 ~10–30ms/token
⑦ 训练
07训练管线:7 步从数据到部署
模型能力主要靠训练堆出来。原文分 7 阶段,核心是三步对齐:
①预训练
海量文本学 next-token,获得语言能力 + 世界知识。最贵的一步。
②SFT
监督微调:用"指令-回答"对,教模型听指令、按格式答。
③RLHF
人类反馈强化学习:用偏好数据对齐价值观,更"好用"。
完整 7 步含:数据采集 → 预训练 → SFT → RLHF → 评估 → 量化 → 部署。现代能力主要靠后训练(SFT+RLHF)叠加,不是预训练本身。
⑧ 分词
08分词:文本怎么变成 token
- BPE(Byte Pair Encoding):把高频字节对合并成新 token,逐步建词表
- 词表大小有限,常见词一个 token,罕见词拆成多个
- token 成本:API 按 token 计费,"看似一句话"可能花很多钱——分词方式直接影响成本和上限
⑨ 架构
09Transformer:LLM 的骨架
GPT-4 级模型堆 96–120 层。每层包含:
- 嵌入层:token → 向量
- 多头注意力:让每个 token "看到"其他 token
- 残差连接:缓解深层梯度问题,信息直通
- 前馈网络(FFN):每层做一次非线性变换
堆很多层 = 逐层抽象出更复杂的表示。
⑩ 核心
10自注意力:Transformer 的心脏
让每个 token 决定"该关注其他哪些 token"。Q/K/V 三元组:
- Q(Query):当前 token 想找什么
- K(Key):每个 token 能提供什么
- V(Value):每个 token 的实际内容
- 注意力分数 = Q·K,softmax 归一化后加权求和 V
- 多头:并行多组 Q/K/V,捕捉不同维度的关系,最后拼接
⑪ 输出
11softmax 与采样:从分数到选择
最后一层输出 logits,softmax 转成概率,再采样出下一个 token。
- temperature:调高=更随机/创意,调低=更确定
- top-k:只从概率最高的 k 个里选
- 核采样(top-p):只从累计概率达 p 的最小集合里选
详见推理管线专篇 · 采样一节。
⑭ 交付
14流式与交付:SSE 边生成边吐
- Server-Sent Events(SSE):服务端逐 token 推送到浏览器,无需等全部生成完
- TTFT(首 token 时间)决定"等多久才看到第一个字"
- tokens/sec决定"生成流畅度"
这就是你在 ChatGPT 看到逐字蹦出来的原理——不是一次性返回,是流式。
一句话串起 14 节
文本→分词→嵌入成向量→喂进堆 96–120 层的 Transformer(每层靠自注意力让 token 互相看见)→输出 logits→softmax+采样出下一个 token→自回归循环→SSE 流式吐给用户。模型本身是预训练+SFT+RLHF三步堆出来的"next-token 预测器"——所谓智能,是这个简单机制在海量数据上的涌现。
中文精简讲解,基于 hammadabbasi.com/under-the-hood/how-llms-work 的 14 节要点重构(非逐字翻译,原文 CC BY-NC-ND 4.0 禁止演绎)。结构与论点来自原文。· 2026-07-30