🧠 LLM 如何工作基于 hammadabbasi.com/under-the-hood/how-llms-work

LLM 是怎么工作的
14 节全景:本质是 next-token 预测器

原文 14 节串成一条线。一句话核心论点:LLM 本质是"预测下一个 token"的机器,它表现出的"智能"是海量训练 + 后训练对齐叠加出来的。

全景

一张图看清 LLM 全流程

从输入到输出,三个大阶段。

输入文本 "法国的首都是" 分词 BPE → token id 序列 嵌入 → 向量 Transformer 注意力 + FFN ×N 96–120 层堆叠 残差连接 logits softmax 采样下一个 token 自回归:把新 token 喂回去,循环生成
① 定位

01AI 家族树:LLM 在哪

把 LLM 放进 AI/ML 谱系——从规则系统到深度学习到 Transformer。

AI ├─ 规则系统(专家系统) ├─ 传统机器学习(SVM、决策树…) └─ 深度学习 ├─ CNN(图像)/ RNN(序列) └─ Transformer → LLM(GPT/Llama/…)
② 基础

02神经网络 101

最小单元是神经元:输入 × 权重,求和,过激活函数,输出。前馈架构把神经元层层连起来。

激活函数引入非线性,没有它再多层也等价于一个线性变换。常见:

函数特点
ReLU简单高效,负数归零
Sigmoid压到 (0,1),易梯度消失
Tanh压到 (−1,1)
GeLUTransformer 常用,平滑的 ReLU
③ 表示

03向量空间:词变成可计算的向量

词嵌入把词映射成高维向量,语义相近的词向量也相近。向量算术能"做减法"。

kingman+womanqueen

相似度用余弦相似度衡量(向量夹角)。这让"语义"变成可计算的几何关系。

④ 学习

04损失与梯度下降:模型怎么学

  • 交叉熵损失:衡量预测分布与真实分布的差距
  • 梯度下降:算损失对每个权重的梯度,朝损失下降方向调权重
  • 学习率:每步走多大——太大震荡,太小太慢
  • 训练循环:前向算损失 → 反向算梯度 → 更新权重 → 重复
⑤ 概率

05概率:LLM 的语言就是概率

LLM 输出的不是"答案",是"下一个 token 的概率分布"。

  • 条件概率链:P(tokenₙ | token₁…tokenₙ₋₁),每个 token 依赖前面所有
  • :分布的不确定度
  • 困惑度(perplexity):衡量模型对文本的"困惑程度",越低越好
⑥⑫⑬ 推理

06·12·13大图景 → next-token → 推理管线

这三节合在一起就是"模型怎么吐字"。详见推理管线专篇,这里给骨架:

  • 大图景:请求 → 预填充 → 解码 → 输出
  • next-token 预测:自回归生成,预填充 vs 解码两阶段,KV-cache 机制
  • 推理管线:TTFT ~200–500ms,解码 ~10–30ms/token
⑦ 训练

07训练管线:7 步从数据到部署

模型能力主要靠训练堆出来。原文分 7 阶段,核心是三步对齐:

预训练

海量文本学 next-token,获得语言能力 + 世界知识。最贵的一步。

SFT

监督微调:用"指令-回答"对,教模型听指令、按格式答。

RLHF

人类反馈强化学习:用偏好数据对齐价值观,更"好用"。

完整 7 步含:数据采集 → 预训练 → SFT → RLHF → 评估 → 量化 → 部署。现代能力主要靠后训练(SFT+RLHF)叠加,不是预训练本身。

⑧ 分词

08分词:文本怎么变成 token

  • BPE(Byte Pair Encoding):把高频字节对合并成新 token,逐步建词表
  • 词表大小有限,常见词一个 token,罕见词拆成多个
  • token 成本:API 按 token 计费,"看似一句话"可能花很多钱——分词方式直接影响成本和上限
⑨ 架构

09Transformer:LLM 的骨架

GPT-4 级模型堆 96–120 层。每层包含:

  • 嵌入层:token → 向量
  • 多头注意力:让每个 token "看到"其他 token
  • 残差连接:缓解深层梯度问题,信息直通
  • 前馈网络(FFN):每层做一次非线性变换

堆很多层 = 逐层抽象出更复杂的表示。

⑩ 核心

10自注意力:Transformer 的心脏

让每个 token 决定"该关注其他哪些 token"。Q/K/V 三元组:

  • Q(Query):当前 token 想找什么
  • K(Key):每个 token 能提供什么
  • V(Value):每个 token 的实际内容
  • 注意力分数 = Q·K,softmax 归一化后加权求和 V
  • 多头:并行多组 Q/K/V,捕捉不同维度的关系,最后拼接
⑪ 输出

11softmax 与采样:从分数到选择

最后一层输出 logits,softmax 转成概率,再采样出下一个 token。

  • temperature:调高=更随机/创意,调低=更确定
  • top-k:只从概率最高的 k 个里选
  • 核采样(top-p):只从累计概率达 p 的最小集合里选

详见推理管线专篇 · 采样一节。

⑭ 交付

14流式与交付:SSE 边生成边吐

  • Server-Sent Events(SSE):服务端逐 token 推送到浏览器,无需等全部生成完
  • TTFT(首 token 时间)决定"等多久才看到第一个字"
  • tokens/sec决定"生成流畅度"

这就是你在 ChatGPT 看到逐字蹦出来的原理——不是一次性返回,是流式。

一句话串起 14 节

文本→分词嵌入成向量→喂进堆 96–120 层的 Transformer(每层靠自注意力让 token 互相看见)→输出 logitssoftmax+采样出下一个 token→自回归循环→SSE 流式吐给用户。模型本身是预训练+SFT+RLHF三步堆出来的"next-token 预测器"——所谓智能,是这个简单机制在海量数据上的涌现。

中文精简讲解,基于 hammadabbasi.com/under-the-hood/how-llms-work 的 14 节要点重构(非逐字翻译,原文 CC BY-NC-ND 4.0 禁止演绎)。结构与论点来自原文。· 2026-07-30