🔧 Under the Hood · 总览

Under the Hood
11 篇精简总览

Hammad Abbasi 的交互式技术深读系列。两个系列共 11 篇,串成一条完整的 LLM 知识链——从数据到训练到推理到落地。

知识链路

一条线串起全部

这 10 篇不是松散的清单,而是按 LLM 的真实生命周期排序的。数据进来 → 训练成模型 → 推理吐 token。

数据 分词 嵌入 神经网络 损失/梯度 注意力/Transformer 训练 概率/采样 推理 Agent 落地
系列 A · How LLMs Work(10 篇)

LLM 是怎么工作的

从最底层的神经网络一路讲到最上层的推理管线。第 0 篇是总览,1–9 是各模块深读。你给我的两个页面是第 0 和第 7(⭐ 标注)。

0
🗺️ How LLMs Work
14 节端到端总览。核心论点:LLM 本质是 next-token 预测器,现代能力靠后训练叠加。从 AI 家族树到训练到流式输出。
⭐ 你给的
1
🧩 Neural Networks
神经网络基础:神经元、权重、激活函数(ReLU / Sigmoid / Tanh / GeLU)、前馈架构。
基础
2
✂️ Tokenization
分词。BPE 编码、词表构建、token 成本含义——为什么"看似一句话"可能花很多钱。
基础
3
📐 Embeddings
向量嵌入。词向量空间、向量算术(king−man+woman≈queen)、余弦相似度。
基础
4
🎯 Attention
自注意力机制。Q/K/V 投影、注意力分数、softmax、多头拼接——Transformer 的心脏。
核心
5
🏗️ Transformers
Transformer 架构。嵌入 + 多头注意力 + 残差连接 + 前馈网络,GPT-4 级模型堆 96–120 层
核心
6
🎓 Training Pipeline
多阶段训练 7 步:数据采集 → 部署。含 SFT、RLHF、评估、量化。
核心
7
Inference Pipeline
推理管线 10 大主题:请求生命周期、Context 组装、Prefill、Decode、KV-Cache、采样、连续批处理、投机解码、GPU 架构、可观测性。
⭐ 你给的
8
📉 Loss & Gradient Descent
损失函数与梯度下降。交叉熵损失、学习率、训练循环。
基础
9
🎲 Probability & Sampling
概率与采样。条件概率链、熵、困惑度、softmax、temperature、top-k、核采样。
推理侧
10
📦 Data & Annotation
数据与标注。训练数据的采集、清洗、标注——一切的上游。
基础
系列 B · Enterprise Agents(1 篇)

企业级 Agent 落地

从"模型怎么工作"跳到"怎么把模型做成可用的企业 agent"——这是知识链的最后一环。

即将上线

Coming Soon

站点预告还有三个系列在路上,其中两个正好接上你之前关注的鉴权/身份线:

🔐 AI Security
AI 安全系列。暂无链接。
预告
📜 Protocol Design
协议设计系列。暂无链接。
预告
🪪 Identity Architecture
身份架构系列。暂无链接——接你之前学的 SSO/CAS 鉴权线
预告
阅读建议

想速通 → 读第 0 篇(How LLMs Work 总览)就够建立全景。想做推理优化 → 直接精读第 7 篇(Inference)。我已把这两篇做了中文精简讲解,见同目录 uth-inference-zh.htmluth-how-llms-work-zh.html

本页是导航总览,链接指向原作者站点(CC BY-NC-NC-ND 4.0)。中文精简讲解为基于原文要点的重构,非逐字翻译。· 2026-07-30