第 02 章 · 大模型核心原理
CHAPTER 02 · 技术地基

大模型核心原理

拆解语言模型、Transformer、Tokenizer、预训练、对齐与推理部署。

6 个主题前置:建议先阅读第 01 章目标:理解大模型从文本输入到生成输出的完整技术链路。
本章知识关系大模型核心原理

理解大模型从文本输入到生成输出的完整技术链路。

LEARNING SEQUENCE

按知识依赖逐步进入

每个主题保留完整原文,并增加教学图、图例、对比表和更清晰的阅读结构。

02.01

什么是大语言模型

大语言模型(Large Language Model, LLM)是当前人工智能领域最核心的技术。理解 LLM 的本质——它是什么、它能做什么、它为什么有效——是掌握大模型与智能体技术的第一步。本章从最基础的原理出发,逐步揭示 LLM 的核心机制。

02.02

Transformer 架构深度剖析

Transformer 是大模型时代一切的技术根基。2017 年 Google 发表的《Attention Is All You Need》提出了这个架构,彻底改变了 NLP 乃至整个深度学习领域的技术路线。本章将从数学原理到工程实现,逐层拆解 Transformer 的每一个组件。

02.03

Tokenizer 与文本表示

Tokenizer(分词器)是大模型处理文本的第一道关卡——它将人类可读的文本转换为模型可处理的 token 序列。分词策略的选择直接影响模型的效率、多语言能力、上下文窗口利用率以及下游应用的表现。本章深入剖析主流的分词算法及其工程实践。

02.04

预训练原理与工程实践

预训练(Pre-training)是大模型能力的根基。通过在海量无标注文本上进行自监督学习,模型习得了语言的语法、语义、逻辑推理和世界知识。本章深入剖析预训练的目标函数、数据工程、训练策略和分布式训练技术。

02.05

对齐技术(SFT / RLHF / DPO)

预训练赋予大模型强大的语言理解和生成能力,但预训练后的模型只会"续写文本",不会遵循指令,也不具备安全性。对齐(Alignment)是将"原始大模型"变成"有用助手"的关键步骤。本章详细剖析从 SFT 到 RLHF 再到 DPO 的完整对齐技术栈。

02.06

推理优化与部署

训练完大模型只是第一步——如何高效地将模型部署到生产环境,以合理的成本提供快速、稳定的推理服务,是同样重要的工程挑战。本章全面覆盖从量化到端侧部署的完整推理优化技术栈。

CHAPTER OVERVIEW

本章主题对照

先看每篇解决什么问题,再决定从哪里深入。

主题核心概念学习产出
什么是大语言模型LLM 的本质定义、参数规模与模型能力、Scaling Laws:大模型的"物理定律"大语言模型(Large Language Model, LLM)是当前人工智能领域最核心的技术。理解 LLM 的本质——它是什么、它能做什么、它为什么有效——是掌握大模型与智能体技术的第一步。本章从最基础的原理出发,逐步揭示 LLM 的核心机制。
Transformer 架构深度剖析Transformer 总体架构、自注意力机制(Self-Attention)深度解析、多头注意力(Multi-Head Attention)Transformer 是大模型时代一切的技术根基。2017 年 Google 发表的《Attention Is All You Need》提出了这个架构,彻底改变了 NLP 乃至整个深度学习领域的技术路线。本章将从数学原理到工程实现,逐层拆解 Transformer 的每一个组件。
Tokenizer 与文本表示为什么需要 Tokenizer、主流分词算法、三种算法的对比Tokenizer(分词器)是大模型处理文本的第一道关卡——它将人类可读的文本转换为模型可处理的 token 序列。分词策略的选择直接影响模型的效率、多语言能力、上下文窗口利用率以及下游应用的表现。本章深入剖析主流的分词算法及其工程实践。
预训练原理与工程实践预训练目标、训练数据、训练策略预训练(Pre-training)是大模型能力的根基。通过在海量无标注文本上进行自监督学习,模型习得了语言的语法、语义、逻辑推理和世界知识。本章深入剖析预训练的目标函数、数据工程、训练策略和分布式训练技术。
对齐技术(SFT / RLHF / DPO)为什么需要对齐、监督微调(SFT, Supervised Fine-Tuning)、基于人类反馈的强化学习(RLHF)预训练赋予大模型强大的语言理解和生成能力,但预训练后的模型只会"续写文本",不会遵循指令,也不具备安全性。对齐(Alignment)是将"原始大模型"变成"有用助手"的关键步骤。本章详细剖析从 SFT 到 RLHF 再到 DPO 的完整对齐技术栈。
推理优化与部署推理的基本流程、量化(Quantization)、推理引擎训练完大模型只是第一步——如何高效地将模型部署到生产环境,以合理的成本提供快速、稳定的推理服务,是同样重要的工程挑战。本章全面覆盖从量化到端侧部署的完整推理优化技术栈。