第 04 章 · 大模型关键能力
CHAPTER 04 · 能力扩展

大模型关键能力

覆盖长上下文、提示工程、RAG、工具调用、微调与多模态。

6 个主题前置:建议完成第 02 章目标:掌握基础模型连接真实应用的六座桥梁。
本章知识关系大模型关键能力

掌握基础模型连接真实应用的六座桥梁。

LEARNING SEQUENCE

按知识依赖逐步进入

每个主题保留完整原文,并增加教学图、图例、对比表和更清晰的阅读结构。

04.01

上下文窗口与长文本

上下文窗口(Context Window)是大模型一次能"看到"的信息总量,以 token 数衡量。它决定了模型能处理多少信息,是衡量模型实用性的关键指标。本章深入探讨上下文窗口的技术原理、扩展方法和长文本处理的挑战。

04.02

提示工程(Prompt Engineering)

提示工程是与大模型"对话"的艺术和科学——通过精心设计输入文本(prompt),引导模型产生更准确、更有用的输出。这是使用大模型最直接、最频繁的技术能力。本章系统讲解从基础到高级的提示工程方法。

04.03

检索增强生成(RAG)

RAG(Retrieval-Augmented Generation)是当前解决大模型"知识截止"和"幻觉"问题最实用的技术方案。核心思想很简单:让模型在回答前先查阅相关资料,然后基于检索到的内容生成回答。 这类似于人类"开卷考试"——不需要记住所有知识,但需要知道在哪里找、怎么用。

04.04

工具调用(Function Calling / Tool Use)

工具调用是让大模型从"只会说话"变成"能做事"的关键技术。通过 Function Calling,模型可以调用外部 API、执行代码、查询数据库、操作文件系统——这使 LLM 从纯文本生成器进化为能够与外部世界交互的智能系统。这也是智能体(Agent)的核心能力之一。

04.05

微调技术(Fine-tuning)

微调是在预训练模型的基础上,用特定领域或任务的数据进一步训练模型,使其适应特定应用场景。如果说预训练让模型"通识百物",那微调就是让模型"专精一域"。本章详解各种微调方法,重点介绍当前最实用的 LoRA 系列技术。

04.06

多模态能力

多模态(Multimodal)是指 AI 系统能同时理解和生成多种类型的信息——文本、图像、音频、视频。这是大模型从"语言模型"走向"通用智能"的关键一步。本章深入解析多模态模型的技术原理和实际应用。

CHAPTER OVERVIEW

本章主题对照

先看每篇解决什么问题,再决定从哪里深入。

主题核心概念学习产出
上下文窗口与长文本上下文窗口的演进、长上下文的技术挑战、长上下文扩展技术上下文窗口(Context Window)是大模型一次能"看到"的信息总量,以 token 数衡量。它决定了模型能处理多少信息,是衡量模型实用性的关键指标。本章深入探讨上下文窗口的技术原理、扩展方法和长文本处理的挑战。
提示工程(Prompt Engineering)提示词的基本结构、零样本与少样本学习、思维链(Chain-of-Thought, CoT)提示工程是与大模型"对话"的艺术和科学——通过精心设计输入文本(prompt),引导模型产生更准确、更有用的输出。这是使用大模型最直接、最频繁的技术能力。本章系统讲解从基础到高级的提示工程方法。
检索增强生成(RAG)RAG 的核心架构、文档解析与预处理、文本分块(Chunking)RAG(Retrieval-Augmented Generation)是当前解决大模型"知识截止"和"幻觉"问题最实用的技术方案。核心思想很简单:让模型在回答前先查阅相关资料,然后基于检索到的内容生成回答。 这类似于人类"开卷考试"——不需要记住所有知识,但需要知道在哪里找、怎么用。
工具调用(Function Calling / Tool Use)工具调用的基本原理、OpenAI Function Calling 协议、多步工具调用工具调用是让大模型从"只会说话"变成"能做事"的关键技术。通过 Function Calling,模型可以调用外部 API、执行代码、查询数据库、操作文件系统——这使 LLM 从纯文本生成器进化为能够与外部世界交互的智能系统。这也是智能体(Agent)的核心能力之一。
微调技术(Fine-tuning)微调 vs 预训练 vs RAG、全参数微调(Full Fine-tuning)、参数高效微调(PEFT)微调是在预训练模型的基础上,用特定领域或任务的数据进一步训练模型,使其适应特定应用场景。如果说预训练让模型"通识百物",那微调就是让模型"专精一域"。本章详解各种微调方法,重点介绍当前最实用的 LoRA 系列技术。
多模态能力多模态的基本概念、视觉语言模型(VLM)、图像生成多模态(Multimodal)是指 AI 系统能同时理解和生成多种类型的信息——文本、图像、音频、视频。这是大模型从"语言模型"走向"通用智能"的关键一步。本章深入解析多模态模型的技术原理和实际应用。