大模型关键能力 / 多模态能力
CHAPTER 04 · TOPIC 06

多模态能力

多模态(Multimodal)是指 AI 系统能同时理解和生成多种类型的信息——文本、图像、音频、视频。这是大模型从"语言模型"走向"通用智能"的关键一步。本章深入解析多模态模型的技术原理和实际应用。

一句话理解

多模态(Multimodal)是指 AI 系统能同时理解和生成多种类型的信息——文本、图像、音频、视频。这是大模型从"语言模型"走向"通用智能"的关键一步。本章深入解析多模态模型的技术原理和实际应用。

阅读前置

建议完成第 02 章

本文关注

多模态的基本概念、视觉语言模型(VLM)、图像生成

所在知识层

能力扩展 · 大模型关键能力

文章导航
主教学视觉多模态能力 · 知识结构

点击图中节点可定位到对应正文。

核心主题关系与流向

引言

多模态(Multimodal)是指 AI 系统能同时理解和生成多种类型的信息——文本、图像、音频、视频。这是大模型从"语言模型"走向"通用智能"的关键一步。本章深入解析多模态模型的技术原理和实际应用。


1. 多模态的基本概念

1.1 什么是模态

模态(Modality)是信息的一种表现形式:

模态示例数据特征
文本文章、对话、代码离散符号序列
图像照片、图表、截图像素矩阵 (H×W×C)
音频语音、音乐、环境音波形信号
视频电影、监控、直播时序图像序列
结构化数据表格、图谱关系型数据

1.2 多模态模型的目标

语义 SVG 重绘多模态能力

根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。

"看图说话":图像文本"文字生图":文本图像"视频问答":视频 + 文本问题文本回答
查看原文结构
"看图说话":图像 → 文本
  "文字生图":文本 → 图像
  "视频问答":视频 + 文本问题 → 文本回答
  "语音对话":语音 → 文本理解 → 文本生成 → 语音合成

2. 视觉语言模型(VLM)

2.1 架构概览

当前主流的视觉语言模型采用"视觉编码器 + 连接器 + 语言模型"的架构:

语义 SVG 重绘多模态能力

根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。

输入 / 表示图像输入 文本输入核心架构视觉编码器 文本 Embedding(ViT / CLIP) (Tokenizer)连接器/投影层输出 / 应用(MLP / Q-Former)拼接
查看原文结构
图像输入                    文本输入
  ↓                           ↓
[视觉编码器]              [文本 Embedding]
(ViT / CLIP)             (Tokenizer)
  ↓                           ↓
[连接器/投影层]               │
(MLP / Q-Former)             │
  ↓                           ↓
  └──────── 拼接 ─────────────┘
              ↓
        [大语言模型]
        (LLaMA / GPT / Qwen)
              ↓
         文本回答

2.2 关键技术组件

视觉编码器:

  • ViT(Vision Transformer):将图像切分为 patch,用 Transformer 编码
  • CLIP(OpenAI):同时训练图像编码器和文本编码器,使图像和文本的向量空间对齐
  • SigLIP(Google):改进的 CLIP,使用 Sigmoid 损失

连接器:

  • MLP 投影层:简单的线性层映射(LLaVA 方案)
  • Q-Former:用可学习的 query 提取视觉特征(BLIP-2 方案)
  • Cross-Attention:在 LLM 层中直接插入视觉交叉注意力

2.3 代表性 VLM 模型

模型开发者特点
GPT-4V/4oOpenAI闭源最强多模态,原生多模态
GeminiGoogle原生多模态,超长上下文
LLaVA开源社区开源 VLM 先驱,架构简洁
Qwen-VL阿里巴巴中文场景优化
InternVL上海 AI Lab开源高性能 VLM
CogVLM智谱 AI视觉理解能力强

2.4 VLM 的能力

能力说明示例
图像描述用自然语言描述图像内容"一只橘猫坐在窗台上看雨"
视觉问答回答关于图像的问题"图中有几个人?" → "3个人"
OCR识别图像中的文字识别截图、文档照片中的文字
图表理解分析图表数据"这张柱状图显示Q3收入增长了多少?"
视觉推理基于图像进行逻辑推理"根据地图,从A到B最近的路是?"
UI 理解理解界面截图"这个按钮在哪里?" → 定位坐标

3. 图像生成

3.1 扩散模型(Diffusion Model)

当前图像生成的主流技术:

语义 SVG 重绘多模态能力 · 结构 1

根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。

前向过程(加噪):原始图像逐步加入噪声纯噪声图像(清晰)(略微模糊)
查看原文结构
前向过程(加噪):
  原始图像 → 逐步加入噪声 → 纯噪声图像
  (清晰) → (略微模糊) → ... → (完全噪声)
语义 SVG 重绘多模态能力 · 结构 2

根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。

反向过程(去噪/生成):纯噪声逐步去噪生成图像(完全噪声)(隐约成形)
查看原文结构
反向过程(去噪/生成):
  纯噪声 → 逐步去噪 → 生成图像
  (完全噪声) → (隐约成形) → ... → (清晰图像)
语义 SVG 重绘多模态能力 · 结构 3

根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。

输入 / 表示条件引导:核心架构文本提示 "一只在月球上弹吉他的猫"引导去噪方向通过 CLIP 文本编码器将文本转为向量,引导每一…输出 / 应用
查看原文结构
条件引导:
  文本提示 "一只在月球上弹吉他的猫" → 引导去噪方向
  通过 CLIP 文本编码器将文本转为向量,引导每一步的去噪

3.2 主流图像生成模型

模型开发者特点
DALL·E 3OpenAI文字渲染能力强,与 ChatGPT 集成
Midjourney v6Midjourney艺术风格最强
Stable Diffusion 3Stability AI开源,可本地部署
Imagen 3Google高质量,与 Gemini 集成
FLUXBlack Forest Labs开源高质量

3.3 图像生成的关键技术

CLIP 引导:

语义 SVG 重绘多模态能力

根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。

输入 / 表示文本核心架构CLIP 文本编码器文本向量引导扩散过程输出 / 应用噪声扩散模型(条件去噪)
查看原文结构
文本 → CLIP 文本编码器 → 文本向量
                            ↓
                      引导扩散过程
                            ↓
噪声 → 扩散模型(条件去噪) → 生成图像

ControlNet:精确控制生成

语义 SVG 重绘多模态能力 · 结构 1

根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。

文本提示 + 控制条件(边缘图/深度图…基础扩散模型 + ControlNet…生成同时满足文本描述和控制条件的图像
查看原文结构
文本提示 + 控制条件(边缘图/深度图/姿态图)
    ↓
基础扩散模型 + ControlNet 分支
    ↓
生成同时满足文本描述和控制条件的图像
语义 SVG 重绘多模态能力 · 结构 2

根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。

例如:文本"一栋现代别墅" + 建筑草…按草图布局生成别墅渲染图
查看原文结构
例如:文本"一栋现代别墅" + 建筑草图 → 按草图布局生成别墅渲染图

4. 语音与音频

4.1 语音识别(ASR)

模型开发者特点
WhisperOpenAI开源,多语言,鲁棒性强
Wav2Vec 2.0Meta自监督预训练
ConformerGoogle当前 ASR 主流架构
Paraformer阿里中文 ASR 领先

4.2 文本到语音(TTS)

模型开发者特点
ElevenLabsElevenLabs最自然的语音克隆
BarkSuno开源,多语言
CosyVoice阿里开源,中文优秀
ChatTTS开源社区对话式语音

4.3 端到端语音对话

语义 SVG 重绘多模态能力 · 结构 1

根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。

传统方式:语音ASR文本LLMTTS语音
查看原文结构
传统方式:语音 → ASR → 文本 → LLM → 文本 → TTS → 语音
  延迟高(3 个模型串行),语音信息丢失(语气、情绪)
语义 SVG 重绘多模态能力 · 结构 2

根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。

端到端方式(GPT-4o):语音语音语言模型语音延迟低(一个模型),保留语气和情感
查看原文结构
端到端方式(GPT-4o):语音 → 语音语言模型 → 语音
  延迟低(一个模型),保留语气和情感

5. 视频理解与生成

5.1 视频理解

TEXT
视频 = 图像序列 + 时间信息 + 音频(可选)

视频理解的关键挑战:
- 时间建模:理解事件的时间顺序和因果关系
- 计算效率:视频帧数巨大,不能逐帧处理
- 长视频:理解数小时的视频内容

Gemini 1.5 Pro 的方案:
- 支持长达 1 小时的视频输入
- 利用超长上下文窗口处理视频帧序列
- 可以回答关于视频细节的问题

5.2 视频生成

模型开发者特点
SoraOpenAI最长 1 分钟,质量极高(2024 年发布)
Runway Gen-3Runway商业可用,效果好
Kling快手国产领先
PikaPika Labs简单易用
Vidu生数科技国产高质量

6. 多模态统一架构

6.1 从分离到统一

语义 SVG 重绘多模态能力 · 结构 1

根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。

早期:每个模态一个独立模型文本GPT图像DALL·E语音
查看原文结构
早期:每个模态一个独立模型
  文本 → GPT
  图像 → DALL·E
  语音 → Whisper
语义 SVG 重绘多模态能力 · 结构 2

根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。

中期:多模型组合图像CLIP 编码拼接到 LLM文本回答
查看原文结构
中期:多模型组合
  图像 → CLIP 编码 → 拼接到 LLM → 文本回答
语义 SVG 重绘多模态能力 · 结构 3

根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。

输入与上下文当前趋势:统一模型系统核心任意模态输入统一 Transformer任意模态输出工具、结果与反馈GPT-4o、Gemini 都朝这个方向发展
查看原文结构
当前趋势:统一模型
  任意模态输入 → 统一 Transformer → 任意模态输出
  GPT-4o、Gemini 都朝这个方向发展

6.2 统一架构的优势

优势说明
跨模态推理可以在不同模态之间进行推理
共享知识不同模态的知识互相增强
简化部署一个模型服务所有模态
更好的对齐不同模态之间自然对齐

7. 实际应用

7.1 典型应用场景

场景输入输出示例
图片问答图片 + 文字文字"这张X光片有什么异常?"
文档理解文档图片/PDF文字"提取发票的关键信息"
图像生成文字图片"生成一张产品宣传图"
视频摘要视频文字"总结这个会议视频的重点"
语音助手语音语音实时语音对话
多模态搜索文字/图片结果"找类似的图片"

7.2 多模态在 Agent 中的应用

语义 SVG 重绘多模态能力

根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。

多模态让 Agent 可以:1. 看懂屏幕截图操作 GUI 界面2. 理解用户上传的图片/文件更丰富的交互3. 生成图表/图像
查看原文结构
多模态让 Agent 可以:
1. 看懂屏幕截图 → 操作 GUI 界面
2. 理解用户上传的图片/文件 → 更丰富的交互
3. 生成图表/图像 → 更直观的展示
4. 听懂语音指令 → 自然交互
5. 生成语音回复 → 语音助手

8. 本章小结

模态理解(输入)生成(输出)
文本LLM 天然支持LLM 天然支持
图像VLM(CLIP + LLM)扩散模型
语音Whisper / ASRTTS / 端到端
视频Gemini / 视频理解模型Sora / Runway

关键趋势: 从多模型拼接到统一多模态模型,一个模型处理所有模态的输入和输出。


相关章节


延伸阅读

  • Radford, A. et al. (2021). "Learning Transferable Visual Models From Natural Language Supervision". ICML (CLIP)
  • Liu, H. et al. (2023). "Visual Instruction Tuning". NeurIPS (LLaVA)
  • Rombach, R. et al. (2022). "High-Resolution Image Synthesis with Latent Diffusion Models". CVPR (Stable Diffusion)
  • Radford, A. et al. (2022). "Robust Speech Recognition via Large-Scale Weak Supervision". ICML (Whisper)
  • Brooks, T. et al. (2024). "Video generation models as world simulators". OpenAI (Sora)