多模态能力
多模态(Multimodal)是指 AI 系统能同时理解和生成多种类型的信息——文本、图像、音频、视频。这是大模型从"语言模型"走向"通用智能"的关键一步。本章深入解析多模态模型的技术原理和实际应用。
多模态(Multimodal)是指 AI 系统能同时理解和生成多种类型的信息——文本、图像、音频、视频。这是大模型从"语言模型"走向"通用智能"的关键一步。本章深入解析多模态模型的技术原理和实际应用。
建议完成第 02 章
多模态的基本概念、视觉语言模型(VLM)、图像生成
能力扩展 · 大模型关键能力
文章导航
- 引言
- 1. 多模态的基本概念
- 1.1 什么是模态
- 1.2 多模态模型的目标
- 2. 视觉语言模型(VLM)
- 2.1 架构概览
- 2.2 关键技术组件
- 2.3 代表性 VLM 模型
- 2.4 VLM 的能力
- 3. 图像生成
- 3.1 扩散模型(Diffusion Model)
- 3.2 主流图像生成模型
- 3.3 图像生成的关键技术
- 4. 语音与音频
- 4.1 语音识别(ASR)
- 4.2 文本到语音(TTS)
- 4.3 端到端语音对话
- 5. 视频理解与生成
- 5.1 视频理解
- 5.2 视频生成
- 6. 多模态统一架构
- 6.1 从分离到统一
- 6.2 统一架构的优势
- 7. 实际应用
- 7.1 典型应用场景
- 7.2 多模态在 Agent 中的应用
- 8. 本章小结
- 相关章节
- 延伸阅读
点击图中节点可定位到对应正文。
引言
多模态(Multimodal)是指 AI 系统能同时理解和生成多种类型的信息——文本、图像、音频、视频。这是大模型从"语言模型"走向"通用智能"的关键一步。本章深入解析多模态模型的技术原理和实际应用。
1. 多模态的基本概念
1.1 什么是模态
模态(Modality)是信息的一种表现形式:
| 模态 | 示例 | 数据特征 |
|---|---|---|
| 文本 | 文章、对话、代码 | 离散符号序列 |
| 图像 | 照片、图表、截图 | 像素矩阵 (H×W×C) |
| 音频 | 语音、音乐、环境音 | 波形信号 |
| 视频 | 电影、监控、直播 | 时序图像序列 |
| 结构化数据 | 表格、图谱 | 关系型数据 |
1.2 多模态模型的目标
根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。
查看原文结构
"看图说话":图像 → 文本
"文字生图":文本 → 图像
"视频问答":视频 + 文本问题 → 文本回答
"语音对话":语音 → 文本理解 → 文本生成 → 语音合成2. 视觉语言模型(VLM)
2.1 架构概览
当前主流的视觉语言模型采用"视觉编码器 + 连接器 + 语言模型"的架构:
根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。
查看原文结构
图像输入 文本输入
↓ ↓
[视觉编码器] [文本 Embedding]
(ViT / CLIP) (Tokenizer)
↓ ↓
[连接器/投影层] │
(MLP / Q-Former) │
↓ ↓
└──────── 拼接 ─────────────┘
↓
[大语言模型]
(LLaMA / GPT / Qwen)
↓
文本回答2.2 关键技术组件
视觉编码器:
- ViT(Vision Transformer):将图像切分为 patch,用 Transformer 编码
- CLIP(OpenAI):同时训练图像编码器和文本编码器,使图像和文本的向量空间对齐
- SigLIP(Google):改进的 CLIP,使用 Sigmoid 损失
连接器:
- MLP 投影层:简单的线性层映射(LLaVA 方案)
- Q-Former:用可学习的 query 提取视觉特征(BLIP-2 方案)
- Cross-Attention:在 LLM 层中直接插入视觉交叉注意力
2.3 代表性 VLM 模型
| 模型 | 开发者 | 特点 |
|---|---|---|
| GPT-4V/4o | OpenAI | 闭源最强多模态,原生多模态 |
| Gemini | 原生多模态,超长上下文 | |
| LLaVA | 开源社区 | 开源 VLM 先驱,架构简洁 |
| Qwen-VL | 阿里巴巴 | 中文场景优化 |
| InternVL | 上海 AI Lab | 开源高性能 VLM |
| CogVLM | 智谱 AI | 视觉理解能力强 |
2.4 VLM 的能力
| 能力 | 说明 | 示例 |
|---|---|---|
| 图像描述 | 用自然语言描述图像内容 | "一只橘猫坐在窗台上看雨" |
| 视觉问答 | 回答关于图像的问题 | "图中有几个人?" → "3个人" |
| OCR | 识别图像中的文字 | 识别截图、文档照片中的文字 |
| 图表理解 | 分析图表数据 | "这张柱状图显示Q3收入增长了多少?" |
| 视觉推理 | 基于图像进行逻辑推理 | "根据地图,从A到B最近的路是?" |
| UI 理解 | 理解界面截图 | "这个按钮在哪里?" → 定位坐标 |
3. 图像生成
3.1 扩散模型(Diffusion Model)
当前图像生成的主流技术:
根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。
查看原文结构
前向过程(加噪):
原始图像 → 逐步加入噪声 → 纯噪声图像
(清晰) → (略微模糊) → ... → (完全噪声)根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。
查看原文结构
反向过程(去噪/生成):
纯噪声 → 逐步去噪 → 生成图像
(完全噪声) → (隐约成形) → ... → (清晰图像)根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。
查看原文结构
条件引导:
文本提示 "一只在月球上弹吉他的猫" → 引导去噪方向
通过 CLIP 文本编码器将文本转为向量,引导每一步的去噪3.2 主流图像生成模型
| 模型 | 开发者 | 特点 |
|---|---|---|
| DALL·E 3 | OpenAI | 文字渲染能力强,与 ChatGPT 集成 |
| Midjourney v6 | Midjourney | 艺术风格最强 |
| Stable Diffusion 3 | Stability AI | 开源,可本地部署 |
| Imagen 3 | 高质量,与 Gemini 集成 | |
| FLUX | Black Forest Labs | 开源高质量 |
3.3 图像生成的关键技术
CLIP 引导:
根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。
查看原文结构
文本 → CLIP 文本编码器 → 文本向量
↓
引导扩散过程
↓
噪声 → 扩散模型(条件去噪) → 生成图像ControlNet:精确控制生成
根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。
查看原文结构
文本提示 + 控制条件(边缘图/深度图/姿态图)
↓
基础扩散模型 + ControlNet 分支
↓
生成同时满足文本描述和控制条件的图像根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。
查看原文结构
例如:文本"一栋现代别墅" + 建筑草图 → 按草图布局生成别墅渲染图4. 语音与音频
4.1 语音识别(ASR)
| 模型 | 开发者 | 特点 |
|---|---|---|
| Whisper | OpenAI | 开源,多语言,鲁棒性强 |
| Wav2Vec 2.0 | Meta | 自监督预训练 |
| Conformer | 当前 ASR 主流架构 | |
| Paraformer | 阿里 | 中文 ASR 领先 |
4.2 文本到语音(TTS)
| 模型 | 开发者 | 特点 |
|---|---|---|
| ElevenLabs | ElevenLabs | 最自然的语音克隆 |
| Bark | Suno | 开源,多语言 |
| CosyVoice | 阿里 | 开源,中文优秀 |
| ChatTTS | 开源社区 | 对话式语音 |
4.3 端到端语音对话
根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。
查看原文结构
传统方式:语音 → ASR → 文本 → LLM → 文本 → TTS → 语音
延迟高(3 个模型串行),语音信息丢失(语气、情绪)根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。
查看原文结构
端到端方式(GPT-4o):语音 → 语音语言模型 → 语音
延迟低(一个模型),保留语气和情感5. 视频理解与生成
5.1 视频理解
视频 = 图像序列 + 时间信息 + 音频(可选)
视频理解的关键挑战:
- 时间建模:理解事件的时间顺序和因果关系
- 计算效率:视频帧数巨大,不能逐帧处理
- 长视频:理解数小时的视频内容
Gemini 1.5 Pro 的方案:
- 支持长达 1 小时的视频输入
- 利用超长上下文窗口处理视频帧序列
- 可以回答关于视频细节的问题5.2 视频生成
| 模型 | 开发者 | 特点 |
|---|---|---|
| Sora | OpenAI | 最长 1 分钟,质量极高(2024 年发布) |
| Runway Gen-3 | Runway | 商业可用,效果好 |
| Kling | 快手 | 国产领先 |
| Pika | Pika Labs | 简单易用 |
| Vidu | 生数科技 | 国产高质量 |
6. 多模态统一架构
6.1 从分离到统一
根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。
查看原文结构
早期:每个模态一个独立模型
文本 → GPT
图像 → DALL·E
语音 → Whisper根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。
查看原文结构
中期:多模型组合
图像 → CLIP 编码 → 拼接到 LLM → 文本回答根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。
查看原文结构
当前趋势:统一模型
任意模态输入 → 统一 Transformer → 任意模态输出
GPT-4o、Gemini 都朝这个方向发展6.2 统一架构的优势
| 优势 | 说明 |
|---|---|
| 跨模态推理 | 可以在不同模态之间进行推理 |
| 共享知识 | 不同模态的知识互相增强 |
| 简化部署 | 一个模型服务所有模态 |
| 更好的对齐 | 不同模态之间自然对齐 |
7. 实际应用
7.1 典型应用场景
| 场景 | 输入 | 输出 | 示例 |
|---|---|---|---|
| 图片问答 | 图片 + 文字 | 文字 | "这张X光片有什么异常?" |
| 文档理解 | 文档图片/PDF | 文字 | "提取发票的关键信息" |
| 图像生成 | 文字 | 图片 | "生成一张产品宣传图" |
| 视频摘要 | 视频 | 文字 | "总结这个会议视频的重点" |
| 语音助手 | 语音 | 语音 | 实时语音对话 |
| 多模态搜索 | 文字/图片 | 结果 | "找类似的图片" |
7.2 多模态在 Agent 中的应用
根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。
查看原文结构
多模态让 Agent 可以:
1. 看懂屏幕截图 → 操作 GUI 界面
2. 理解用户上传的图片/文件 → 更丰富的交互
3. 生成图表/图像 → 更直观的展示
4. 听懂语音指令 → 自然交互
5. 生成语音回复 → 语音助手8. 本章小结
| 模态 | 理解(输入) | 生成(输出) |
|---|---|---|
| 文本 | LLM 天然支持 | LLM 天然支持 |
| 图像 | VLM(CLIP + LLM) | 扩散模型 |
| 语音 | Whisper / ASR | TTS / 端到端 |
| 视频 | Gemini / 视频理解模型 | Sora / Runway |
关键趋势: 从多模型拼接到统一多模态模型,一个模型处理所有模态的输入和输出。
相关章节
- Transformer架构深度剖析 — 多模态模型的架构基础
- Tokenizer与文本表示 — 从文本表示到多模态统一表示
- 新兴架构与技术 — 统一多模态与原生多模态的前沿方向
延伸阅读
- Radford, A. et al. (2021). "Learning Transferable Visual Models From Natural Language Supervision". ICML (CLIP)
- Liu, H. et al. (2023). "Visual Instruction Tuning". NeurIPS (LLaVA)
- Rombach, R. et al. (2022). "High-Resolution Image Synthesis with Latent Diffusion Models". CVPR (Stable Diffusion)
- Radford, A. et al. (2022). "Robust Speech Recognition via Large-Scale Weak Supervision". ICML (Whisper)
- Brooks, T. et al. (2024). "Video generation models as world simulators". OpenAI (Sora)