机器学习崛起(1994–2011)
从 1990 年代中期开始,AI 领域经历了一次深刻的范式转换:从依赖人类专家编写规则,转向让机器从数据中自动学习。这一转变的核心推动力是机器学习(Machine Learning)的兴起。本章详细讲述从"知识驱动"到"数据驱动"的革命性转变,以及在此期间奠定大模型时代基础的关键技术突破。
从 1990 年代中期开始,AI 领域经历了一次深刻的范式转换:从依赖人类专家编写规则,转向让机器从数据中自动学习。这一转变的核心推动力是机器学习(Machine Learning)的兴起。本章详细讲述从"知识驱动"到"数据驱动"的革命性转变,以及在此期间奠定大模型时代基础的关键技术突破。
无需技术基础
范式转换:从知识驱动到数据驱动、经典机器学习算法、深度学习的前奏:神经网络的稳步推进
历史坐标 · AI 发展简史
文章导航
- 引言
- 1. 范式转换:从知识驱动到数据驱动
- 1.1 为什么需要数据驱动
- 1.2 范式转换的三大推动力
- 2. 经典机器学习算法
- 2.1 支持向量机(SVM, 1995)
- 2.2 决策树与集成方法
- 2.3 贝叶斯方法
- 2.4 聚类与降维
- 3. 深度学习的前奏:神经网络的稳步推进
- 3.1 LeNet-5(1998)
- 3.2 长短时记忆网络(LSTM, 1997)
- 3.3 深度信念网络(DBN, 2006)
- 4. 重大应用突破
- 4.1 IBM Watson 与 Jeopardy!(2011)
- 4.2 推荐系统的崛起
- 4.3 计算机视觉的渐进突破
- 4.4 统计自然语言处理
- 5. 计算基础设施的成熟
- 5.1 GPU 通用计算
- 5.2 大数据基础设施
- 6. 本章小结
- 相关章节
- 延伸阅读
点击图中节点可定位到对应正文。
引言
从 1990 年代中期开始,AI 领域经历了一次深刻的范式转换:从依赖人类专家编写规则,转向让机器从数据中自动学习。这一转变的核心推动力是机器学习(Machine Learning)的兴起。本章详细讲述从"知识驱动"到"数据驱动"的革命性转变,以及在此期间奠定大模型时代基础的关键技术突破。
1. 范式转换:从知识驱动到数据驱动
1.1 为什么需要数据驱动
前两代 AI 的核心困境是:
- **专家系统**:需要人类手动编写数千条规则,知识获取成本极高
- 符号 AI:无法处理现实世界的模糊性和不确定性
- 手工特征工程:即使使用统计方法,特征的设计仍依赖领域专家
数据驱动的核心思想: 不再让人类告诉机器"怎么想",而是给机器大量数据,让它自己"学会怎么想"。
1.2 范式转换的三大推动力
| 推动力 | 说明 |
|---|---|
| 数据爆炸 | 互联网普及带来海量数字化数据(网页、邮件、交易记录) |
| 算力提升 | CPU 性能遵循摩尔定律持续增长,GPU 开始用于通用计算 |
| 算法成熟 | SVM、随机森林、贝叶斯方法等高效学习算法相继出现 |
2. 经典机器学习算法
2.1 支持向量机(SVM, 1995)
由 Vladimir Vapnik 和 Corinna Cortes 在 1995 年正式提出,SVM 是 1990s 至 2000s 最具影响力的分类算法之一。
核心思想:
在特征空间中找到一个最优超平面,使得不同类别的数据点之间的间隔(margin)最大化。
根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。
查看原文结构
类别 B
○ ○ ○ ○ ○
───────────────── 支持向量
╔═════════════════╗ 最优超平面(分类边界)
───────────────── 支持向量
● ● ● ● ●
类别 A核技巧(Kernel Trick):
- 当数据在原始空间线性不可分时,通过核函数将数据映射到高维空间
- 在高维空间中,数据可能变得线性可分
- 常用核函数:线性核、多项式核、RBF 核(高斯径向基函数)
SVM 的优势:
- 在小样本数据上表现优异
- 高维空间中仍然有效
- 泛化能力强,不容易过拟合
- 在深度学习崛起之前,SVM 是图像分类、文本分类等领域的首选算法
2.2 决策树与集成方法
决策树(Decision Tree)
[根节点:年龄 > 30?]
/ \
是 否
/ \
[收入 > 5万?] [学历 > 本科?]
/ \ / \
是 否 是 否
| | | |
购买 不购买 购买 不购买- 通过递归地将数据集分割为更纯的子集来构建树结构
- 可解释性强——可以像流程图一样阅读和理解
- 缺点:容易过拟合,对数据噪声敏感
随机森林(Random Forest, 2001)
Leo Breiman 提出的集成方法:
- 构建多棵决策树,每棵树使用随机子集的数据和特征
- 最终预测通过投票(分类)或平均(回归)得出
- 显著降低了单棵决策树的过拟合问题
- 在深度学习之前,是 Kaggle 竞赛中最常用的算法之一
梯度提升树(Gradient Boosting)
- AdaBoost(1997):通过加权迭代组合多个弱分类器
- XGBoost(2014):陈天奇开发,优化了梯度提升的效率和精度,成为 2014-2018 年数据科学竞赛的霸主
2.3 贝叶斯方法
朴素贝叶斯分类器(Naive Bayes)
基于贝叶斯定理,假设特征之间相互独立:
P(类别|特征) = P(特征|类别) × P(类别) / P(特征)
示例:垃圾邮件分类
P(垃圾|包含"免费") = P("免费"|垃圾) × P(垃圾) / P("免费")- 实现简单、训练快速
- 在文本分类(如垃圾邮件过滤)中表现惊人地好
- "朴素"假设(特征独立)在现实中几乎不成立,但实践中效果依然很好
贝叶斯网络(Bayesian Networks)
- 用有向无环图(DAG)表示变量之间的概率依赖关系
- 能够处理不确定性推理
- 在医学诊断、故障分析等需要因果推理的场景中有重要应用
2.4 聚类与降维
K-Means 聚类:将数据自动分为 K 个群组,广泛用于客户分群、图像分割
主成分分析(PCA):降低数据维度,保留最重要的信息,用于可视化和特征提取
t-SNE(2008):Laurens van der Maaten 和 Geoffrey Hinton 提出的降维可视化方法,能够在高维数据中发现有意义的低维结构
3. 深度学习的前奏:神经网络的稳步推进
3.1 LeNet-5(1998)
Yann LeCun 在贝尔实验室开发的 LeNet-5 是第一个成功的卷积神经网络(CNN)商业应用:
架构:
输入(32×32) → 卷积C1(28×28) → 池化S2(14×14) → 卷积C3(10×10) → 池化S4(5×5) → 全连接 → 输出(10类)应用场景:
- 用于美国银行支票上的手写数字识别
- 到 1990 年代末,处理了美国所有支票中超过 10% 的识别工作
- 证明了 CNN 在实际商业场景中的可行性和可靠性
卷积操作的核心直觉:
根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。
查看原文结构
输入图像 卷积核(3×3) 特征图
┌──────┐ ┌─────┐ ┌────┐
│1 2 3 │ │1 0 1│ │ │
│4 5 6 │ ←滑动→ │0 1 0│ ──────→ │ │
│7 8 9 │ │1 0 1│ │ │
└──────┘ └─────┘ └────┘3.2 长短时记忆网络(LSTM, 1997)
Sepp Hochreiter 和 Jürgen Schmidhuber 提出的 LSTM 解决了传统 RNN 的梯度消失问题:
问题: 传统 RNN 在处理长序列时,梯度在反向传播过程中会指数级衰减(消失)或增大(爆炸),导致模型无法学习长距离依赖关系。
LSTM 的解决方案——门控机制:
根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。
查看原文结构
┌─────────────────────────────────┐
│ LSTM 单元 │
│ │
│ 遗忘门 fₜ = σ(Wf·[hₜ₋₁,xₜ]+bf)│ 决定丢弃多少旧信息
│ 输入门 iₜ = σ(Wi·[hₜ₋₁,xₜ]+bi)│ 决定写入多少新信息
│ 候选值 C̃ₜ = tanh(Wc·[hₜ₋₁,xₜ])│ 新的候选记忆
│ 细胞状态 Cₜ = fₜ*Cₜ₋₁ + iₜ*C̃ₜ │ 记忆的核心更新
│ 输出门 oₜ = σ(Wo·[hₜ₋₁,xₜ]+bo)│ 决定输出多少记忆
│ 隐藏状态 hₜ = oₜ*tanh(Cₜ) │ 当前时刻的输出
└─────────────────────────────────┘- 遗忘门:决定从细胞状态中丢弃哪些信息
- 输入门:决定将哪些新信息存入细胞状态
- 输出门:决定从细胞状态中输出哪些信息
应用: LSTM 后来成为机器翻译、语音识别、文本生成等序列任务的标准选择,直到 Transformer 的出现。
3.3 深度信念网络(DBN, 2006)
Geoffrey Hinton 在 2006 年发表的论文被认为是**深度学习时代的开端**:
- 提出通过逐层预训练(Layer-wise Pre-training)来训练深层网络
- 先用无监督学习(受限 Boltzmann 机)逐层预训练每一层
- 再用有监督学习(反向传播)微调整个网络
- 解决了深层网络难以训练的问题
虽然 DBN 的预训练方法后来被更好的初始化技术(如 Xavier/He 初始化)和 Batch Normalization 取代,但它重新点燃了学术界对深层神经网络的兴趣。
4. 重大应用突破
4.1 IBM Watson 与 Jeopardy!(2011)
2011 年 2 月,IBM 的 Watson 系统在电视问答节目 Jeopardy! 中击败了两位人类冠军:
技术栈:
- 自然语言理解:解析复杂的双关语、隐喻和歧义
- 信息检索:从海量知识库中快速检索相关信息
- 置信度评估:判断答案的可靠程度,决定是否"冒险"抢答
- 集成学习:组合了数百个算法的预测结果
意义:
- 证明了 AI 在非结构化自然语言理解方面的巨大进步
- 向公众展示了"统计 AI"相比"规则 AI"的优越性
- 推动了 NLP 领域的投资和关注度
4.2 推荐系统的崛起
- Netflix Prize(2006–2009):Netflix 悬赏 100 万美元给能将推荐算法准确率提升 10% 的团队
- 矩阵分解(Matrix Factorization)成为推荐系统的核心技术
- 协同过滤(Collaborative Filtering)在电商和内容平台中大规模应用
- 推荐系统是机器学习最早实现大规模商业化的应用之一
4.3 计算机视觉的渐进突破
- PASCAL VOC 挑战赛(2005–2012):推动了目标检测算法的系统性进步
- ImageNet 数据集(2009):李飞飞团队构建了包含 1400 万张标注图像的大规模数据集,为深度学习革命提供了关键的"弹药"
- HOG(Histogram of Oriented Gradients)+ SVM 成为行人检测的标准方法
- Deformable Part Models(DPM)在目标检测中取得显著进步
4.4 统计自然语言处理
- Word2Vec(2013):Tomas Mikolov 在 Google 开发的词向量模型,将词语映射到稠密向量空间,使得语义关系可以用向量运算表达(king - man + woman ≈ queen)
- n-gram 语言模型:基于统计的文本预测,在机器翻译和语音识别中广泛应用
- 机器翻译:统计机器翻译(SMT)逐步取代了基于规则的方法
5. 计算基础设施的成熟
5.1 GPU 通用计算
| 时间 | 事件 |
|---|---|
| 1999 | NVIDIA 发布 GeForce 256,首款被称为"GPU"的产品 |
| 2006 | NVIDIA 推出 CUDA,允许开发者使用 GPU 进行通用计算 |
| 2007 | NVIDIA Tesla 系列推出,专为高性能计算设计 |
| 2012 | GPU 在深度学习中的优势被 AlexNet 充分证明 |
为什么 GPU 适合深度学习:
- CPU:少量强大的核心,适合复杂逻辑运算
- GPU:大量简单的核心,适合大规模并行矩阵运算
- 深度学习中的核心操作(矩阵乘法、卷积)恰好是高度可并行的
5.2 大数据基础设施
- MapReduce(2004):Google 提出的分布式计算框架,催生了 Hadoop
- Hadoop(2006):开源的大数据处理平台
- Spark(2009):内存计算框架,速度比 Hadoop 快数十倍
- 这些工具使得处理和训练大规模数据集成为可能
6. 本章小结
| 维度 | 1994–2011 的变化 |
|---|---|
| 方法论 | 从规则驱动转向数据驱动 |
| 核心算法 | SVM、随机森林、LSTM、DBN |
| 应用 | 垃圾邮件过滤、推荐系统、手写识别、问答系统 |
| 基础设施 | GPU 通用计算、大数据平台、ImageNet 数据集 |
| 学术影响 | 机器学习从 AI 的子领域变为主流研究方向 |
关键启示:
- 数据为王:这一时期确立了一个至今有效的原则——在足够的数据面前,简单算法往往优于复杂算法
- 渐进积累的价值:LeNet、LSTM、DBN 等工作在当时并非"爆款",但它们的积累直接催生了 2012 年之后的深度学习革命
- 商业验证的重要性:推荐系统、垃圾邮件过滤等应用证明了 AI/ML 的商业价值,为后续的大规模投资提供了信心
- 基础设施决定上限:GPU、大数据平台、大规模数据集的出现,为深度学习的爆发创造了必要条件
相关章节
- 专家系统与第二次寒冬(1975–1993) — 前情:规则驱动范式的困境与知识获取瓶颈
- 深度学习革命(2012–2019) — 后续:神经网络在算力与数据加持下的全面爆发
延伸阅读
- Cortes, C. & Vapnik, V. (1995). "Support-Vector Networks". Machine Learning, 20(3), 273-297
- Hochreiter, S. & Schmidhuber, J. (1997). "Long Short-Term Memory". Neural Computation, 9(8), 1735-1780
- Hinton, G.E., Osindero, S., & Teh, Y.W. (2006). "A Fast Learning Algorithm for Deep Belief Nets". Neural Computation, 18(7), 1527-1554
- Mikolov, T. et al. (2013). "Efficient Estimation of Word Representations in Vector Space". ICLR
- LeCun, Y. et al. (1998). "Gradient-Based Learning Applied to Document Recognition". Proceedings of the IEEE, 86(11), 2278-2324