AI 发展简史 / 机器学习崛起(1994–2011)
CHAPTER 01 · TOPIC 04

机器学习崛起(1994–2011)

从 1990 年代中期开始,AI 领域经历了一次深刻的范式转换:从依赖人类专家编写规则,转向让机器从数据中自动学习。这一转变的核心推动力是机器学习(Machine Learning)的兴起。本章详细讲述从"知识驱动"到"数据驱动"的革命性转变,以及在此期间奠定大模型时代基础的关键技术突破。

一句话理解

从 1990 年代中期开始,AI 领域经历了一次深刻的范式转换:从依赖人类专家编写规则,转向让机器从数据中自动学习。这一转变的核心推动力是机器学习(Machine Learning)的兴起。本章详细讲述从"知识驱动"到"数据驱动"的革命性转变,以及在此期间奠定大模型时代基础的关键技术突破。

阅读前置

无需技术基础

本文关注

范式转换:从知识驱动到数据驱动、经典机器学习算法、深度学习的前奏:神经网络的稳步推进

所在知识层

历史坐标 · AI 发展简史

文章导航
主教学视觉机器学习崛起(1994–2011) · 知识结构

点击图中节点可定位到对应正文。

事件 / 阶段演进方向

引言

从 1990 年代中期开始,AI 领域经历了一次深刻的范式转换:从依赖人类专家编写规则,转向让机器从数据中自动学习。这一转变的核心推动力是机器学习(Machine Learning)的兴起。本章详细讲述从"知识驱动"到"数据驱动"的革命性转变,以及在此期间奠定大模型时代基础的关键技术突破。


1. 范式转换:从知识驱动到数据驱动

1.1 为什么需要数据驱动

前两代 AI 的核心困境是:

  • **专家系统**:需要人类手动编写数千条规则,知识获取成本极高
  • 符号 AI:无法处理现实世界的模糊性和不确定性
  • 手工特征工程:即使使用统计方法,特征的设计仍依赖领域专家

数据驱动的核心思想: 不再让人类告诉机器"怎么想",而是给机器大量数据,让它自己"学会怎么想"。

1.2 范式转换的三大推动力

推动力说明
数据爆炸互联网普及带来海量数字化数据(网页、邮件、交易记录)
算力提升CPU 性能遵循摩尔定律持续增长,GPU 开始用于通用计算
算法成熟SVM、随机森林、贝叶斯方法等高效学习算法相继出现

2. 经典机器学习算法

2.1 支持向量机(SVM, 1995)

由 Vladimir Vapnik 和 Corinna Cortes 在 1995 年正式提出,SVM 是 1990s 至 2000s 最具影响力的分类算法之一。

核心思想:

在特征空间中找到一个最优超平面,使得不同类别的数据点之间的间隔(margin)最大化。

语义 SVG 重绘机器学习崛起(1994–2011)

根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。

类别 B○ ○ ○ ○ ○支持向量╔ ╗ 最优超平面(分类边界)● ● ● ● ●类别 A
查看原文结构
类别 B
        ○ ○ ○ ○ ○
       ─────────────────  支持向量
      ╔═════════════════╗  最优超平面(分类边界)
       ─────────────────  支持向量
        ● ● ● ● ●
              类别 A

核技巧(Kernel Trick):

  • 当数据在原始空间线性不可分时,通过核函数将数据映射到高维空间
  • 在高维空间中,数据可能变得线性可分
  • 常用核函数:线性核、多项式核、RBF 核(高斯径向基函数)

SVM 的优势:

  • 在小样本数据上表现优异
  • 高维空间中仍然有效
  • 泛化能力强,不容易过拟合
  • 在深度学习崛起之前,SVM 是图像分类、文本分类等领域的首选算法

2.2 决策树与集成方法

决策树(Decision Tree)

TEXT
           [根节点:年龄 > 30?]
           /                    \
         是                     否
        /                        \
  [收入 > 5万?]              [学历 > 本科?]
   /        \                 /         \
  是         否              是          否
  |          |               |           |
购买       不购买          购买        不购买
  • 通过递归地将数据集分割为更纯的子集来构建树结构
  • 可解释性强——可以像流程图一样阅读和理解
  • 缺点:容易过拟合,对数据噪声敏感

随机森林(Random Forest, 2001)

Leo Breiman 提出的集成方法:

  • 构建多棵决策树,每棵树使用随机子集的数据和特征
  • 最终预测通过投票(分类)或平均(回归)得出
  • 显著降低了单棵决策树的过拟合问题
  • 在深度学习之前,是 Kaggle 竞赛中最常用的算法之一

梯度提升树(Gradient Boosting)

  • AdaBoost(1997):通过加权迭代组合多个弱分类器
  • XGBoost(2014):陈天奇开发,优化了梯度提升的效率和精度,成为 2014-2018 年数据科学竞赛的霸主

2.3 贝叶斯方法

朴素贝叶斯分类器(Naive Bayes)

基于贝叶斯定理,假设特征之间相互独立:

TEXT
P(类别|特征) = P(特征|类别) × P(类别) / P(特征)

示例:垃圾邮件分类
P(垃圾|包含"免费") = P("免费"|垃圾) × P(垃圾) / P("免费")
  • 实现简单、训练快速
  • 在文本分类(如垃圾邮件过滤)中表现惊人地好
  • "朴素"假设(特征独立)在现实中几乎不成立,但实践中效果依然很好

贝叶斯网络(Bayesian Networks)

  • 用有向无环图(DAG)表示变量之间的概率依赖关系
  • 能够处理不确定性推理
  • 在医学诊断、故障分析等需要因果推理的场景中有重要应用

2.4 聚类与降维

K-Means 聚类:将数据自动分为 K 个群组,广泛用于客户分群、图像分割

主成分分析(PCA):降低数据维度,保留最重要的信息,用于可视化和特征提取

t-SNE(2008):Laurens van der Maaten 和 Geoffrey Hinton 提出的降维可视化方法,能够在高维数据中发现有意义的低维结构


3. 深度学习的前奏:神经网络的稳步推进

3.1 LeNet-5(1998)

Yann LeCun 在贝尔实验室开发的 LeNet-5 是第一个成功的卷积神经网络(CNN)商业应用:

架构:

TEXT
输入(32×32) → 卷积C1(28×28) → 池化S2(14×14) → 卷积C3(10×10) → 池化S4(5×5) → 全连接 → 输出(10类)

应用场景:

  • 用于美国银行支票上的手写数字识别
  • 到 1990 年代末,处理了美国所有支票中超过 10% 的识别工作
  • 证明了 CNN 在实际商业场景中的可行性和可靠性

卷积操作的核心直觉:

语义 SVG 重绘机器学习崛起(1994–2011)

根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。

1 2 3 · 4 5 6 · 7 8 91 0 1 · 0 1 0
查看原文结构
输入图像          卷积核(3×3)         特征图
┌──────┐          ┌─────┐           ┌────┐
│1 2 3 │          │1 0 1│           │    │
│4 5 6 │  ←滑动→  │0 1 0│  ──────→  │    │
│7 8 9 │          │1 0 1│           │    │
└──────┘          └─────┘           └────┘

3.2 长短时记忆网络(LSTM, 1997)

Sepp Hochreiter 和 Jürgen Schmidhuber 提出的 LSTM 解决了传统 RNN 的梯度消失问题

问题: 传统 RNN 在处理长序列时,梯度在反向传播过程中会指数级衰减(消失)或增大(爆炸),导致模型无法学习长距离依赖关系。

LSTM 的解决方案——门控机制:

语义 SVG 重绘机器学习崛起(1994–2011)

根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。

输入与上下文LSTM 单元系统核心遗忘门 fₜ = σ(Wf· hₜ₋₁,xₜ +b…输入门 iₜ = σ(Wi· hₜ₋₁,xₜ +b…候选值 C̃ₜ = tanh(Wc· hₜ₋₁,x…工具、结果与反馈细胞状态 Cₜ = fₜCₜ₋₁ + iₜC̃ₜ …输出门 oₜ = σ(Wo· hₜ₋₁,xₜ +b…
查看原文结构
┌─────────────────────────────────┐
│         LSTM 单元               │
│                                 │
│  遗忘门 fₜ = σ(Wf·[hₜ₋₁,xₜ]+bf)│  决定丢弃多少旧信息
│  输入门 iₜ = σ(Wi·[hₜ₋₁,xₜ]+bi)│  决定写入多少新信息
│  候选值 C̃ₜ = tanh(Wc·[hₜ₋₁,xₜ])│  新的候选记忆
│  细胞状态 Cₜ = fₜ*Cₜ₋₁ + iₜ*C̃ₜ │  记忆的核心更新
│  输出门 oₜ = σ(Wo·[hₜ₋₁,xₜ]+bo)│  决定输出多少记忆
│  隐藏状态 hₜ = oₜ*tanh(Cₜ)      │  当前时刻的输出
└─────────────────────────────────┘
  • 遗忘门:决定从细胞状态中丢弃哪些信息
  • 输入门:决定将哪些新信息存入细胞状态
  • 输出门:决定从细胞状态中输出哪些信息

应用: LSTM 后来成为机器翻译、语音识别、文本生成等序列任务的标准选择,直到 Transformer 的出现。

3.3 深度信念网络(DBN, 2006)

Geoffrey Hinton 在 2006 年发表的论文被认为是**深度学习时代的开端**:

  • 提出通过逐层预训练(Layer-wise Pre-training)来训练深层网络
  • 先用无监督学习(受限 Boltzmann 机)逐层预训练每一层
  • 再用有监督学习(反向传播)微调整个网络
  • 解决了深层网络难以训练的问题

虽然 DBN 的预训练方法后来被更好的初始化技术(如 Xavier/He 初始化)和 Batch Normalization 取代,但它重新点燃了学术界对深层神经网络的兴趣。


4. 重大应用突破

4.1 IBM Watson 与 Jeopardy!(2011)

2011 年 2 月,IBM 的 Watson 系统在电视问答节目 Jeopardy! 中击败了两位人类冠军:

技术栈:

  • 自然语言理解:解析复杂的双关语、隐喻和歧义
  • 信息检索:从海量知识库中快速检索相关信息
  • 置信度评估:判断答案的可靠程度,决定是否"冒险"抢答
  • 集成学习:组合了数百个算法的预测结果

意义:

  • 证明了 AI 在非结构化自然语言理解方面的巨大进步
  • 向公众展示了"统计 AI"相比"规则 AI"的优越性
  • 推动了 NLP 领域的投资和关注度

4.2 推荐系统的崛起

  • Netflix Prize(2006–2009):Netflix 悬赏 100 万美元给能将推荐算法准确率提升 10% 的团队
  • 矩阵分解(Matrix Factorization)成为推荐系统的核心技术
  • 协同过滤(Collaborative Filtering)在电商和内容平台中大规模应用
  • 推荐系统是机器学习最早实现大规模商业化的应用之一

4.3 计算机视觉的渐进突破

  • PASCAL VOC 挑战赛(2005–2012):推动了目标检测算法的系统性进步
  • ImageNet 数据集(2009):李飞飞团队构建了包含 1400 万张标注图像的大规模数据集,为深度学习革命提供了关键的"弹药"
  • HOG(Histogram of Oriented Gradients)+ SVM 成为行人检测的标准方法
  • Deformable Part Models(DPM)在目标检测中取得显著进步

4.4 统计自然语言处理

  • Word2Vec(2013):Tomas Mikolov 在 Google 开发的词向量模型,将词语映射到稠密向量空间,使得语义关系可以用向量运算表达(king - man + woman ≈ queen)
  • n-gram 语言模型:基于统计的文本预测,在机器翻译和语音识别中广泛应用
  • 机器翻译:统计机器翻译(SMT)逐步取代了基于规则的方法

5. 计算基础设施的成熟

5.1 GPU 通用计算

时间事件
1999NVIDIA 发布 GeForce 256,首款被称为"GPU"的产品
2006NVIDIA 推出 CUDA,允许开发者使用 GPU 进行通用计算
2007NVIDIA Tesla 系列推出,专为高性能计算设计
2012GPU 在深度学习中的优势被 AlexNet 充分证明

为什么 GPU 适合深度学习:

  • CPU:少量强大的核心,适合复杂逻辑运算
  • GPU:大量简单的核心,适合大规模并行矩阵运算
  • 深度学习中的核心操作(矩阵乘法、卷积)恰好是高度可并行的

5.2 大数据基础设施

  • MapReduce(2004):Google 提出的分布式计算框架,催生了 Hadoop
  • Hadoop(2006):开源的大数据处理平台
  • Spark(2009):内存计算框架,速度比 Hadoop 快数十倍
  • 这些工具使得处理和训练大规模数据集成为可能

6. 本章小结

维度1994–2011 的变化
方法论从规则驱动转向数据驱动
核心算法SVM、随机森林、LSTM、DBN
应用垃圾邮件过滤、推荐系统、手写识别、问答系统
基础设施GPU 通用计算、大数据平台、ImageNet 数据集
学术影响机器学习从 AI 的子领域变为主流研究方向

关键启示:

  1. 数据为王:这一时期确立了一个至今有效的原则——在足够的数据面前,简单算法往往优于复杂算法
  2. 渐进积累的价值:LeNet、LSTM、DBN 等工作在当时并非"爆款",但它们的积累直接催生了 2012 年之后的深度学习革命
  3. 商业验证的重要性:推荐系统、垃圾邮件过滤等应用证明了 AI/ML 的商业价值,为后续的大规模投资提供了信心
  4. 基础设施决定上限:GPU、大数据平台、大规模数据集的出现,为深度学习的爆发创造了必要条件

相关章节


延伸阅读

  • Cortes, C. & Vapnik, V. (1995). "Support-Vector Networks". Machine Learning, 20(3), 273-297
  • Hochreiter, S. & Schmidhuber, J. (1997). "Long Short-Term Memory". Neural Computation, 9(8), 1735-1780
  • Hinton, G.E., Osindero, S., & Teh, Y.W. (2006). "A Fast Learning Algorithm for Deep Belief Nets". Neural Computation, 18(7), 1527-1554
  • Mikolov, T. et al. (2013). "Efficient Estimation of Word Representations in Vector Space". ICLR
  • LeCun, Y. et al. (1998). "Gradient-Based Learning Applied to Document Recognition". Proceedings of the IEEE, 86(11), 2278-2324