专家系统与第二次寒冬(1975–1993)
经历了第一次寒冬后,AI 研究者在 1970 年代末找到了新的突破口——专家系统。通过将人类专家的知识编码为"如果-那么"规则,专家系统在特定领域展现出惊人的实用性,引发了新一轮的投资热潮。然而,知识获取的瓶颈和维护成本的高昂再次将 AI 推入寒冬。本章详细剖析这段从希望到幻灭的完整历程。
经历了第一次寒冬后,AI 研究者在 1970 年代末找到了新的突破口——专家系统。通过将人类专家的知识编码为"如果-那么"规则,专家系统在特定领域展现出惊人的实用性,引发了新一轮的投资热潮。然而,知识获取的瓶颈和维护成本的高昂再次将 AI 推入寒冬。本章详细剖析这段从希望到幻灭的完整历程。
无需技术基础
专家系统的兴起、知识获取瓶颈、日本第五代计算机计划(1982–1993)
历史坐标 · AI 发展简史
文章导航
- 引言
- 1. 专家系统的兴起
- 1.1 什么是专家系统
- 1.2 里程碑系统
- 1.3 专家系统的推理方式
- 2. 知识获取瓶颈
- 2.1 核心问题
- 2.2 知识工程的尝试
- 3. 日本第五代计算机计划(1982–1993)
- 3.1 计划概述
- 3.2 失败原因
- 3.3 历史意义
- 4. 连接主义的悄然复兴
- 4.1 反向传播算法的广泛认知(1986)
- 4.2 Hopfield 网络与 Boltzmann 机
- 4.3 神经认知机(Neocognitron, 1980)
- 5. 第二次 AI 寒冬(1987–1993)
- 5.1 专家系统市场的崩溃
- 5.2 Lisp 机器市场的瓦解
- 5.3 寒冬的影响
- 6. 寒冬中的种子
- 6.1 统计方法的引入
- 6.2 强化学习的理论奠基
- 7. 本章小结
- 相关章节
- 延伸阅读
点击图中节点可定位到对应正文。
引言
经历了第一次寒冬后,AI 研究者在 1970 年代末找到了新的突破口——专家系统。通过将人类专家的知识编码为"如果-那么"规则,专家系统在特定领域展现出惊人的实用性,引发了新一轮的投资热潮。然而,知识获取的瓶颈和维护成本的高昂再次将 AI 推入寒冬。本章详细剖析这段从希望到幻灭的完整历程。
1. 专家系统的兴起
1.1 什么是专家系统
专家系统(Expert System)是一种基于规则的 AI 程序,旨在模拟特定领域人类专家的决策能力。其核心架构包括:
根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。
查看原文结构
┌─────────────────────────────────────┐
│ 专家系统架构 │
│ │
│ ┌─────────────┐ ┌──────────────┐ │
│ │ 知识库 │ │ 推理引擎 │ │
│ │ (Knowledge │ │ (Inference │ │
│ │ Base) │←→│ Engine) │ │
│ │ │ │ │ │
│ │ IF...THEN │ │ 前向链推理 │ │
│ │ 规则集合 │ │ 后向链推理 │ │
│ └─────────────┘ └──────┬───────┘ │
│ │ │
│ ┌──────┴───────┐ │
│ │ 用户接口 │ │
│ │ (User │ │
│ │ Interface) │ │
│ └──────────────┘ │
│ │
│ ┌──────────────────────────────┐ │
│ │ 解释模块(Explanator) │ │
│ │ 能够解释推理过程和结论依据 │ │
│ └──────────────────────────────┘ │
└─────────────────────────────────────┘核心组件:
- 知识库(Knowledge Base):存储领域专家的"如果-那么"(IF-THEN)规则
- 推理引擎(Inference Engine):基于规则进行逻辑推理的核心模块
- 用户接口(User Interface):与用户交互,收集信息并输出结论
- 解释模块(Explanation Facility):能够向用户解释"为什么得出这个结论"
1.2 里程碑系统
MYCIN(1972–1980)
由 Edward Shortliffe 在斯坦福大学开发,是最著名的早期专家系统之一:
- 领域:诊断血液感染疾病并推荐治疗方案
- 规则数量:约 600 条 IF-THEN 规则
- 创新点:引入了"置信度因子"(Certainty Factor),每条规则和结论都带有一个 0-1 之间的置信度,处理医学中的不确定性
- 准确率:在测试中对感染疾病的诊断准确率达 69%,超过了普通医生
- 影响:证明了 AI 在专业领域可以达到甚至超越人类专家水平
DENDRAL(1965–1970s 持续改进)
- 领域:根据质谱数据推断有机分子结构
- 意义:第一个成功的专家系统,在化学领域的实际应用中证明 AI 的商业价值
- 方法论:采用"假设-生成-测试"(Hypothesis-Generation-Testing)范式
XCON / R1(1980)
由 John McDermott 为 DEC(Digital Equipment Corporation)开发:
- 功能:自动配置 VAX 计算机系统订单
- 规则数量:约 2500 条规则
- 经济价值:每年为 DEC 节省约 4000 万美元
- 意义:这是第一个产生巨大商业价值的专家系统,直接引爆了 1980s 的专家系统投资热潮
1.3 专家系统的推理方式
前向链推理(Forward Chaining)
从已知事实出发,逐步应用规则推导新事实,直到得出结论:
根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。
查看原文结构
已知事实 → 匹配规则 → 推导新事实 → 匹配更多规则 → ... → 结论后向链推理(Backward Chaining)
从目标结论出发,反向寻找支持该结论的证据:
根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。
查看原文结构
目标:诊断疾病X?
→ 需要证据A和证据B
→ 证据A需要检查C
→ 检查C结果阳性 → 证据A成立
→ 证据B直接已知 → 证据B成立
→ 结论:疾病X确诊对比:
| 维度 | 前向链推理 | 后向链推理 |
|---|---|---|
| 方向 | 数据驱动(Data-driven) | 目标驱动(Goal-driven) |
| 适用场景 | 监测、预警、分类 | 诊断、规划 |
| 优势 | 能发现意外结论 | 搜索效率高,聚焦目标 |
| 劣势 | 可能推导大量无关结论 | 需要预先知道可能的目标 |
2. 知识获取瓶颈
2.1 核心问题
专家系统的最大瓶颈不在于推理能力,而在于知识的获取和维护,这被称为"知识获取瓶颈"(Knowledge Acquisition Bottleneck):
知识获取过程(传统方式):
根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。
查看原文结构
领域专家 ──(访谈)──→ 知识工程师 ──(编码)──→ 规则库
↑ ↓
耗时数周 需要反复验证
专家表述模糊 规则间可能冲突
隐性知识难以表达 维护成本高昂具体挑战:
| 挑战 | 说明 | 示例 |
|---|---|---|
| 隐性知识 | 专家凭"直觉"决策,难以用规则表达 | 老中医的诊断经验难以完全形式化 |
| 知识不完备 | 规则无法覆盖所有情况 | MYCIN 遇到罕见病原体时无法处理 |
| 规则冲突 | 不同规则可能给出矛盾结论 | 规则A说用药X,规则B说药X禁忌 |
| 维护困难 | 领域知识更新时,数百条规则需要重新审查 | 医学指南更新导致大量规则失效 |
| 扩展性差 | 从100条规则扩展到1000条时,系统行为变得不可预测 | 规则间的交互效应产生"意外"结论 |
2.2 知识工程的尝试
为解决知识获取瓶颈,研究者发展出了"知识工程"(Knowledge Engineering)方法论:
- 结构化访谈:系统地引导专家表达决策过程
- 协议分析(Protocol Analysis):让专家在解决问题时"大声思考"(think aloud),记录其思维过程
- 知识获取工具:如 TEIRESIAS(用于 MYCIN),帮助专家直接输入和修改规则
然而,这些方法只是部分缓解了问题,根本矛盾(人类知识的丰富性与规则系统的有限性)始终存在。
3. 日本第五代计算机计划(1982–1993)
3.1 计划概述
1982 年,日本通商产业省(MITI)启动了"第五代计算机系统"(Fifth Generation Computer Systems, FGCS)计划:
目标:
- 建造具有推理能力的"知识库计算机"
- 使用逻辑编程(Prolog)作为核心语言
- 实现自然语言理解、图像识别等 AI 功能
- 十年内超越美国在计算机领域的领先地位
技术路线:
- 基于并行推理的硬件架构
- 大规模知识库系统
- 约束逻辑编程(Constraint Logic Programming)
3.2 失败原因
尽管投入了约 5 亿美元和大量顶尖人才,FGCS 最终未能实现其宏大目标:
| 失败因素 | 说明 |
|---|---|
| 技术路线偏差 | 押注逻辑编程和符号 AI,错过了神经网络和统计方法的崛起 |
| 硬件发展速度 | 通用处理器的摩尔定律发展速度超过了专用推理硬件 |
| 知识瓶颈 | 构建大规模知识库的工程难度被严重低估 |
| 封闭生态 | 过度自研,与国际主流技术生态脱节 |
3.3 历史意义
虽然 FGCS 在商业上失败了,但它:
- 推动了逻辑编程和并行计算的研究
- 催生了约束满足问题(CSP)领域的重要进展
- 为后来的知识图谱和本体论研究奠定了基础
- 提供了一个关于"国家级 AI 战略"的重要案例研究
4. 连接主义的悄然复兴
4.1 反向传播算法的广泛认知(1986)
1986 年,David Rumelhart、Geoffrey Hinton 和 Ronald Williams 在《Nature》发表了里程碑式论文《Learning Representations by Back-Propagating Errors》,让反向传播算法(Backpropagation)获得了广泛关注。
反向传播的核心思想:
根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。
查看原文结构
前向传播(Forward Pass):
输入 → 隐藏层 → 输出层 → 预测值根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。
查看原文结构
反向传播(Backward Pass):
误差 → 输出层权重梯度 → 隐藏层权重梯度 → ... → 更新所有权重为什么这很重要:
- 解决了 Minsky 指出的多层网络训练问题
- 多层神经网络(MLP)可以学习 XOR 等非线性问题
- 为神经网络提供了一种系统化的学习方法
反向传播解决 XOR 问题:
根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。
查看原文结构
原始空间: 变换后空间:
B h₁
1│ ● ○ 1│ ● ○
│ │
0│ ○ ● 0│ ○
└─────── A └──── h₂
0 1 ●
↑ 隐藏层的非线性变换
使得 ● 和 ○ 线性可分4.2 Hopfield 网络与 Boltzmann 机
Hopfield 网络(1982)
John Hopfield 提出了一种具有"能量函数"的循环神经网络:
- 网络状态会向能量最低点演化,类似于物理系统达到平衡
- 可以作为联想记忆(Associative Memory):输入不完整的模式,网络能"回忆"出完整模式
- 为神经网络提供了物理学视角的理论框架
Boltzmann 机(1985)
Geoffrey Hinton 和 Terry Sejnowski 在 Hopfield 网络基础上引入随机性:
- 引入概率单元和隐藏层
- 使用对比散度(Contrastive Divergence)或 Gibbs 采样进行学习
- 后来的受限 Boltzmann 机(RBM)成为深度学习的预训练关键技术
4.3 神经认知机(Neocognitron, 1980)
日本科学家福岛邦彦(Kunihiko Fukushima)提出了神经认知机:
- 受 Hubel 和 Wiesel 关于猫视觉皮层研究的启发
- 包含交替的 S-层(特征提取)和 C-层(位置不变性)
- 这是卷积神经网络(CNN)的直接前身
- Yann LeCun 后来在此基础上发展出了 LeNet
5. 第二次 AI 寒冬(1987–1993)
5.1 专家系统市场的崩溃
1980 年代中期,专家系统市场经历了快速膨胀和崩溃:
膨胀期(1983–1987):
- 全球专家系统市场估计达到数十亿美元
- 大量公司成立,专门开发各行业的专家系统
- Lisp 机器(如 Symbolics、LMI)成为价值数万美元的专用硬件
- 各国政府纷纷推出 AI 战略计划
崩溃原因:
| 因素 | 说明 |
|---|---|
| 高成本 | 开发一个专家系统需要数百万美元和数年时间 |
| 维护困难 | 知识库需要持续更新,维护成本往往超过开发成本 |
| 脆弱性 | 系统遇到知识库之外的情况时会产生荒谬的结论 |
| Lisp 机器衰落 | 通用 PC 的性能追上了专用 Lisp 机器,后者失去存在价值 |
| 期望落差 | 市场宣传的"AI"远超过实际能力 |
5.2 Lisp 机器市场的瓦解
1980 年代,Symbolics、Lisp Machines Inc. 等公司销售价值 5-10 万美元的 Lisp 专用工作站。但到 1987 年前后:
- Apple Macintosh 和 Sun 工作站的性能已经接近 Lisp 机器
- 价格只有 Lisp 机器的几分之一
- Lisp 机器市场一夜之间崩塌,多家公司倒闭
5.3 寒冬的影响
- 全球 AI 研究经费再次大幅削减
- "AI"一词在学术界和工业界几乎成为贬义词——研究者开始用"机器学习"、"模式识别"等替代
- 大量 AI 研究人员转行
- 但正如第一次寒冬一样,关键的理论突破仍在继续
6. 寒冬中的种子
6.1 统计方法的引入
第二次寒冬期间,一些研究者开始从"规则驱动"转向"数据驱动":
- 隐马尔可夫模型(HMM):在语音识别中取得突破性成功(Jim Baker, Fred Jelinek)
- 决策树(ID3/C4.5):Ross Quinlan 的决策树算法展示了从数据中自动学习分类规则的可行性
- 贝叶斯网络(1988):Judea Pearl 提出了概率图模型,为不确定性推理提供了严格的数学框架
6.2 强化学习的理论奠基
- 1989 年,Chris Watkins 提出 Q-Learning 算法
- 1992 年,Gerald Tesauro 的 TD-Gammon 通过强化学习在西洋双陆棋中达到人类专家水平
- 这些工作为后来的 AlphaGo 和强化学习在大模型对齐中的应用奠定了基础
7. 本章小结
| 阶段 | 时间 | 特征 |
|---|---|---|
| 专家系统兴起 | 1975–1985 | MYCIN、XCON、知识工程、商业热潮 |
| 连接主义复兴 | 1982–1989 | 反向传播、Hopfield 网络、Neocognitron |
| 第二次寒冬 | 1987–1993 | 专家系统崩溃、Lisp 机器瓦解、资金削减 |
关键教训:
- 规则系统的天花板:专家系统证明了 AI 在特定领域的实用价值,但也暴露了"知识获取瓶颈"这个根本性限制
- 专用硬件的风险:Lisp 机器的失败表明,押注专用硬件在通用计算能力飞速发展的时代是危险的
- 数据驱动的种子:寒冬中统计方法和神经网络的悄然进步,为下一阶段的突破积累了关键能量
- 范式转换的征兆:从"知识驱动"到"数据驱动"的转变,在第二次寒冬中已经清晰可见
相关章节
- 第一次繁荣与第一次寒冬(1957–1974) — 前情:AI 的第一个繁荣与寒冬周期
- 机器学习崛起(1994–2011) — 后续:从规则驱动到数据驱动的范式转变
延伸阅读
- Shortliffe, E.H. (1976). Computer-Based Medical Consultations: MYCIN. Elsevier
- Rumelhart, D.E., Hinton, G.E., & Williams, R.J. (1986). "Learning Representations by Back-Propagating Errors". Nature, 323, 533-536
- Fukushima, K. (1980). "Neocognitron: A Self-organizing Neural Network Model for a Mechanism of Pattern Recognition Unaffected by Shift in Position". Biological Cybernetics, 36(4), 193-202
- Pearl, J. (1988). Probabilistic Reasoning in Intelligent Systems. Morgan Kaufmann