第一次繁荣与第一次寒冬(1957–1974)
达特茅斯会议之后,人工智能研究进入了第一个高速发展期。研究者充满乐观,相信在一代人内就能创造出具有人类水平智能的机器。然而,技术瓶颈和资金断裂很快将这种乐观击碎。本章详细梳理 AI 从狂热到幻灭的第一个完整周期。
达特茅斯会议之后,人工智能研究进入了第一个高速发展期。研究者充满乐观,相信在一代人内就能创造出具有人类水平智能的机器。然而,技术瓶颈和资金断裂很快将这种乐观击碎。本章详细梳理 AI 从狂热到幻灭的第一个完整周期。
无需技术基础
第一次繁荣:黄金年代(1957–1966)、第一次 AI 寒冬(1967–1974)、寒冬中的暗流
历史坐标 · AI 发展简史
文章导航
点击图中节点可定位到对应正文。
引言
达特茅斯会议之后,人工智能研究进入了第一个高速发展期。研究者充满乐观,相信在一代人内就能创造出具有人类水平智能的机器。然而,技术瓶颈和资金断裂很快将这种乐观击碎。本章详细梳理 AI 从狂热到幻灭的第一个完整周期。
1. 第一次繁荣:黄金年代(1957–1966)
1.1 感知机(Perceptron)的诞生与轰动
1957 年,美国心理学家弗兰克·罗森布拉特(Frank Rosenblatt)在康奈尔大学提出了感知机(Perceptron)——第一个可以从数据中"学习"的人工神经网络模型。
感知机模型结构:
根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。
查看原文结构
输入 x₁ ──w₁──┐
输入 x₂ ──w₂──┼── Σ(wᵢxᵢ) + b ── 阶跃函数 ──→ 输出 (0 或 1)
输入 x₃ ──w₃──┘
↑
偏置 b (bias)工作原理:
- 输入向量经过加权求和后,通过一个阶跃激活函数(step function)输出二分类结果
- 学习规则:如果预测正确,权重不变;如果预测错误,按误差方向调整权重
- 收敛定理:如果数据线性可分,感知机学习算法保证在有限步内收敛
感知机可以解决的问题:
- AND 门:两个输入都为 1 时输出 1
- OR 门:任一输入为 1 时输出 1
- 简单的二分类问题(如判断邮件是否为垃圾邮件的极简版本)
轰动效应:
- 1958 年《纽约时报》报道:"海军揭示电子计算机的胚胎,期望它能走路、说话、看见、书写、自我复制并感知自身存在"
- 美国海军研究办公室(ONR)投入大量资金支持感知机研究
- Rosenblatt 预言感知机最终能够识别人、呼唤其名字、即时翻译语言
1.2 Logic Theorist 与 GPS
Logic Theorist(1956–1957)
Allen Newell 和 Herbert Simon 开发的 Logic Theorist 是历史上第一个 AI 程序:
- 能够自动证明怀特海和罗素《数学原理》中的数学定理
- 在 52 个定理中成功证明了 38 个,其中一些证明比原书更简洁
- 被投稿到《Journal of Symbolic Logic》,但因作者包含"机器"而被拒——讽刺地反映了当时学术界对 AI 的态度
General Problem Solver(GPS, 1959)
Newell 和 Simon 进一步开发了 GPS(通用问题求解器):
- 基于"手段-目的分析"(Means-Ends Analysis):识别当前状态与目标状态的差异,选择能缩小差异的操作
- 试图成为一个可以解决任意问题的通用框架
- 局限:只能处理高度结构化的问题,现实世界的复杂性远超其处理能力
1.3 LISP 语言与早期 NLP
LISP(1958)
McCarthy 在 MIT 发明了 LISP(LISt Processing),这是一种专门为 AI 研究设计的编程语言:
| 创新特性 | 说明 | 对 AI 的意义 |
|---|---|---|
| 递归 | 函数可以调用自身 | 自然表达搜索和推理过程 |
| 符号处理 | 原生支持符号(而非数字)运算 | 适合知识表示和逻辑推理 |
| 垃圾回收 | 自动内存管理 | 让研究者专注于算法而非内存管理 |
| 高阶函数 | 函数可以作为参数传递 | 支持灵活的元编程 |
| 宏系统 | 代码即数据,数据即代码 | 允许程序自我修改 |
LISP 统治了 AI 编程长达 30 年,衍生出 Scheme、Common Lisp 等方言,至今仍在某些领域使用。
早期自然语言处理
- ELIZA(1966):Joseph Weizenbaum 在 MIT 开发的对话程序,通过简单的模式匹配模拟心理治疗师。尽管极其简单,许多用户却对其产生了情感依赖(Weizenbaum 称之为"ELIZA 效应"),这预示了后来 AI 交互中的核心问题
- SHRDLU(1970):Terry Winograd 开发的系统,能在"积木世界"(blocks world)微环境中理解自然语言指令并执行操作,展示了受限领域内 NLP 的可能性
1.4 乐观预言
这一时期的研究者对未来充满了极大信心。以下是几个著名的乐观预测:
| 年份 | 预测者 | 预测内容 |
|---|---|---|
| 1958 | H.A. Simon | "十年内,数字计算机将成为国际象棋世界冠军" |
| 1960 | H.A. Simon | "二十年内,机器将能做到任何人能做到的事" |
| 1965 | H.A. Simon | "二十年内,机器将能够完成人类能完成的任何工作" |
| 1967 | M. Minsky | "在一代人之内,'人工智能'问题将被基本解决" |
| 1970 | M. Minsky | "在三到八年内,我们将拥有具备普通人类智能的机器" |
反思: 这些预测的过度乐观后来成为 AI 遭受资金削减的重要把柄。Minsky 后来承认:"我们当时太天真了。"这种"炒作-幻灭"的周期在 AI 历史上反复出现(后见 Gartner Hype Cycle),在大模型时代仍然值得警惕。
2. 第一次 AI 寒冬(1967–1974)
2.1 Minsky 和 Papert 的致命打击:《Perceptrons》(1969)
1969 年,Minsky 和 Seymour Papert 出版了《Perceptrons》一书,对感知机进行了严格的数学分析,揭示了其根本性局限:
核心发现——XOR 问题:
感知机无法解决"异或"(XOR)问题。XOR 的真值表如下:
| 输入 A | 输入 B | XOR 输出 |
|---|---|---|
| 0 | 0 | 0 |
| 0 | 1 | 1 |
| 1 | 0 | 1 |
| 1 | 1 | 0 |
XOR 问题在二维平面上是线性不可分的——不存在一条直线能将 (0,1) 和 (1,0) 与 (0,0) 和 (1,1) 分开。
根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。
查看原文结构
B
1 │ ●(0,1) ○(1,1)
│
0 │ ○(0,0) ●(1,0)
└────────────────── A
0 1根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。
查看原文结构
● = 输出1 ○ = 输出0
→ 无法用一条直线分开 ● 和 ○Minsky & Papert 的结论:
- 单层感知机只能处理线性可分问题
- 虽然多层感知机理论上可以解决 XOR,但当时没有有效的多层网络训练算法
- 他们悲观地推断:神经网络的扩展"不太可能"产生有意义的结果
影响:
- 这本书几乎摧毁了整个神经网络研究领域
- 政府和企业大幅削减了对神经网络研究的资金
- 神经网络研究者花费了近 20 年才从这次打击中恢复
- Rosenblatt 本人也在 1971 年的一场船难中去世,未能看到神经网络的复兴
历史讽刺: Minsky 本人是连接主义的早期贡献者(SNARC 的创造者),但他对感知机的批评反而扼杀了这个领域。他后来表示,他并不想"杀死"神经网络,只是想指出其局限性。
2.2 Lighthill 报告(1973)
1973 年,英国数学家 James Lighthill 受英国政府委托,对 AI 研究进行了全面评估,发表了著名的《Lighthill Report》:
主要批评:
- AI 研究在 25 年中未能在其"宏大目标"上取得实质性进展
- 组合爆炸(Combinatorial Explosion)问题:许多 AI 算法的计算复杂度随问题规模指数增长,在实际应用中不可行
- AI 研究分为三个独立子领域(高级自动化、机器人学、认知科学),彼此缺乏协同
直接后果:
- 英国政府几乎完全停止了对 AI 研究的资助
- 仅保留爱丁堡大学等少数几个研究中心
- 其他国家纷纷效仿,全球 AI 研究经费急剧下降
2.3 DARPA 的资金削减
在美国,国防高级研究计划局(DARPA)也开始重新评估 AI 的投资回报:
- 1969 年的 Mansfield Amendment 要求 DARPA 只资助与军事任务直接相关的项目
- AI 的基础研究项目(如自然语言理解、视觉识别)被认为距离实用太过遥远
- 1970 年代初期,DARPA 对 AI 的资助大幅削减
2.4 技术瓶颈的本质
第一次 AI 寒冬的根本原因是技术瓶颈,而非仅仅是资金或政治问题:
| 瓶颈 | 说明 | 为什么当时无法解决 |
|---|---|---|
| 计算能力 | 计算机的内存和速度极其有限 | 1970 年代最强的计算机仅有几 MB 内存 |
| 数据匮乏 | 没有大规模数字化数据集 | 互联网尚未诞生,数据存储成本极高 |
| 算法局限 | 缺乏有效的多层网络训练方法 | 反向传播算法要到 1986 年才被广泛认知 |
| 组合爆炸 | 搜索空间随问题规模指数增长 | 理论问题,至今仍需要启发式方法应对 |
| 知识表示 | 如何让机器"理解"世界知识 | 符号 AI 的知识获取瓶颈(Knowledge Acquisition Bottleneck) |
3. 寒冬中的暗流
尽管表面上 AI 研究陷入低谷,但一些关键工作在寒冬中悄然推进:
3.1 反向传播算法的早期形式
- 1970 年,Seppo Linnainmaa 在芬兰发表了关于自动微分的反向模式(reverse mode of automatic differentiation)的论文
- 1974 年,Paul Werbos 在博士论文中首次提出将反向传播应用于神经网络训练
- 这些工作当时几乎被忽视,直到 1986 年被 Rumelhart、Hinton 和 Williams 重新发现和推广
3.2 知识工程的萌芽
- 1960s 末至 1970s 初,研究者开始探索将专家知识编码为规则系统
- DENDRAL(1965–1970s):由 Edward Feigenbaum 等人开发,能够根据质谱数据推断分子结构,是第一个成功的专家系统
- 这些工作为下一次 AI 繁荣(专家系统时代)埋下了种子
3.3 Prolog 与逻辑编程
- 1972 年,Alain Colmerauer 在法国开发了 Prolog(Programming in Logic)语言
- 与 LISP 不同,Prolog 基于形式逻辑的推理机制(归结原理),更适合知识表示和推理
- 后来成为日本"第五代计算机"计划的核心语言
4. 本章小结
| 阶段 | 时间 | 特征 |
|---|---|---|
| 黄金年代 | 1957–1966 | 感知机轰动、LISP 诞生、乐观预测层出不穷 |
| 寒冬降临 | 1967–1974 | 《Perceptrons》打击、Lighthill 报告、资金断崖 |
关键教训:
- 过度承诺的代价:1960s 的乐观预测设定了无法达到的期望,当承诺未兑现时,整个领域遭受了信任危机
- 理论瓶颈的持续性:Minsky 指出的线性可分限制确实存在,但解决方案(多层网络 + 反向传播)在 15 年后出现——技术突破往往需要等待配套条件的成熟
- 寒冬不等于死亡:即使在资金最匮乏的时期,关键的理论突破仍在继续。AI 的寒冬淘汰了浮躁,留下了真正有价值的研究
相关章节
- 思想起源与理论奠基(1940s–1956) — 前情:达特茅斯会议与感知机之前的理论奠基
- 专家系统与第二次寒冬(1975–1993) — 后续:AI 的第二个繁荣与寒冬周期
延伸阅读
- Rosenblatt, F. (1958). "The Perceptron: A Probabilistic Model for Information Storage and Organization in the Brain". Psychological Review, 65(6), 386-408
- Minsky, M. & Papert, S. (1969). Perceptrons: An Introduction to Computational Geometry. MIT Press
- Lighthill, J. (1973). "Artificial Intelligence: A General Survey". In Artificial Intelligence: A Paper Symposium. Science Research Council
- Werbos, P. (1974). Beyond Regression: New Tools for Prediction and Analysis in the Behavioral Sciences. PhD thesis, Harvard University