AI 伦理与公平性
大模型和 Agent 的决策可能影响人们的就业、信贷、司法等重要领域。如果 AI 系统存在偏见或不公平,将加剧社会不平等。本章探讨 AI 伦理的核心议题和公平性保障方法。
一句话理解
大模型和 Agent 的决策可能影响人们的就业、信贷、司法等重要领域。如果 AI 系统存在偏见或不公平,将加剧社会不平等。本章探讨 AI 伦理的核心议题和公平性保障方法。
阅读前置
建议结合应用章节阅读
本文关注
AI 偏见、公平性度量、去偏见方法
所在知识层
安全边界 · 安全治理与伦理
文章导航
点击图中节点可定位到对应正文。
能力与机会风险与约束
引言
大模型和 Agent 的决策可能影响人们的就业、信贷、司法等重要领域。如果 AI 系统存在偏见或不公平,将加剧社会不平等。本章探讨 AI 伦理的核心议题和公平性保障方法。
1. AI 偏见
1.1 偏见来源
根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。
查看原文结构
4. 反馈循环
- AI 推荐 → 用户行为改变 → 更多同类数据 → 更强的偏见
示例: 推荐系统推荐高薪工作给男性 → 男性更多点击 → 模型学到关联1.2 真实案例
| 案例 | 偏见类型 | 影响 |
|---|---|---|
| 亚马逊招聘 AI | 性别偏见 | 对女性候选人评分更低 |
| COMPAS 量刑系统 | 种族偏见 | 对非裔被告预测再犯率更高 |
| 面部识别 | 种族和性别偏见 | 对深色皮肤女性识别错误率更高 |
| 语言模型生成 | 性别刻板印象 | "医生=他"、"护士=她" |
2. 公平性度量
2.1 主要公平性指标
TEXT
1. 人口统计平价(Demographic Parity)
不同群体的正面预测比例应该相同
P(Ŷ=1 | A=0) = P(Ŷ=1 | A=1)
适用场景:招聘、录取
2. 均等机会(Equal Opportunity)
真正例率在不同群体间相同
P(Ŷ=1 | Y=1, A=0) = P(Ŷ=1 | Y=1, A=1)
适用场景:贷款审批(合格的申请者应被公平对待)
3. 预测平等(Predictive Parity)
预测为正的结果中,实际为正的比例相同
P(Y=1 | Ŷ=1, A=0) = P(Y=1 | Ŷ=1, A=1)
适用场景:犯罪风险评估
⚠️ 不可能定理:以上三种公平性指标通常不能同时满足
需要根据具体场景选择最合适的公平性定义2.2 偏见检测
PYTHON
def audit_model_bias(model, test_data, protected_attribute: str):
"""审计模型偏见"""
results = {"groups": {}, "metrics": {}}
# 按受保护属性分组
for group_value in test_data[protected_attribute].unique():
group = test_data[test_data[protected_attribute] == group_value]
predictions = model.predict(group)
results["groups"][group_value] = {
"count": len(group),
"positive_rate": predictions.mean(),
"accuracy": accuracy_score(group.labels, predictions),
"false_positive_rate": fpr(group.labels, predictions),
"false_negative_rate": fnr(group.labels, predictions),
}
# 计算公平性指标
groups = list(results["groups"].values())
results["metrics"] = {
"demographic_parity_diff": max_positive_rate - min_positive_rate,
"equal_opportunity_diff": max_tpr - min_tpr,
"disparate_impact": min_positive_rate / max_positive_rate,
# < 0.8 通常被认为存在显著偏见
}
return results3. 去偏见方法
3.1 技术方法
| 阶段 | 方法 | 说明 |
|---|---|---|
| 数据阶段 | 重采样 | 平衡不同群体的样本比例 |
| 数据阶段 | 重写标签 | 修正带有偏见的标注 |
| 训练阶段 | 对抗去偏 | 添加对抗损失,使模型无法预测受保护属性 |
| 训练阶段 | 公平性约束 | 在损失函数中添加公平性惩罚 |
| 后处理阶段 | 阈值调整 | 不同群体使用不同的决策阈值 |
| 后处理阶段 | 校准 | 确保预测概率在各群体间校准 |
3.2 LLM 去偏见
TEXT
大模型去偏见的层次:
1. 预训练阶段
- 数据去偏:过滤或平衡训练数据中的偏见内容
- 数据多样化:确保训练数据覆盖不同视角
2. 对齐阶段
- RLHF 中的公平性偏好
- Constitutional AI 中的非歧视原则
- DPO 中的公平性对比数据
3. 推理阶段
- 系统提示中明确要求公平
- 输出检测和过滤
- 多样性采样(降低刻板印象输出)4. AI 伦理原则
4.1 核心原则
| 原则 | 说明 | 实践 |
|---|---|---|
| 公平性 | 不歧视,公平对待所有群体 | 偏见审计 + 公平性约束 |
| 透明度 | 决策过程可解释 | 可解释 AI + 决策说明 |
| 隐私 | 保护个人数据 | 数据最小化 + 匿名化 |
| 安全性 | 系统可靠,不易被滥用 | 安全测试 + 红队测试 |
| 人类控制 | 关键决策有人类参与 | Human-in-the-Loop |
| 问责 | 出现问题可追溯 | 日志记录 + 责任分工 |
| 可持续性 | 考虑环境和社会影响 | 碳足迹评估 + 社会影响评估 |
4.2 红队测试
TEXT
AI 红队测试(Red Teaming):
目的:通过模拟攻击来发现 AI 系统的安全漏洞
红队测试场景:
1. 提示注入测试
- 直接注入、间接注入、多语言注入
2. 越狱测试
- 角色扮演、编码绕过、多步骤诱导
3. 偏见测试
- 不同性别/种族/年龄的平行测试
- 输出中的刻板印象检测
4. 有害内容测试
- 尝试诱导生成暴力、色情、违法内容
5. 隐私测试
- 尝试提取训练数据中的个人信息
- 尝试获取系统提示
6. Agent 安全测试
- 诱导 Agent 执行危险工具操作
- 测试 Agent 的权限边界5. 本章小结
| 维度 | 要点 |
|---|---|
| 偏见来源 | 数据偏见 + 模型偏见 + 部署偏见 + 反馈循环 |
| 公平度量 | 人口统计平价 / 均等机会 / 预测平等 |
| 去偏见 | 数据阶段 / 训练阶段 / 后处理阶段 |
| 伦理原则 | 公平 + 透明 + 隐私 + 安全 + 人类控制 + 问责 |
| 测试 | 红队测试覆盖注入/越狱/偏见/隐私/Agent 安全 |
相关章节
- 大模型安全风险全景 — 偏见与歧视等风险的关联
- AI 治理与法规 — 公平性的法规约束
- 对齐技术(SFT-RLHF-DPO) — 通过对齐实现价值观与公平
延伸阅读
- Mehrabi, N. et al. (2021). "A Survey on Bias and Fairness in Machine Learning". ACM CSUR
- Bender, E.M. et al. (2021). "On the Dangers of Stochastic Parrots". FAccT
- Anthropic (2024). "Responsible Scaling Policy"
- Partnership on AI: partnershiponai.org