安全治理与伦理 / AI 伦理与公平性
CHAPTER 10 · TOPIC 03

AI 伦理与公平性

大模型和 Agent 的决策可能影响人们的就业、信贷、司法等重要领域。如果 AI 系统存在偏见或不公平,将加剧社会不平等。本章探讨 AI 伦理的核心议题和公平性保障方法。

一句话理解

大模型和 Agent 的决策可能影响人们的就业、信贷、司法等重要领域。如果 AI 系统存在偏见或不公平,将加剧社会不平等。本章探讨 AI 伦理的核心议题和公平性保障方法。

阅读前置

建议结合应用章节阅读

本文关注

AI 偏见、公平性度量、去偏见方法

所在知识层

安全边界 · 安全治理与伦理

文章导航
主教学视觉AI 伦理与公平性 · 知识结构

点击图中节点可定位到对应正文。

能力与机会风险与约束

引言

大模型和 Agent 的决策可能影响人们的就业、信贷、司法等重要领域。如果 AI 系统存在偏见或不公平,将加剧社会不平等。本章探讨 AI 伦理的核心议题和公平性保障方法。


1. AI 偏见

1.1 偏见来源

语义 SVG 重绘AI 伦理与公平性

根据原图的箭头、并列、分层与循环关系选择对应图形;可展开核对原文结构。

查看原文结构
4. 反馈循环
   - AI 推荐 → 用户行为改变 → 更多同类数据 → 更强的偏见
   示例: 推荐系统推荐高薪工作给男性 → 男性更多点击 → 模型学到关联

1.2 真实案例

案例偏见类型影响
亚马逊招聘 AI性别偏见对女性候选人评分更低
COMPAS 量刑系统种族偏见对非裔被告预测再犯率更高
面部识别种族和性别偏见对深色皮肤女性识别错误率更高
语言模型生成性别刻板印象"医生=他"、"护士=她"

2. 公平性度量

2.1 主要公平性指标

TEXT
1. 人口统计平价(Demographic Parity)
   不同群体的正面预测比例应该相同
   P(Ŷ=1 | A=0) = P(Ŷ=1 | A=1)
   适用场景:招聘、录取

2. 均等机会(Equal Opportunity)
   真正例率在不同群体间相同
   P(Ŷ=1 | Y=1, A=0) = P(Ŷ=1 | Y=1, A=1)
   适用场景:贷款审批(合格的申请者应被公平对待)

3. 预测平等(Predictive Parity)
   预测为正的结果中,实际为正的比例相同
   P(Y=1 | Ŷ=1, A=0) = P(Y=1 | Ŷ=1, A=1)
   适用场景:犯罪风险评估

⚠️ 不可能定理:以上三种公平性指标通常不能同时满足
   需要根据具体场景选择最合适的公平性定义

2.2 偏见检测

PYTHON
def audit_model_bias(model, test_data, protected_attribute: str):
    """审计模型偏见"""
    
    results = {"groups": {}, "metrics": {}}
    
    # 按受保护属性分组
    for group_value in test_data[protected_attribute].unique():
        group = test_data[test_data[protected_attribute] == group_value]
        predictions = model.predict(group)
        
        results["groups"][group_value] = {
            "count": len(group),
            "positive_rate": predictions.mean(),
            "accuracy": accuracy_score(group.labels, predictions),
            "false_positive_rate": fpr(group.labels, predictions),
            "false_negative_rate": fnr(group.labels, predictions),
        }
    
    # 计算公平性指标
    groups = list(results["groups"].values())
    results["metrics"] = {
        "demographic_parity_diff": max_positive_rate - min_positive_rate,
        "equal_opportunity_diff": max_tpr - min_tpr,
        "disparate_impact": min_positive_rate / max_positive_rate,
        # < 0.8 通常被认为存在显著偏见
    }
    
    return results

3. 去偏见方法

3.1 技术方法

阶段方法说明
数据阶段重采样平衡不同群体的样本比例
数据阶段重写标签修正带有偏见的标注
训练阶段对抗去偏添加对抗损失,使模型无法预测受保护属性
训练阶段公平性约束在损失函数中添加公平性惩罚
后处理阶段阈值调整不同群体使用不同的决策阈值
后处理阶段校准确保预测概率在各群体间校准

3.2 LLM 去偏见

TEXT
大模型去偏见的层次:

1. 预训练阶段
   - 数据去偏:过滤或平衡训练数据中的偏见内容
   - 数据多样化:确保训练数据覆盖不同视角

2. 对齐阶段
   - RLHF 中的公平性偏好
   - Constitutional AI 中的非歧视原则
   - DPO 中的公平性对比数据

3. 推理阶段
   - 系统提示中明确要求公平
   - 输出检测和过滤
   - 多样性采样(降低刻板印象输出)

4. AI 伦理原则

4.1 核心原则

原则说明实践
公平性不歧视,公平对待所有群体偏见审计 + 公平性约束
透明度决策过程可解释可解释 AI + 决策说明
隐私保护个人数据数据最小化 + 匿名化
安全性系统可靠,不易被滥用安全测试 + 红队测试
人类控制关键决策有人类参与Human-in-the-Loop
问责出现问题可追溯日志记录 + 责任分工
可持续性考虑环境和社会影响碳足迹评估 + 社会影响评估

4.2 红队测试

TEXT
AI 红队测试(Red Teaming):

目的:通过模拟攻击来发现 AI 系统的安全漏洞

红队测试场景:
1. 提示注入测试
   - 直接注入、间接注入、多语言注入
   
2. 越狱测试
   - 角色扮演、编码绕过、多步骤诱导
   
3. 偏见测试
   - 不同性别/种族/年龄的平行测试
   - 输出中的刻板印象检测
   
4. 有害内容测试
   - 尝试诱导生成暴力、色情、违法内容
   
5. 隐私测试
   - 尝试提取训练数据中的个人信息
   - 尝试获取系统提示

6. Agent 安全测试
   - 诱导 Agent 执行危险工具操作
   - 测试 Agent 的权限边界

5. 本章小结

维度要点
偏见来源数据偏见 + 模型偏见 + 部署偏见 + 反馈循环
公平度量人口统计平价 / 均等机会 / 预测平等
去偏见数据阶段 / 训练阶段 / 后处理阶段
伦理原则公平 + 透明 + 隐私 + 安全 + 人类控制 + 问责
测试红队测试覆盖注入/越狱/偏见/隐私/Agent 安全

相关章节


延伸阅读

  • Mehrabi, N. et al. (2021). "A Survey on Bias and Fairness in Machine Learning". ACM CSUR
  • Bender, E.M. et al. (2021). "On the Dangers of Stochastic Parrots". FAccT
  • Anthropic (2024). "Responsible Scaling Policy"
  • Partnership on AI: partnershiponai.org