A13 / research

可解释性、不确定性、对齐与安全

可解释性、不确定性、对齐与安全围绕第一编 解释与归因、第二编 不确定性与稳健性、第三编 对齐与安全综合复习建立连续章节顺序。

结构
3 编 · 6
适合读者
适合准备阅读研究文献并需要统一记号、方法和边界条件的读者。
开始本册

BEFORE READING

先修与记号

本册对象

研究解释方法、校准、分布外风险、对齐目标和安全评估。

先修教材

符号约定

  • 本册在首次使用时定义可解释性、不确定性、对齐与安全专用符号,并区分标量、向量、算子与单位。
  • 同一符号出现多种约定时明确命名空间、假设和适用章节。

CONTENTS

完整目录

PART 01

第一编 解释与归因

第一编 解释与归因组织特征归因、显著性与反事实、表示探测与机制可解释性,形成连续的学习单元。

  1. 01

    特征归因、显著性与反事实

    特征归因、显著性与反事实:比较梯度、扰动、Shapley 归因和反事实解释,检查基线、相关特征与解释忠实度。

    阅读本章
  2. 02

    表示探测与机制可解释性

    表示探测与机制可解释性:用探针、激活干预和电路假设研究内部机制,区分相关性证据、因果证据与可读故事。

    阅读本章
PART 02

第二编 不确定性与稳健性

第二编 不确定性与稳健性组织校准、分布外检测与选择性预测、鲁棒性、对抗攻击与防御评估,形成连续的学习单元。

  1. 03

    校准、分布外检测与选择性预测

    校准、分布外检测与选择性预测:计算可靠性图与校准误差,比较温度缩放、分布外分数和选择性预测,并避免测试集调参。

    阅读本章
  2. 04

    鲁棒性、对抗攻击与防御评估

    鲁棒性、对抗攻击与防御评估:从威胁模型构造对抗扰动,比较白盒与黑盒攻击、防御和自适应评估,避免梯度遮蔽误判。

    阅读本章
PART 03

第三编 对齐与安全综合复习

第三编 对齐与安全综合复习组织对齐目标、反馈与奖励建模、安全评测、系统边界与治理综合复习,形成连续的学习单元。

  1. 05

    对齐目标、反馈与奖励建模

    对齐目标、反馈与奖励建模:把偏好数据、奖励模型和策略目标分开,分析代理目标、奖励黑客、分布偏移和反馈者差异。

    阅读本章
  2. 06

    安全评测、系统边界与治理综合复习

    安全评测、系统边界与治理综合复习:把技术评测、使用情境、风险登记和治理责任连接起来,以证据等级、残余风险和监测计划收口。

    阅读本章

综合练习

  • 每章安排定义辨析、推导计算和结果核验练习。
  • 本册末章安排跨 Part 综合题,并保留可复算的解题检查点。

相关教材