把大模型从演示变成能值班的系统时,机制可解释性几乎总会先露出工程缺口。下面按可执行的顺序来拆:先讲它解决什么、卡在哪,再讲选型时看哪些数字,最后落到智能体和网关该怎么接。本文面向要上线的工程师,不写空泛趋势。
一、什么是 circuit:因果模型,不是贴标签
52|可解释性入门 讲过,attention weight 不是完整解释,因为它只是相关性线索。机制可解释性(mechanistic interpretability)往前走一步:不满足于“看起来关注哪里”,而是要求因果证据——干预某个内部组件,行为是否按预测变化。
这条路线的难点不在于找不到有意义的组件,而在于三件事经常被混淆:找到一个能解释部分行为的 head,不等于解释了整个模型;干预实验本身也会制造虚假的因果结论;从几层的玩具模型得到的结论,搬到几十层的生产模型上未必成立。本文按这三条线索展开:circuit 在因果意义上怎么定义,induction head 和 IOI 电路两个具体案例分别说明了什么,activation patching 怎么提供因果证据又怎么会给出错误结论,superposition 和 Sparse Autoencoder 为什么是同一个问题的两面。
二、Induction head:谱系起点,也是可扩展性的第一次警示
在机制可解释性里,circuit(电路)指模型内部一组组件及其连接,被证明共同实现了某个具体行为。组件可以是 attention head、MLP、残差流上的某个方向,连接可以是层间的读写关系。
关键在“被证明”。给某个 head 起一个好记的名字不算找到电路;电路研究要求可反驳的因果主张:切掉这些组件,行为要消失;把它们从干净输入替换到损坏输入,行为要恢复。Wang 等人(ICLR 2023)在验证 IOI 电路时提出了三条量化标准—— faithfulness (电路单独能重现多少原模型行为)、 completeness (去掉电路外的部分是否还保持行为)、 minimality (电路里是否有可以再删掉的冗余部分)。这三条标准比“看起来像”严格得多,也是本文后面判断一个电路主张是否站得住的基准。
三、IOI 电路:一个行为需要 26 个 head
Induction head 的形式化定义来自 Elhage 等人(Anthropic,Transformer Circuits Thread,2021)的《A Mathematical Framework for Transformer Circuits》。这篇工作把多头注意力分解成 QK 电路(决定关注哪里)和 OV 电路(决定写入什么),并引入 K-composition :一层的输出可以被下一层用作 key,从而让两层 head 组合出单层无法实现的算法。
Induction head 正是这种组合的产物。它在一个只有两层、只有 attention 没有 MLP 的玩具模型里就能被完整刻画:第一层的 previous token head 在每个位置写入“上一个 token 是谁”;第二层的 induction head 通过 K-composition 读到这个信息,在当前 token 是 A 时去找“前一个 token 也是 A”的位置,然后用 OV 电路把那个位置之后的 token(记为 B)复制到输出。整体效果是:序列里出现过 A B … A ,模型倾向预测下一个是 B 。这正是 in-context learning 最基础的模式之一。
四、Activation patching:把相关性变成因果证据
Olsson 等人(Anthropic,2022,arXiv:2209.11895)把这个案例推向了可扩展性问题的核心。他们在训练早期观察到一次“相变”(phase change):训练损失曲线上出现一个明显的凸起,同一时刻 induction head 大量形成,模型的 in-context learning 能力(用序列早期与晚期 token 的 loss 差衡量)也同步跳变。这个相变出现在从 2 层 attention-only 玩具模型到 40 层、13B 参数全尺寸模型的所有测试模型里,位置大致在训练的前 1~5 亿 token 附近。
但他们对因果性的措辞非常克制,值得原文引用:对于小的 attention-only 模型,论文给出的是 强因果证据 ;对于带 MLP 的大模型,论文明确写的是 相关性证据 (correlational evidence)。也就是说,“induction head 是大模型 in-context learning 的机制来源”这个结论,在玩具模型里被严格证明过,在真实规模的大模型里至今仍是有强相关支持、但未被因果证明的假设。这是本文要强调的第一个可扩展性边界:找到 induction head 不等于解释了大模型的 in-context learning,论文作者自己就没有这样宣称。
五、Patching 自己也会制造“解释幻觉”
如果说 induction head 说明了“电路存在”,Wang 等人(ICLR 2023,《Interpretability in the Wild》)说明了“电路有多大”。他们逆向工程了 GPT-2 small 完成 Indirect Object Identification(IOI)任务的完整机制——给定 When Mary and John went to the store, John gave a drink to ___ ,模型要预测 Mary 而不是重复出现的 John 。
结果是一个包含 26 个 attention head、分成 7 类角色 的电路:
六、Superposition:一个神经元靠不住的原因
作者使用的定位方法是 path patching ——只替换某个 head 到指定下游组件之间的特定路径,而不是整体替换该 head 的所有输出,从而分离出“这条具体的信息通路”对结果的贡献。这个方法后来被 Goldowsky-Dill 等人(arXiv:2304.05969,2023,未经 peer review 的预印本)推广成通用框架。
这个案例最直接的价值,是给“找到一个 head 就解释了模型”这句常见误解一个具体反例:GPT-2 small 只是一个 117M 参数的模型,只完成一个语法层面的指代任务,已经需要 26 个 head 分七种角色协作,还带有一类连作者自己都只能猜测功能的“负向”头。真实模型要完成的任务远比 IOI 复杂,组件数量只会更多。
落地时建议先做的 5 件事
- 用自己的 20 条真实请求测 TTFT / TPOT / 失败原因,不要只看公开榜。
- 先写显存和 KV 缓存账,再决定卡数、量化和并发上限。
- 网关层把鉴权、配额、审计和模型路由收口,应用里不要各接各的 Key。
- 工具调用默认拒绝,按白名单放开,高风险动作必须人审。
- 模型升级准备回滚:旧权重、旧 Prompt、旧评测集要能一键切回。
和智能体产品怎么接
对龙虾PRO这类要把 OpenClaw 落到中国业务场景的平台来说,机制可解释性决定的是延迟能不能进对话、成本能不能规模化、出了问题能不能追溯。技能市场、数字员工和网关都应该吃同一套观测与权限,而不是文章里的概念演示。
本文侧重全链路风控方法论。落地时请用自身业务单据做回放验证,不要把示例阈值直接当生产策略。 相关:风控体检 · 方案资源
常见问题 FAQ
什么是AI智能系统?
「AI智能系统」可概括为:机制可解释性要的不是热力图,而是因果证据。本文用 induction head、IOI 26-head 电路、activation patching、superposition 和 Sparse Autoencoder 讲清楚:找到一个 head 远不等于解释整个模型,patching 本身也会制造“解释幻觉”,SAE 从玩具模型扩到 Claude 3 So 本文从定义、方法与实践要点展开说明。
为什么要关注AI智能系统?
关注AI智能系统,是因为它直接影响效率、风险与可复制性。文中指出:52|可解释性入门 讲过,attention weight 不是完整解释,因为它只是相关性线索。机制可解释性(mechanistic interpretability)往前走一步:不满足于“看起来关注哪里”,而是要求因果证据——干预某个内部组件,行为是否按预测变化。
如何落地AI智能系统?有哪些关键步骤?
建议按以下路径推进AI智能系统:1) 用自己的 20 条真实请求测 TTFT / TPOT / 失败原因,不要只看公开榜。;2) 先写显存和 KV 缓存账,再决定卡数、量化和并发上限。;3) 网关层把鉴权、配额、审计和模型路由收口,应用里不要各接各的 Key。;4) 工具调用默认拒绝,按白名单放开,高风险动作必须人审。;5) 模型升级准备回滚:旧权重、旧 Prompt、旧评测集要能一键切回。。细节见正文对应章节。
AI智能系统适合哪些人或团队?
AI智能系统更适合:产品/技术负责人、运营与增长团队、需要落地智能体或自动化的中小团队、关注「AI智能系统」方向的读者。若你只需要单次聊天式问答,可先读概念;若要上生产,请重点看步骤、权限与风控相关段落。
关于「一、什么是 circuit:因果模型,不是贴标签」,本文给出了什么结论?
在「一、什么是 circuit:因果模型,不是贴标签」部分,要点是:的因果结论;从几层的玩具模型得到的结论,搬到几十层的生产模型上未必成立。本文按这三条线索展开:circuit 在因果意义上怎么定义,induction head 和 IOI 电路两个具体案例分别说明了什么,activation patching 怎么提供因果证据又怎么会给出错误结论,superposition 和 Sparse Autoencoder 为什么是同一个问题的两面。 二、Induction head:谱系起点,也是可扩展性的
关于「二、Induction head:谱系起点,也是可扩展性的第一次警示」,本文给出了什么结论?
在「二、Induction head:谱系起点,也是可扩展性的第一次警示」部分,要点是:osition 读到这个信息,在当前 token 是 A 时去找“前一个 token 也是 A”的位置,然后用 OV 电路把那个位置之后的 token(记为 B)复制到输出。整体效果是:序列里出现过 A B … A ,模型倾向预测下一个是 B 。这正是 in-context learning 最基础的模式之一。 四、Activation patching:把相关性变成因果证据 Olsson 等人(Anthropic,2022,arX