先给结论:比较两个网络的表示,不能靠作者自选的直觉测验。同一对网络,中心核对齐会说各层很像,典型相关会说后层已经不像。换「同深度应对齐」的测验,前者好看;换敏感性测验,后者好看。该让相似度跟着功能走:任务正确率差是表示不同的信号,指标必须看见。跨多项功能更稳的,往往是把形状对齐的普氏距离,而不是最新的核方法。

为什么「再发明一种不变性」填不成指标竞赛

痛点是文献用直觉清单给新指标颁奖。有人要求对可逆线性变换不变,于是推典型相关;有人要求同架构不同初始化时同深度最像,于是推中心核对齐。两张热力图可以对同一对网络给出相反故事。继续加不变性或加一条直觉测验,只能再让某一种方法看起来赢。正确做法是先承认:任何单一直觉都能被另一条直觉打脸。

功能才是不那么任意的锚。两个模型正确率差得大,说明它们在处理数据上已经不同,中间表示不该被判成一样。当然,完美拟合某一任务的正确率差也不对,因为指标该看见多种重要差别,而不是只看见这一项。好指标是在若干功能上普遍高相关,而不是在作者最喜欢的测验上满分。一个硬例子:同样的语言编码器,不同微调种子,分布内正确率几乎一样,分布外可以从零到六成。两个都稳健的模型,相似度该高;一稳一不稳,该低。拿一百个这样的模型两两比,看(不)相似度和分布外正确率差是否同向。

五步把相似度从审美收成可复核的基准

  1. 禁止只用一条直觉测验发论文。至少同时报特异性和敏感性。只赢一条,写明输在哪条。
  2. 功能操作化成任务正确率(或线性探针正确率)的差。表示对的(不)相似度要和这个差相关。相关在许多对模型上算,不是看两张热力图像不像人脑分区。
  3. 基准要覆盖多种变化轴:训练种子、层深度、删主分量、预训练种子、微调种子;功能轴至少包括探针正确率和分布外测试。单一轴会把指标过拟合到该轴的几何上。
  4. 把普氏距离当必比基线。它做的是把两组表示用正交变换对齐后再比形状,古典、不时髦,但跨子任务更稳,常常贴近各项第一名。中心核对齐和投影加权的典型相关会在某些子任务称霸、在另一些掉队。最后一项「预训练加微调种子、看分布外」可以难到谁都相关不高,应保留当挑战集,而不是删掉以免难看。
  5. 用基准去评其他解释工具,不只评相似度。可视化、归因、回路发现,同样能被「自选测验」美化。功能相关这根尺子可以共用。
指标 它被哪条直觉抬起来 跨功能时 门禁
中心核对齐 同深度应对齐 有的子任务强、有的弱 禁止当唯一证据
典型相关 可逆线性不变 敏感性好,特异性差 禁止当唯一证据
普氏距离 形状对齐(基线) 更稳,常近第一 新指标必须先比过它
只看热力图 视觉叙事 可与正确率无关 禁止当结论
单任务完美相关 该任务功能 看不见别的差别 要多项功能

现场有三条。其一,同架构不同种子在分布内可以难分,在分布外可以差出六十个点。若相似度把它们判成一样,它量的是训练损失附近的几何,不是你关心的功能。其二,没有哪种指标该在所有子任务称王。基准的价值是暴露「这项强、那项弱」,并给新方法留一道谁都还没过的关。其三,视觉模型和语言模型都要测。只在一种模态上赢,不能写成通用表示工具。

比较表示是为了回答「这两个网络是不是在做同一件事」。正确率差是目前最便宜、最跨架构的「同一件事」探针。等有了更好的功能电池,相似度基准该跟着换电池,而不是换更漂亮的核。现场还要防一件事:把「对可逆线性变换不变」写成绝对美德。下游若真的把表示旋转一下任务就垮,指标对旋转不敏感,反而会把功能差看不见。不变性清单必须服从功能,不能反过来指挥功能。

若只能改论文模板一处:新相似度必须交出与功能差的相关表,并包含普氏基线。只有热力图和一条自选测验的,不当进度。评审时把「同深度应对齐」从必过关降成可选诊断:它对初始化噪声敏感,却对分布外功能可以完全瞎。诊断可以留,关卡必须是功能相关。

结论:相似度要跟功能走,不要跟直觉走

换测验就能让任何方法好看。正确率差是表示不同的信号。普氏距离跨任务更稳,时髦核方法会偏科。仍用一张热力图宣布两个网络一样,是在用审美代替基准。

你下次比较两个模型的内部,先报和哪些功能差相关、有没有输给普氏距离。报不出来,相似就不能写进结论。

效率龙虾 会带着下面这段开聊

按文章《表示相似度不要靠直觉测验:要对齐功能差别,普氏距离往往更稳》把卡点收成可执行步骤:先做什么、别踩哪条、怎么验证。

用效率龙虾试这篇

本文侧重全链路风控方法论。落地时请用自身业务单据做回放验证,不要把示例阈值直接当生产策略。 相关:风控体检 · 方案资源

常见问题 FAQ

什么是AI智能系统?

「AI智能系统」可概括为:换一套直觉测验就能让任何指标好看。好的相似度应随任务正确率差一起动。中心核对齐和典型相关各霸一项,跨任务更稳的是普氏距离。 本文从定义、方法与实践要点展开说明。

为什么要关注AI智能系统?

关注AI智能系统,是因为它直接影响效率、风险与可复制性。文中指出:痛点是文献用直觉清单给新指标颁奖。有人要求对可逆线性变换不变,于是推典型相关;有人要求同架构不同初始化时同深度最像,于是推中心核对齐。两张热力图可以对同一对网络给出相反故事。继续加不变性或加一条直觉测验,只能再让某一种方法看起来赢。正确做法是先承认:任何单一直觉都能被另一条直觉打脸。

如何落地AI智能系统?有哪些关键步骤?

建议按以下路径推进AI智能系统:1) 禁止只用一条直觉测验发论文。至少同时报特异性和敏感性。只赢一条,写明输在哪条。;2) 功能操作化成任务正确率(或线性探针正确率)的差。表示对的(不)相似度要和这个差相关。相关在许多对模型上算,不是看两张热力图像不像人脑分区。;3) 基准要覆盖多种变化轴:训练种子、层深度、删主分量、预训练种子、微调种子;功能轴至少包括探针正确率和分布外测试。单一轴会把指标过拟合到该轴的几何上。;4) 把普氏距离当必比基线。它做的是把两组表示用正交变换对齐后再比形状,古典、不时髦,但跨子任务更稳,常常贴近各项第一名。中心核对齐和投影加权的典型相关会在某些子任…;5) 用基准去评其他解释工具,不只评相似度。可视化、…

AI智能系统适合哪些人或团队?

AI智能系统更适合:产品/技术负责人、运营与增长团队、需要落地智能体或自动化的中小团队、关注「AI智能系统」方向的读者。若你只需要单次聊天式问答,可先读概念;若要上生产,请重点看步骤、权限与风控相关段落。

关于「为什么「再发明一种不变性」填不成指标竞赛」,本文给出了什么结论?

在「为什么「再发明一种不变性」填不成指标竞赛」部分,要点是:到六成。两个都稳健的模型,相似度该高;一稳一不稳,该低。拿一百个这样的模型两两比,看(不)相似度和分布外正确率差是否同向。 五步把相似度从审美收成可复核的基准 禁止只用一条直觉测验发论文。至少同时报特异性和敏感性。只赢一条,写明输在哪条。 功能操作化成任务正确率(或线性探针正确率)的差。表示对的(不)相似度要和这个差相关。相关在许多对模型上算,不是看两张热力图像不像人脑分区。 基准要覆盖多种变化轴:训练种子、层深度、删主分量、预训练种子

关于「五步把相似度从审美收成可复核的基准」,本文给出了什么结论?

在「五步把相似度从审美收成可复核的基准」部分,要点是:,先报和哪些功能差相关、有没有输给普氏距离。报不出来,相似就不能写进结论。