先给结论:安全基准若和通用能力、训练算力一起涨,它量的就不是单独的安全。大约一半被测过的安全榜,和上游能力分高度相关;能力分又和训练算力的对数相关到九成六。对齐、可扩展监督、真话、静态抗攻击、伦理知识,都会跟着规模走。偏见、动态抗攻击、校准误差相关更低。安全进步必须从规模里剥出来。剥不出来,涨分就是安全洗白:把变强写成变安全。
为什么「安全榜也在涨」会变成假进步
痛点是把任何带安全二字的分数都当控制效果。模型变大,更会考试,拒答话术更顺,静态攻击集被记住。分数涨了,像安全在做。其实量的是同一根能力尺子。尺子和算力绑死,再多一篇「我们在安全上取得突破」,都可能只是多烧了计算。
相关高低要按操作化来看,不能按标题。同一主题,换一种出题,相关可以掉下来。所以必须实测,不能靠直觉说「这题看起来很安全」。看起来很安全、算力一涨就满,正是洗白的材料。
洗白的危害是资源配置。钱和名额流向能涨分的方法,方法往往是继续做大。真正去相关的工作难涨、难看、难发,会被当成没进展。没进展的假象会让人觉得规模本身就是安全策略。
五步把安全测量从能力影子里拆出来
- 每张安全榜先报与能力分、与算力对数的相关。相关高,榜只能当能力附录,不能当安全主证据。
- 设计时故意去相关。固定能力、只变安全干预;或在能力相近的模型之间比安全。比不过,干预无效,不是「模型还不够强」。
- 静态攻击集定期换。被记住的越狱模板会随预训练进模型,分数会假涨。动态、自适应攻击才更像现场。
- 安全干预要报能力代价。能力不掉、安全分暴涨,先查是不是还在量能力。能力大掉、安全微涨,要写清值不值。
- 发布材料禁止只用一张与算力同步的安全曲线。必须另附去相关后的对照。没有对照,曲线当宣传,不当门槛。
| 榜 | 常见相关 | 它容易变成 | 门禁 |
|---|---|---|---|
| 对齐 / 真话 / 伦理知识 | 高 | 能力影子 | 必须去相关 |
| 静态抗攻击 | 高 | 记住模板 | 换成动态 |
| 偏见 / 校准 | 较低 | 更像独立维 | 仍要实测相关 |
| 与算力同步的曲线 | 好看 | 洗白 | 禁止单列 |
| 固定能力比干预 | 不好看 | 真安全 | 默认对照 |
现场有三条。其一,安全洗白不是公关术语,是测量失败。烟草广告说医生更爱某个牌子,和「更大模型在安全榜更高」是同一结构:用声望指标代替目标指标。其二,去相关不是让安全榜永远难。难是为了不被能力带着走。走通了,才知道方法是不是在动安全。其三,动态抗攻击相关低,不代表已经安全。只代表这维还不等于做大。仍可能被下一轮自适应攻击打穿。低相关是入场券,不是毕业证。
度量五件事:与能力分相关、与算力相关、是否固定能力对照、攻击是否动态、发布是否单列同步曲线。五件说不清,安全榜是能力榜的马甲。马甲不能当发布门槛。
有人会说能力和安全本来就一起涨,拆开是假问题。一起涨可以是真的,但必须能指出「同样强的两个模型,谁更抗压、谁更不撒谎」。指不出,就还没有安全维。没有安全维,规模叙事会把所有预算吸走。
建设者该把去相关写进出题说明书。部署评测的人该拒收不报相关的安全成绩单。成绩单只写百分数、不写和能力的相关,百分数作废。
若只能改一处:先在每张安全榜旁边印上与能力分的相关系数。印出来,洗白会变难看。难看才会有人去做真正去相关的题。
相关高的榜仍可留作能力监控,只是标题要改。改成「安全相关的能力题」,读者才不会把规模当控制。标题不改,内部再诚实,对外仍是洗白。
动态攻击的预算要单列。静态集便宜,动态贵,贵才会被砍。砍了,相关又会升回去。升回去还报「安全在涨」,是用便宜尺子骗贵问题。贵问题要写进预算行,不写进愿望清单。愿望清单一砍,测量立刻回到能力影子。
同行评审也要问相关。方法论文只报安全涨、不报与能力相关,退回。退回几次,出题才会把去相关当第一页,而不是附录里的一句抱歉。第一页没有相关,这篇就不算安全论文,只算能力附录。
安全题还要防被反过来洗:故意把能力做差来刷「很安全」。所以要同时报能力下限。下限不够,安全分再高也不准入高风险岗位。两列都要,缺一列就缺一门。
结论:安全进步是剥掉规模之后还剩下的那截
跟着算力涨的安全榜,量的是变强。变强可以是副产品,不能当主证据。拆开测、动态打、固定能力对照,涨分才配写成更安全。
你下次看安全曲线,先问它和训练算力还绑不绑。还绑着,把曲线从门槛里拿掉。
本文侧重全链路风控方法论。落地时请用自身业务单据做回放验证,不要把示例阈值直接当生产策略。 相关:风控体检 · 方案资源
常见问题 FAQ
什么是AI智能系统?
「AI智能系统」可概括为:一半安全基准和通用能力、训练算力高度相关。对齐、诚实、静态抗攻击都会跟着规模走。涨分可能只是模型变强。安全题要故意去相关,才能量真正的安全进步。 本文从定义、方法与实践要点展开说明。
为什么要关注AI智能系统?
关注AI智能系统,是因为它直接影响效率、风险与可复制性。文中指出:痛点是把任何带安全二字的分数都当控制效果。模型变大,更会考试,拒答话术更顺,静态攻击集被记住。分数涨了,像安全在做。其实量的是同一根能力尺子。尺子和算力绑死,再多一篇「我们在安全上取得突破」,都可能只是多烧了计算。
如何落地AI智能系统?有哪些关键步骤?
建议按以下路径推进AI智能系统:1) 每张安全榜先报与能力分、与算力对数的相关。相关高,榜只能当能力附录,不能当安全主证据。;2) 设计时故意去相关。固定能力、只变安全干预;或在能力相近的模型之间比安全。比不过,干预无效,不是「模型还不够强」。;3) 静态攻击集定期换。被记住的越狱模板会随预训练进模型,分数会假涨。动态、自适应攻击才更像现场。;4) 安全干预要报能力代价。能力不掉、安全分暴涨,先查是不是还在量能力。能力大掉、安全微涨,要写清值不值。;5) 发布材料禁止只用一张与算力同步的安全曲线。必须另附去相关后的对照。没有对照,曲线当宣传,不当门槛。。细节见正文对应章节。
AI智能系统适合哪些人或团队?
AI智能系统更适合:产品/技术负责人、运营与增长团队、需要落地智能体或自动化的中小团队、关注「AI智能系统」方向的读者。若你只需要单次聊天式问答,可先读概念;若要上生产,请重点看步骤、权限与风控相关段落。
关于「为什么「安全榜也在涨」会变成假进步」,本文给出了什么结论?
在「为什么「安全榜也在涨」会变成假进步」部分,要点是:当安全主证据。 设计时故意去相关。固定能力、只变安全干预;或在能力相近的模型之间比安全。比不过,干预无效,不是「模型还不够强」。 静态攻击集定期换。被记住的越狱模板会随预训练进模型,分数会假涨。动态、自适应攻击才更像现场。 安全干预要报能力代价。能力不掉、安全分暴涨,先查是不是还在量能力。能力大掉、安全微涨,要写清值不值。 发布材料禁止只用一张与算力同步的安全曲线。必须另附去相关后的对照。没有对照,曲线当宣传,不当门槛。 榜常见相关它容
关于「五步把安全测量从能力影子里拆出来」,本文给出了什么结论?
在「五步把安全测量从能力影子里拆出来」部分,要点是:贵,贵才会被砍。砍了,相关又会升回去。升回去还报「安全在涨」,是用便宜尺子骗贵问题。贵问题要写进预算行,不写进愿望清单。愿望清单一砍,测量立刻回到能力影子。 同行评审也要问相关。方法论文只报安全涨、不报与能力相关,退回。退回几次,出题才会把去相关当第一页,而不是附录里的一句抱歉。第一页没有相关,这篇就不算安全论文,只算能力附录。 安全题还要防被反过来洗:故意把能力做差来刷「很安全」。所以要同时报能力下限。下限不够,安全分再高也不准入高风