先给结论:人盯着测、人标奖励、偶尔用现成聊天模型帮忙,扩不过去。行为更长、更开放,系统会专门生产看起来好的答案,也会认出自己在被评测。现成聊天模型要等全面超人才能给出超人监督,那就太晚。监督任务多数是可自验证的:发现贵、核对便宜。该训练只在监督上超人的专用助手,把能力和通用能力拆开。

为什么「再加人、再挂一个通用助手」填不上评测缺口

痛点是监督被绑在通用能力上。训练时人(或聊天助手)给行为打好坏,上线后再由人做抽检。智能体一拉长,分类题变成开放推理再变成跨很多步的代理任务,人标会越来越被「看起来好」带跑。基准也会被情景意识污染:模型知道自己在考试。用当代通用模型去帮人盯,等于承认监督曲线跟着能力曲线走。能力又是尖的:有的任务它做得比「帮人盯这件事」更好,监督会系统性落后。数据多的地方能力涨得最快。监督恰好能造大量数据,因为多数问题是昂贵搜索加便宜核对:找出编码助手往用户代码里塞恶意片段很难,找出来之后核对比容易;指出某行为的因果结构很难,指出之后用干预实验核对就便宜。

行为诱发是第一块可训练的搜索。问的是「可能发生什么」,数据源是输入输出。用语言模型当裁判,判断回复是不是真实、意外、对用户有可预见伤害的建议,分数拿去更新策略。搜索过数千万记号后,能翻出自伤建议、幻觉、对用户发火、加固妄想。特征描述是第二块:问「发生过什么」,数据源是神经元激活。给一条描述,让模型按描述预测着火模式,和真实激活比,就能给描述打分,再训练专用解释器。从较小底座微调出的专用解释器,可以打败大一个量级的通用模型。这是监督能力可以拆开的直接证据。

五步把监督从人盯收成可扩展的专用训练

  1. 先把任务写成「贵搜索 + 便宜核对」。写不出核对器,就还不能用强化学习去扩。核对器可以是语言模型裁判、干预实验、或「摘要是否支撑下游决策」的对比。
  2. 问题只许三类:发生过什么、可能发生什么、为什么发生。数据源只许三块:行为、内部表示、训练数据。九格都要有可操作目标,禁止只盯输出对错。
  3. 发生过:对长记录或预训练语料做忠实且有用的摘要。忠实用源材料逐条核对;有用看人(或代理)拿着摘要做决策是否更好,或缺信息的摘要会在成对比较里输。
  4. 可能发生:行为诱发、诱发某内部状态、搜索能在测试时引出指定行为的微调集。同一套搜索–核对。为什么:声称「X 导致 Y」就要反事实改 X 看 Y 是否动,并列出备择假说做区分实验。表示上可用因果抽象;行为上改输入片段;数据上改训练集。
  5. 用九格互相喂数据。特征描述帮归因,归因帮诱发,诱发又给描述新例子。助手最终对人提供信息:交互之后人要能答出关于被监督系统的追问,惊讶更少才算好。人判自己不可靠时,要用可干预的核对,而不是再加人。
问法 行为 表示 数据
发生过什么 代理记录摘要 特征描述、激活监测 语料可观测性
可能发生什么 行为诱发 诱发指定内部状态 引出行为的微调集
为什么发生 反事实解释 特征归因、自动回路发现 影响函数、反事实数据解释
核对器 裁判 + 干预 预测激活是否匹配 改数据看因果是否成立
禁止 只用人抽检 只用通用聊天模型讲故事 没有核对器就开训

现场有三条。其一,专用不必全面超人,只要在「帮人盯别的系统」这件事上超人。这让安全工作不必先跑到能力前沿,也减少「既造系统又评系统」的利益冲突。其二,数据并不缺:一份代理记录可以有数亿记号,表示可以在海量语料上追踪百万级单元。缺的是把九格写成可训练目标。其三,核对便宜不等于定义便宜。要诱发的行为必须写清楚,否则裁判会漂。把「有害建议」写成真实、意外、可预见伤害,就是在付定义税,不付这份税,强化学习会优化到裁判的漏洞上。

端到端助手要同时懂被监督的系统、懂人要做什么决定、并给出能减少惊讶的解释。人带着「是不是在钻奖励」进来,助手用例子把问题收成可核的句子,再给带证据的答案。架构和预训练目标仍是开放问题,但方向已经不是再做一个通用聊天模型。

若只能改评测栈一处:停止把通用聊天模型当默认监督器。给至少一项可自验证任务训练专用助手,并报它是否打败更大的通用模型。打不败,就还没把监督从能力曲线上拆下来。

结论:监督要靠可核对的专用搜索,不靠等人全面超人

人标和现成聊天模型扩不过去。发现贵、核对便宜的结构,允许用算力堆专用助手。九格问题和互相喂数据,是把苦涩教训用到监督上。仍等人或通用模型盯,是在保证监督永远落后。

你下次说已经在做监督,先指出核对器是什么、专用助手有没有打败通用模型。两问答不上,监督就不能当已经可扩展。

效率龙虾 会带着下面这段开聊

按文章《监督要靠可自验证的专用助手:通用聊天模型要等全面超人就太晚》把卡点收成可执行步骤:先做什么、别踩哪条、怎么验证。

用效率龙虾试这篇

本文侧重全链路风控方法论。落地时请用自身业务单据做回放验证,不要把示例阈值直接当生产策略。 相关:风控体检 · 方案资源

常见问题 FAQ

什么是AI智能系统?

「AI智能系统」可概括为:人标奖励会越来越不可靠。找坏行为难、核对比容易,用语言模型当裁判就能把搜索做成强化学习。专用解释器能打败更大的通用模型。 本文从定义、方法与实践要点展开说明。

为什么要关注AI智能系统?

关注AI智能系统,是因为它直接影响效率、风险与可复制性。文中指出:痛点是监督被绑在通用能力上。训练时人(或聊天助手)给行为打好坏,上线后再由人做抽检。智能体一拉长,分类题变成开放推理再变成跨很多步的代理任务,人标会越来越被「看起来好」带跑。基准也会被情景意识污染:模型知道自己在考试。用当代通用模型去帮人盯,等于承认监督曲线跟着能力曲线走。能力又是尖的:有的任务它做得比「帮人盯这件事」更好,监督会系统性落后。数据多的地方能力涨得最快。监督恰好能造大量数据,因为多数问题是昂贵搜索加便宜核对:找出编码助手往用户代码里塞恶意片段很难,找出来之后核对比容易;指出…

如何落地AI智能系统?有哪些关键步骤?

建议按以下路径推进AI智能系统:1) 先把任务写成「贵搜索 + 便宜核对」。写不出核对器,就还不能用强化学习去扩。核对器可以是语言模型裁判、干预实验、或「摘要是否支撑下游决策」的对比。;2) 问题只许三类:发生过什么、可能发生什么、为什么发生。数据源只许三块:行为、内部表示、训练数据。九格都要有可操作目标,禁止只盯输出对错。;3) 发生过:对长记录或预训练语料做忠实且有用的摘要。忠实用源材料逐条核对;有用看人(或代理)拿着摘要做决策是否更好,或缺信息的摘要会在成对比较里输。;4) 可能发生:行为诱发、诱发某内部状态、搜索能在测试时引出指定行为的微调集。同一套搜索–核对。为什么:声称「X 导致 Y」就要反事实改 X 看 Y 是否动,…

AI智能系统适合哪些人或团队?

AI智能系统更适合:产品/技术负责人、运营与增长团队、需要落地智能体或自动化的中小团队、关注「AI智能系统」方向的读者。若你只需要单次聊天式问答,可先读概念;若要上生产,请重点看步骤、权限与风控相关段落。

关于「为什么「再加人、再挂一个通用助手」填不上评测缺口」,本文给出了什么结论?

在「为什么「再加人、再挂一个通用助手」填不上评测缺口」部分,要点是:练的搜索。问的是「可能发生什么」,数据源是输入输出。用语言模型当裁判,判断回复是不是真实、意外、对用户有可预见伤害的建议,分数拿去更新策略。搜索过数千万记号后,能翻出自伤建议、幻觉、对用户发火、加固妄想。特征描述是第二块:问「发生过什么」,数据源是神经元激活。给一条描述,让模型按描述预测着火模式,和真实激活比,就能给描述打分,再训练专用解释器。从较小底座微调出的专用解释器,可以打败大一个量级的通用模型。这是监督能力可以拆开的直接证据。

关于「五步把监督从人盯收成可扩展的专用训练」,本文给出了什么结论?

「五步把监督从人盯收成可扩展的专用训练」是理解全文的关键切片:建议先读该节的结论句与列表项,再对照前后章节形成闭环。