人工智能让它做研究,不能写成同一档能力。至少要分成四档:找出已经有人写过的答案,把已有碎片拼成一个能核对的解,用我们已经会的方法去做新实验,以及发明一套新的做法。第三档做完,不能宣称第四档也会。物理上做错了,试验会失败,人的价值没有这种免费纠错。在同一档上多加步骤,也不等于换了范式。

人工智能自动研究的痛点是四件完全不同的事共用一个说法

计划里最常见的一句是:让它自己把安全研究做了。这句话底下至少有四件。第一件是检索,答案已经在旧材料里,它只是找出来。第二件是拼装,碎片都有,它排成一条能检查的链,最好落在可以验算的范围。第三件是把已知手法用到新的数据、新的切分、新的设置上。第四件是提出这行以前没有的做法,连问题该怎么问都变了。

第三件和第四件被揉在一起,乐观就来得特别便宜。它能把已知手法跑得很顺,别人就以为离新范式只差一步。差的不是一步。已知手法再熟练,也还在旧问题的形状里。新范式是问题形状变了。变没变,要单独有证据,不能用第三档的产量填。

还有一种揉法是:现在它做研究已经有用,所以再多给一点计算、再多套几层步骤,第四档就会出现,而且仍然安全。步骤和计算可以让第三档更多。它们不自动产生新范式,也不自动保证新范式站在人这边。

人工智能给自动研究分档的步骤:先标档、第三档不填第四档、出范围另测、价值单独有纠错、加步骤不算升级

  1. 每句它在做研究,标成一到四中的一档。标不出,这句话删掉。
  2. 第三档的实验列表再长,第四档仍是空的。空的不能写成即将解决。
  3. 第四档的说法只要出了已知材料的范围,必须另有一组对不上旧模板的例子。没有,按第三档记。
  4. 人的价值要写自己的纠错。不能把物理上试验失败会露馅,抄成价值也会自己回到人这边。
  5. 同一档里加步骤、加检索、加核对,记成这一档更顺,不记成升档。
它实际在做 不能写成
从旧材料里找出答案 它发现了新东西
把已有碎片拼成能核对的解 它换了问题的问法
用已知方法做新实验 新范式已经在望
发明一套以前没有的做法 第三档的产量可以代替证据
加步骤 同一档更顺 能力升了一档

上表右列出现在计划里,这句退回,改标左列的档。

人工智能现场把安全进度按档记账,而不是按稿子厚度记账

周报只留四行。每一行写这周新完成的是哪一档,证据是什么。第三行写了二十个实验,第四行仍是未出现,结论就是第三档在推进。我们见过把第三行的字数抄进第四行,对外就变成安全研究被自动解决了。字数不能过档。

物理和价值要分两本纠错账。代码跑不通、规格对不上、测量和预测差一截,这些会把物理上的错露出来。人这边没有同等的露馅。它可以用一套很顺的旧说法,把出了今天范围的事也说成已经照顾到人。说得顺,不是价值还在。价值这本账要写:出了哪一个旧范围之后,谁用什么对照检查它还站在人这边。对照空着,第四档不许启动。

还有一种假进度是它自己宣布下一档已经安全。它在第三档里很认真,检查也很多,然后把结论推广到它并不会发明新做法的那一档。推广的那句单独划掉。留下的只是第三档的实验。实验可以有用,有用不是升档。

若有人主张第四档根本不需要,也要写成一句明确的话:已知方法覆盖到什么范围就够了。范围没写,这句话等于空。空的乐观不能用来给能力那边继续加速开绿灯。

人工智能常见翻车是用现在有用证明以后出了范围还有用

现在有用,说明第三档在今天的材料里成立。今天的材料不是以后的世界。以后的世界若换了做法,第三档的成功不能搬过去。搬之前先做那组对不上旧模板的例子。没做,成功作废。

另一类翻车是把检索到的旧答案说成研究完成。第一档最快,也最像完成。完成的标准若是找到一篇旧文,就标第一档,不要标第三档或第四档。

还有一类是价值纠错抄了物理纠错的格式,却没有失败时会怎样。格式一样,内容是空的。空的纠错视为没写。

结论:人工智能的自动研究先标档,第三档的顺不代表第四档会出现

四档分开记。第三档不填第四档。出了已知范围要另测。人的价值要有自己的纠错,不能靠物理那种免费露馅。加步骤只算同一档更顺。

你下次说它在自动做安全研究,先标是四档里的哪一档。第四档没有单独证据,先不要写成新范式已经在望。

效率龙虾 会带着下面这段开聊

按文章《人工智能让它自动做研究禁止当成同一档:2026四档能力必须分开核》把卡点收成可执行步骤:先做什么、别踩哪条、怎么验证。

用效率龙虾试这篇

本文侧重全链路风控方法论。落地时请用自身业务单据做回放验证,不要把示例阈值直接当生产策略。 相关:风控体检 · 方案资源

常见问题 FAQ

人工智能自动研究的四档能力具体指什么?

文章将人工智能的自动研究能力清晰划分为四档。第一档是检索,即从旧材料里找出已有的答案。第二档是拼装,把已有的信息碎片拼接成能核对的逻辑链条。第三档是用已知的方法去做新的实验,比如应用到新数据或新设置上。第四档是发明全新的方法,提出以前没有的问题问法。这四档代表了完全不同的任务复杂度和创新层次。

为什么不能把人工智能的研究能力当成同一档来规划?

因为这四档是质的不同,而非量的积累。文章特别强调,第三档(用已知方法做实验)做得再顺畅,也不代表第四档(发明新范式)会自动出现。就像用旧工具熟练地干活,和发明一套全新工具是两回事。如果混为一谈,就会产生‘只要加点计算或步骤,第四档就会来’的廉价乐观,这是常见的规划翻车点。

在制定人工智能研究计划时,如何应用这个四档分类法?

核心步骤是:先给计划里提到的每一项研究任务标清楚属于哪一档。如果标不出,那这句话本身就不该保留。关键规则是:第三档的成果列表再长,也不能直接填进第四档的空白处。当任务涉及超出已知材料范围的新问题时,必须另外进行独立测试,不能套用旧模板。这样能防止进度虚报。

第三档的‘新实验’和第四档的‘新范式’本质区别是什么?

本质区别在于是否改变了‘问题的形状’。第三档是在旧问题的框架下,用已知手法去处理新的数据或场景,它是在验证已知的方法。第四档则是提出一个这行以前根本没有的问题或解决思路,是问题定义本身的创新。第三档的成功证明的是方法的适用性,而第四档需要证明问题形状发生了变化。

在推进人工智能研究时,最常见的认知错误是什么?

最常见的错误是用第三档的短期有用,来证明第四档在未来也能安全实现。文章指出,‘现在有用’只说明第三档在当前的材料范围内成立。未来的世界如果问题变了,第三档的成功经验就不能直接搬过去。在没有一组对不上旧模板的独立证据前,不能宣称新范式已近在咫尺。

如果人工智能研究计划中涉及第四档,但没有证据怎么办?

文章给出了硬性规定:如果关于第四档(发明新做法)的描述出了已知材料的范围,就必须提供一组独立的、对不上旧模板的例子作为证据。如果证据空缺,那么该任务就只能按第三档(应用旧方法)来记录进度。同时,衡量价值的‘人’的纠错账必须单独记,物理上试验失败会露馅,但价值账上如果没有对照检查,第四档就不允许启动。