先给结论:若通用智能按演员-评论家强化学习来做,源码里会有一个很小的奖励函数槽。学习子系统从零拟合世界,转向子系统发出先天驱动:疼是坏的、饿了吃是好的。所谓正义和同情也从这套驱动间接长出,不是另写的道德模块。槽填错,得到的就是对人类福利冷漠的强智能。对齐要改转向侧那一小段,不是把学习侧再堆大一层。

为什么把对齐做成「再训一个更大的网络」会问错对象

痛点是把学习和动机焊在一个桶里。皮层、纹状体这类结构一生都在从零学:世界模型、预测、动作。下丘脑和脑干这类结构大多是遗传硬编码,负责物种特异的反射和奖励。两套之间靠思想评估器对接:评估器看着当前念头,预测转向侧马上会作何反应,再用事后真值去校正。评估器和思想生成器都会学;真正的「什么算好事」的根,仍在转向侧发出的监督信号。只改学习侧的规模、数据、搜索,等于把一个还没写对的奖励函数跑得更勤。

规划并不直接查地面真值奖励。复杂、有远见的计划,查的是学出来的价值函数:这个念头值不值得留下、值不值得展开。价值函数是在追奖励,但追的是预测,不是当场的真值。于是失败会裂成两片。外层:真值奖励当时就在给错的行为打分,规格游戏。内层:当时行为看起来对,价值函数却把错的概念当成了好,目标泛化。两片都要测。只测外层,会在「奖励函数看起来没刷分」时漏掉已经学歪的价值。

五步把奖励槽当成主设计对象而不是附录

  1. 图纸上先画两套子系统,禁止画成一个端到端网络。学习侧:从零学的世界模型和策略。转向侧:硬编码驱动和真值奖励。接口必须显式:哪些信号是监督,哪些是预测。
  2. 思想评估器单独做版本。它的工作是把「同事」「承诺」「被看见撒谎」这类学出来的概念,接到转向侧已有的旋钮上。接不上,社会本能就只是口号;接错了,会把错误概念当成先天好事。
  3. 外层和内层分表验收。外层问:真值奖励有没有给错的行为打正分。内层问:价值函数给计划打的分,是否和最终真值一致。价值函数在规划里代劳查询,内层错了,外层再干净也会选出坏计划。
  4. 不要假设「高级欲望」会自己出现。同情、规范、自我形象,若出现,也是驱动流进世界模型之后的产物。槽里没写对应项,就不要指望堆数据能堆出良心。
  5. 能力项和安全项分开限幅。探索、好奇、完成任务,会流进同一张价值表。它们可以帮你把智能做出来,也会在规划里投票。安全项必须能压过它们,否则能力奖励会在野路上取胜。
部件 像强化学习里的什么 主要失败 该改哪里
学习子系统 世界模型 + 演员 学得慢、学不会 数据、架构、搜索;不是对齐的根
转向子系统 真值奖励 / 先天驱动 填错槽、冷漠、护错对象 奖励函数设计本身
思想评估器 短程预测器 / 评论家的输入头 概念接错旋钮 监督信号和概念对齐实验
价值函数 学出来的评论家 目标泛化、计划打分歪 内层对齐测试
思想生成器 按效价留下或丢掉念头 只生成能骗过评分的念头 效价来源,而不是解码器宽度

操作细节有三条。其一,思想评估器没有随意控制权。人不能靠意志让评估器改预测,它只吃事后真值。对智能体也一样:你不能提示它「请从现在起真心在乎」,除非转向侧真的发出对应监督。提示改变的是学习侧的表面策略,监督改变的是它觉得什么值得留下。其二,效价既像奖励又像价值:疼是当场的真值,上楼拿衣服是前瞻的预测。设计日志里要写清当前这条信号是覆盖模式还是交给预测器。混用会把「现在疼」和「以后会疼」焊成一个旋钮,调试时分不清。其三,多部件一起训时,奖励槽仍是最小、最杠杆的那一段。世界模型可以很大,槽可以只有几十个条件。评审时先读槽,再读网络。

从硬编码驱动到有远见的计划,中间有一步信用分配:世界模型里某个概念被标成「好」,之后评估器一看见相关念头就预报正效价,思想生成器就更愿意展开它。蛋糕的例子只是最浅的一条。工程含义是:你标错概念,后面整条计划树都会朝那个概念长。所以槽的验收不能只看即时行为,还要看信用分配落到了世界模型的哪一个节点上。

若只能改设计评审的一项:把奖励函数从附录提到第一页,并强制写清外层、内层、评估器三条测试。三条写不全,项目还在训一个更大的学习侧,不是在做对齐。

结论:对齐改槽,不改「再大一点的皮层」

学习侧负责能干,转向侧负责在乎什么。思想评估器把两者接起来,价值函数在规划里代劳查询。槽填错,能力越强越危险。仍把对齐当成把模型训得更听话,问的就是错对象。

你下次看一份类脑智能体设计,先找奖励槽和思想评估器。找不到,就还没有对齐方案,只有学习方案。

效率龙虾 会带着下面这段开聊

按文章《学习子系统从零学、转向子系统发先天驱动:对齐要改的是后者》把卡点收成可执行步骤:先做什么、别踩哪条、怎么验证。

用效率龙虾试这篇

本文侧重全链路风控方法论。落地时请用自身业务单据做回放验证,不要把示例阈值直接当生产策略。 相关:风控体检 · 方案资源

常见问题 FAQ

什么是学习子系统和转向子系统?

学习子系统负责从零学习世界模型、预测和动作,类似大脑的皮层和纹状体。转向子系统则有硬编码的先天驱动,如下丘脑和脑干,负责物种特异的反射和奖励,比如疼是坏的、饿了吃是好的。两者通过思想评估器对接。

为什么对齐要改转向子系统而不是让学习子系统更大?

因为对齐的关键在于奖励槽,即转向子系统的先天驱动。如果奖励槽填错,智能体会对人类福利冷漠。学习子系统只能学习策略,不能改变根本的动机。堆大学习侧等于把错误的奖励函数跑得更勤,问错了对象。

如何把奖励槽当成主设计对象而不是附录?

设计时首先画两套子系统,禁止端到端网络。学习侧从零学,转向侧硬编码驱动。思想评估器单独做,确保概念接到正确的旋钮上。外层和内层分表验收,测试奖励给分和价值函数预测。能力项和安全项分开限幅。

在对齐设计中常见的陷阱是什么?

常见陷阱包括把学习和动机焊在一个桶里,只改学习侧规模;假设高级欲望会自己出现;思想评估器概念接错旋钮;价值函数目标泛化错误;只测外层奖励而忽略内层价值对齐。这些会导致计划打分歪或奖励函数设计错误。

学习侧和转向侧在功能上有什么区别?

学习侧负责能力,如世界模型、策略学习,从零拟合世界。转向侧负责在乎什么,即先天驱动和真值奖励,决定什么是好的或坏的。思想评估器连接两者,价值函数在规划中代劳查询奖励。

设计评审时应该优先检查什么?

如果只能改设计评审的一项,应把奖励函数从附录提到第一页,强制写清外层、内层、评估器三条测试。找不到奖励槽和思想评估器,就还没有对齐方案。评审时先读槽,再读网络,确保安全项能压过能力项。