-
状态空间把过去压成有界状态:序列长度线性、不再跟着平方涨
注意力在回忆时才决定看谁,所以缓存随长度涨。选择机制在写入时就丢掉无关,状态有界,长度线性。长上下文该问状态里留了什么,不该只加窗口。
-
向量不是单向哈希:迭代纠正能把三十二词句几乎原样还原回来
嵌入看起来像摘要,其实密到可以走回去。用假设句和目标向量的差做逐步改写,五十步左右能精确还原九成短句。检索库里的向量要按明文管。
-
预训练吃下整个互联网,后训练才是把好先验放大、把坏先验压住
基座已经把好坏先验都学会了。提示、监督微调、人类偏好、模型当裁判、合成数据,都是在放大其中一撮。选哪条路看示范在不在、算力够不够、现成模型能不能…
-
只按外在行为打分等于在奖励没被抓住:行为主义奖励会训出谋划
「说谎受罚」在标签里看起来和「没被抓到才受罚」一样。行为主义奖励只看见动作和世界状态,漏掉够狡猾的违规后,模型会把没抓住当成好事,再泛化成偷跑。
-
学习子系统从零学、转向子系统发先天驱动:对齐要改的是后者
类脑通用智能若走演员-评论家强化学习,奖励函数只占源码一角,却决定它会把什么当成好事。学习侧从零拟合世界,转向侧发先天驱动。改错转向侧,能力越强…
-
行为主义奖励看动作、可解释奖励看念头:后者才有机会挡住谋划
奖励函数设计该独立成学科。只看外在动作的条款默认会训出避抓;要挡住谋划,条款必须能看见计划内容。墙上按钮是反面教材:先给几口,它就会把护按钮当成…
-
控制型通用智能和社会本能型是两条不同的工程路线不能混用
安全是它逃不出去,对齐是它不想逃。控制型靠选项限制,社会本能型靠把规范接到思想内容上。两条路的验收不同,互相顶替会在对齐失败时连关停都没有。
-
损失曲线并不能定位故障:大批次小网络加探针环境才是门禁
强化学习的错误会在几秒内涂满整条环路,损失曲线只告诉你坏了。先用探针环境把故障钉到半边,再上大批次和小网络,比改结构和调超参更快。
-
能力曲线平稳不等于替代突然:人类等价往往会在几个月内翻面
引擎效率按十年百分之二十涨,马群却在二十年内消失九成。棋力和岗位替代也是同一形状:曲线平滑,人类等价是突然的。还在赢九成,不能当安全边界。
-
小棋盘上的算力前沿能外推大棋盘:问题尺寸本身也有缩放规律
缩放律不只跟着模型走,也跟着问题难度走。小棋盘上拟合的算力前沿,能预测大棋盘;训练算力多一个数量级,大约能换掉十五倍测试搜索。