先给结论:缩放律不只对模型大小成立,对问题尺寸也成立。小棋盘上拟合的算力前沿,能预测还没烧钱的大棋盘,误差随纳入的小棋盘变多而指数下降。棋盘每加大一档,完美对弈大约要七倍训练算力;上升段里算力多一个数量级大约多五百等级分。训练多十倍,测试树大约能缩小十五倍,直到单节点。
为什么只缩放模型、不缩放问题会把预算问错
痛点是把「大实验买不起」理解成「只能等有钱的机构发结果」。模型大小、数据、训练算力上的幂律已经让人习惯用小模型外推大模型。可问题本身的难度常常被钉死:同一套语言、同一套图像。于是你外推出的是「在这个固定难题上再堆算力会怎样」,不是「难题再难一档要多少」。第二问才决定:小实验室有没有资格先在玩具难度上把曲线摸清,再决定要不要上真正烧钱的尺寸。
可调难度的棋正好适合当尺子。规则干净,没有易位、打劫这类会把实现写炸的边角;棋盘边长一加,状态空间就跳一档;完美对弈在九路及以下有独立算法可当零点,等级分不会整表平移。自对弈算法用搜索把网络策略放大,再用对局当经验,不需要人类棋谱。把网络深度、宽度和训练时长当成三根算力旋钮,快照按算力指数抽取,就能在同一套规则下同时看到「问题变难」和「模型变大」。
五步在小问题上把大问题的账单先算出来
- 先固定评级零点。多人对局的分数取决于对手,必须把完美对弈钉在零,随机到完美的距离才有跨棋盘的意义。只打内部联赛,表可以整体平移,前沿看起来会假。
- 每个尺寸上扫一批网络和训练长度,取每个算力档的最好成绩当前沿,不要报平均成绩。平均会把没训够的小网和已经平台的大网搅在一起。前沿才是「这份算力上限能到哪」。
- 用带折点的曲线去拟合:底下一段平台、中间一段斜坡、上面顶在完美对弈。斜坡斜率、起飞所需算力、完美对弈所需算力,三个数分开记。一次拟合所有小尺寸,再拿没见过的大尺寸做预测,看残差怎么掉。
- 把测试树大小当成第二根预算。训练时用的搜索和评估时用的搜索不必一样。同一份权重,测试节点从一扫到几百,成绩往往也是一条 S 形。把「训练算力、测试算力、等级分」画在一张权衡图上,才能回答「少训一点、多搜一点」划不划算。
- 大尺寸开训前,先用已拟合的前沿给出账单:起飞要多少、完美对弈要多少、再涨五百等级分要多少。账单对不上再上机,比先烧完再解释「这盘比上一盘难」便宜。
| 量 | 在这套棋上的样子 | 工程读法 | 误用 |
|---|---|---|---|
| 斜坡斜率 | 算力多一个数量级,大约多五百等级分 | 上升段里你比对手多一倍算力,大约赢三分之二 | 当成所有游戏的普适常数 |
| 完美对弈门槛 | 棋盘每加一档,大约乘七 | 边长规划要按指数预留机器,不要按线性 | 用墙钟时间当算力 |
| 起飞门槛 | 棋盘每加一档,大约乘四 | 太小的实验会看起来「完全没学」,其实只是没过起飞 | 把起飞前的平线写成算法失败 |
| 随机到完美的距离 | 每加一档大约五百等级分 | 这是游戏本身的跨度,不是网络深度 | 和斜坡斜率混成一个数 |
| 训练换测试 | 训练多十倍,测试树大约能缩十五倍,直到单节点 | 推理预算和训练预算要放在同一张表里买 | 默认测试搜索更「便宜」所以无限加 |
实现上有三条不写进摘要就容易踩的细节。其一,网络可以非常小。九路上两层各五百一十二的残差全连接就能摸到完美对弈,前向成本是大型卷积网络的零头。网络一小,环境和搜索反而成为瓶颈,值得整段搬到加速卡上,几万盘并行。其二,批次可以开到三万量级,回放缓冲区反而要短,大约两百万样本、几十步。陈旧样本少,环状克制不一定要靠大赛和联赛。其三,正则化搜索能用少得多的节点把高价值分支反映到根上;探索系数也可以比文献低一个数量级。这些选择是为了在小问题上把前沿扫完,不是为了宣布新的最强棋手。正确性用「能否和完美对弈打平」验收,不是用墙钟去打榜。
等级分的非传递性要单独处理。石头剪刀布会让等级分没意义。对照办法是:除了两两对打,再让每个快照跟最强快照打有限盘。极端强弱之间一万盘才出一个冷门,所以这张表会更吵,但前沿形状应当还在。形状还在,才说明你看到的不是评级系统的假象。
光滑性本身也是结果。成绩随算力和棋盘变难都是平滑移动,没有突然跳档。跳档若出现,才值得讲「顿悟」或「复杂度阈值」。没出现,就不要为了等顿悟去加大棋盘;加大棋盘的理由应当是拟合还不稳定,需要下一个点来降预测误差。小棋盘预测大棋盘的误差指数下降,这才是「有资格外推」的证据。
若只能改预算表的一行:把测试搜索从「默认和训练一样」改成独立列。同一条等级分,可以是多训少搜,也可以是少训多搜。列写不出来,你就还在用直觉说「推理更便宜」,而账单会对不上。
结论:先在买得起的尺寸上把前沿拟合完
问题尺寸是第三根缩放轴。小棋盘上的算力前沿能预测大棋盘,训练和测试算力可以按对数互换。把斜率、起飞、完美对弈门槛分开记,大实验的账单在开机前就能写。仍只缩放模型、把问题钉死,小实验室会永远觉得自己没有资格提问。
你下次规划更难的任务,先在两个更小的版本上画出算力前沿,再决定第三档要烧多少。画不出来,就还不是缩放实验,只是一次更大的试跑。
本文侧重全链路风控方法论。落地时请用自身业务单据做回放验证,不要把示例阈值直接当生产策略。 相关:风控体检 · 方案资源
常见问题 FAQ
什么是AI智能系统?
「AI智能系统」可概括为:缩放律不只跟着模型走,也跟着问题难度走。小棋盘上拟合的算力前沿,能预测大棋盘;训练算力多一个数量级,大约能换掉十五倍测试搜索。 本文从定义、方法与实践要点展开说明。
为什么要关注AI智能系统?
关注AI智能系统,是因为它直接影响效率、风险与可复制性。文中指出:痛点是把「大实验买不起」理解成「只能等有钱的机构发结果」。模型大小、数据、训练算力上的幂律已经让人习惯用小模型外推大模型。可问题本身的难度常常被钉死:同一套语言、同一套图像。于是你外推出的是「在这个固定难题上再堆算力会怎样」,不是「难题再难一档要多少」。第二问才决定:小实验室有没有资格先在玩具难度上把曲线摸清,再决定要不要上真正烧钱的尺寸。
如何落地AI智能系统?有哪些关键步骤?
建议按以下路径推进AI智能系统:1) 先固定评级零点。多人对局的分数取决于对手,必须把完美对弈钉在零,随机到完美的距离才有跨棋盘的意义。只打内部联赛,表可以整体平移,前沿看起来会假。;2) 每个尺寸上扫一批网络和训练长度,取每个算力档的最好成绩当前沿,不要报平均成绩。平均会把没训够的小网和已经平台的大网搅在一起。前沿才是「这份算力上限能到哪」。;3) 用带折点的曲线去拟合:底下一段平台、中间一段斜坡、上面顶在完美对弈。斜坡斜率、起飞所需算力、完美对弈所需算力,三个数分开记。一次拟合所有小尺寸,再拿没见过的大…;4) 把测试树大小当成第二根预算。训练时用的搜索和评估时用的搜索不必一样。同一份权重,测试节点从一扫到几百,成绩往往也是一…
AI智能系统适合哪些人或团队?
AI智能系统更适合:产品/技术负责人、运营与增长团队、需要落地智能体或自动化的中小团队、关注「AI智能系统」方向的读者。若你只需要单次聊天式问答,可先读概念;若要上生产,请重点看步骤、权限与风控相关段落。
关于「为什么只缩放模型、不缩放问题会把预算问错」,本文给出了什么结论?
在「为什么只缩放模型、不缩放问题会把预算问错」部分,要点是:放大,再用对局当经验,不需要人类棋谱。把网络深度、宽度和训练时长当成三根算力旋钮,快照按算力指数抽取,就能在同一套规则下同时看到「问题变难」和「模型变大」。 五步在小问题上把大问题的账单先算出来 先固定评级零点。多人对局的分数取决于对手,必须把完美对弈钉在零,随机到完美的距离才有跨棋盘的意义。只打内部联赛,表可以整体平移,前沿看起来会假。 每个尺寸上扫一批网络和训练长度,取每个算力档的最好成绩当前沿,不要报平均成绩。平均会把没训够的小网
关于「五步在小问题上把大问题的账单先算出来」,本文给出了什么结论?
在「五步在小问题上把大问题的账单先算出来」部分,要点是:法是:除了两两对打,再让每个快照跟最强快照打有限盘。极端强弱之间一万盘才出一个冷门,所以这张表会更吵,但前沿形状应当还在。形状还在,才说明你看到的不是评级系统的假象。 光滑性本身也是结果。成绩随算力和棋盘变难都是平滑移动,没有突然跳档。跳档若出现,才值得讲「顿悟」或「复杂度阈值」。没出现,就不要为了等顿悟去加大棋盘;加大棋盘的理由应当是拟合还不稳定,需要下一个点来降预测误差。小棋盘预测大棋盘的误差指数下降,这才是「有资格外推」的证据。