公开数字很少,但有一条比较硬:某代推理模型相对上一代,推理阶段训练量大约十倍,间隔大约四个月,数学、科学、编码和智能体编程套件都明显变强。另一条线是:预训练总量大约每年四到五倍。两条斜率不可能永远平行。若推理训练继续每几个月十倍,大约一年内就会碰到总训练算力的前沿,然后被迫和总账一起走,大约每年四倍,而不是继续十倍跳。
早期阶段之所以涨得猛,是因为大家都还在曲线很早的位置:花一百万而不是十万,就能换来很大一截。实验室正把第二阶段从百万级拉到亿和十亿。交叉点一旦过去,推理训练不再是「小而猛的补丁」,而会占掉总训练的大部分。监管如果还只统计预训练浮点运算,会漏掉真正在抬能力的那一截。编码智能体的脚手架也能在不加大训练的情况下抬产品能力,那是另一笔账,不要和训练算力混在一起。
对部署的含义是:纯推理、答案便宜可验证的题,会先看到超人类;要稳定操作电脑、要和环境反馈对练的智能体,会晚一截。推理训练目前多半还没在「跑代码、搜网页、开终端」的闭环里做强化,工具使用并不比底座强多少。把推理模型塞进为普通对话优化的智能体,提示风格不对,分数还可能掉。
落地清单
- 能力规划按两段写:碰上总训练前沿之前可以按十倍跳来估,之后改用每年约四倍。
- 智能体提示和工具协议要为推理模型单开一版,不要复用聊天模板。
- 算总训练成本时把推理后训练单列,否则账单和监管口径都会偏。
- 可验证的数学编码可以激进上推理;环境反馈弱的操作任务,先别按同一斜率承诺。
十倍跳是窗口,不是定律。窗口关上以后,推理模型和预训练模型会重新变成同一场算力竞赛。
本文侧重全链路风控方法论。落地时请用自身业务单据做回放验证,不要把示例阈值直接当生产策略。 相关:风控体检 · 方案资源
常见问题 FAQ
推理训练的当前增长速度是多少?
根据文章,推理训练相对上一代增加约十倍,间隔大约四个月,数学、科学等任务明显变强。但一旦追上预训练总量,增速会掉回每年大约四倍。早期增长猛是因为基数小,实验室正将训练从百万级提升到亿和十亿规模。
为什么推理训练早期增长这么迅猛?
因为早期阶段基数很低,花一百万而不是十万就能换来很大提升,所以增长十倍跳。实验室正把推理训练从百万级拉到亿和十亿,但一旦碰到总训练算力前沿,增长就会放缓,被迫和总账一起走每年约四倍的增速。
如何规划推理训练的能力阶段?
按落地清单,能力规划分两段:在碰上总训练前沿之前,可以按十倍跳来估计增长;之后改用每年约四倍。同时,智能体提示和工具协议要为推理模型单开一版,不要复用聊天模板,以确保性能不下降。
哪些任务适合激进部署推理训练?
可验证的数学编码任务适合激进上推理训练,因为答案便宜可验证,能先看到超人类表现。但环境反馈弱的操作任务,如稳定操作电脑,会晚一截,不适合按同一斜率承诺,推理训练目前在闭环强化中还不强。
部署推理模型时要避免什么常见错误?
避免把推理模型塞进为普通对话优化的智能体,因为提示风格不对,分数可能掉。智能体提示和工具协议必须为推理模型单开一版,不要复用聊天模板,否则工具使用不比底座强多少,影响产品能力。
推理训练和预训练的增长趋势有什么不同?
推理训练早期按十倍跳,间隔约四个月;预训练总量每年增长四到五倍。两条斜率不可能永远平行,推理训练一旦追上总训练算力前沿,增速会掉回与预训练同步的每年约四倍,不再是小而猛的补丁。