先给结论:堆算力和参数能做出吃过整个互联网的基座,但基座会把优雅散文和有毒帖子一起建模。后训练的工作是先验放大:把想要的那一撮分布投影上去,把其余压住。提示、监督微调、人类偏好强化学习、模型当裁判、合成数据,都在做这件事,只是杠杆和污染源不同。能力多半在预训练里已经有了;后训练教的是推理时走哪条子分布。选错杠杆,会把坏先验一起放大。
为什么「再提示一下」经常走不出有毒区
痛点是基座太忠实。它不是坏模型,它就是在拟合训练分布。提示想把查询打扮成高质量例子,好把模型拽到那片子分布上。提示太泛,模型听得懂但没用;太具体,训练里没见过就泛化失败。更麻烦的是吸收态:论坛里「礼貌讨论变味」远多于「变味再变回礼貌」,提示很难从坏相关里游出来。零样本等于让模型拖着原分布的全部行李上场。
有示范就不要只靠说。监督微调是「做给我看」:一小份高质量数据当金标准。可以是原数据过滤后的子集,也可以是新采的。全量更新最猛;只训一小撮额外参数更便宜,消费级卡也能做。示范从哪来、干净不干净,和更新哪些权重同样决定放大了什么。没有示范,再考虑人类偏好:学一个奖励模型,在策略自己的输出上给分,能用次优数据,也能按「你现在会什么」给不同分。人类贵、吵、慢,就让现成模型当裁判——验证往往比生成容易。裁判若只会判断不会生成,仍能产偏好对;若连判断都不稳,就别自动化。
五步按「先验在哪」选杠杆,而不是按论文热度
- 先问预训练语料里有没有你要的能力。有,先试提示。没有,必须微调。提示失败若是因为坏相关吸收,也算「有但拽不出来」,转微调。
- 有干净示范,走监督微调。示范难采,走人类偏好或模型裁判。算力紧,用参数高效微调,不要一上来全量。
- 现成模型若能生成可用数据,做合成;若只能当裁判,做偏好或反思;两样都不行,回到人类。合成要单独测能力有没有过来,不能只看口吻像不像老师。
- 奖励模型和策略拆开迭代。策略在自己的输出上拿分,才知道「你这个水平该不该硬答」。离线标签不管当前能力,会把该含糊的教成硬编。
- 每轮放大都记账:这撮先验从人来、从过滤来、还是从上一届模型来。迭代蒸馏会把来源糊掉,偏见和风格会在师生之间滚雪球。账糊了,对齐和去偏就没有落点。
| 杠杆 | 放大的是什么 | 前提 | 典型失败 |
|---|---|---|---|
| 提示 | 原语料里已有的好岛 | 岛存在且能被上下文点亮 | 坏相关吸收、太具体就崩 |
| 监督微调 | 示范集里的行为 | 示范干净、覆盖目标 | 示范脏则脏被固化 |
| 人类偏好 | 比较里的相对好坏 | 标得动、标得稳 | 贵、吵;奖励模型自己会偏 |
| 模型裁判 | 现成模型里的判断先验 | 验证比生成容易且够准 | 裁判的坏先验被写成新老师 |
| 合成数据 | 生成模型的能力与口吻 | 生成质量过关 | 只蒸到风格,蒸不到事实 |
现场有三条。其一,监督微调往往比成功的偏好学习更能改指令跟随,因为它在行为上直接克隆。需要「轻推」而不是「整个人格重写」时,偏好可能更合适。其二,合成数据最容易交出假承诺:小模型学会大模型的客套和列表格式,事实性没过来。验收要分口吻和能力两张表。口吻像、能力不像,就还是蒸馏失败。其三,模型辅助标注可以加快人,而不必假装无人。分割、检测这类任务,模型打底、人改,比纯人快数倍。省下的预算应拿去抽查,而不是宣布数据已经自动干净。
决策可以写成三问。原语料有没有?有就提示,没有就微调。示范好不好采?好采就监督,不好采就偏好或裁判。现成模型能不能生成或验证?能生成走合成,只能验证走裁判,都不能走人类。算力另问:够就全量,不够就高效微调。四问写在项目页上,比追最新缩写少走弯路。
若只能定一条默认策略:有一百条以上可抽查的干净示范,先监督微调;没有,先不要上合成。合成看起来便宜,污染验收更贵。抽查要覆盖事实题、拒绝题和格式题各一叠,只抽格式会把「看起来像老师」误写成「已经对齐」。三叠都过,才允许把这版示范当成下一轮的老师。
结论:后训练是驯化分布,不是再堆一次缩放曲线
基座已经把人类数字经验的好坏都吃进去了。后训练要放大哪一撮、用哪根杠杆、污染从哪来,必须能写在表上。提示拽不出吸收态,示范会固化脏数据,合成会只蒸到口吻。把三问问完再开工,驯化才不是口号。
你下次规划后训练,先写清先验来自语料、示范、人类还是上一届模型。写不清,就还在堆缩放,不是在做放大。
本文侧重全链路风控方法论。落地时请用自身业务单据做回放验证,不要把示例阈值直接当生产策略。 相关:风控体检 · 方案资源
常见问题 FAQ
什么是AI智能系统?
「AI智能系统」可概括为:基座已经把好坏先验都学会了。提示、监督微调、人类偏好、模型当裁判、合成数据,都是在放大其中一撮。选哪条路看示范在不在、算力够不够、现成模型能不能当裁判。 本文从定义、方法与实践要点展开说明。
为什么要关注AI智能系统?
关注AI智能系统,是因为它直接影响效率、风险与可复制性。文中指出:痛点是基座太忠实。它不是坏模型,它就是在拟合训练分布。提示想把查询打扮成高质量例子,好把模型拽到那片子分布上。提示太泛,模型听得懂但没用;太具体,训练里没见过就泛化失败。更麻烦的是吸收态:论坛里「礼貌讨论变味」远多于「变味再变回礼貌」,提示很难从坏相关里游出来。零样本等于让模型拖着原分布的全部行李上场。
如何落地AI智能系统?有哪些关键步骤?
建议按以下路径推进AI智能系统:1) 先问预训练语料里有没有你要的能力。有,先试提示。没有,必须微调。提示失败若是因为坏相关吸收,也算「有但拽不出来」,转微调。;2) 有干净示范,走监督微调。示范难采,走人类偏好或模型裁判。算力紧,用参数高效微调,不要一上来全量。;3) 现成模型若能生成可用数据,做合成;若只能当裁判,做偏好或反思;两样都不行,回到人类。合成要单独测能力有没有过来,不能只看口吻像不像老师。;4) 奖励模型和策略拆开迭代。策略在自己的输出上拿分,才知道「你这个水平该不该硬答」。离线标签不管当前能力,会把该含糊的教成硬编。;5) 每轮放大都记账:这撮先验从人来、从过滤来、还是从上一届模型来。迭代蒸馏会把来源糊掉,偏见和…
AI智能系统适合哪些人或团队?
AI智能系统更适合:产品/技术负责人、运营与增长团队、需要落地智能体或自动化的中小团队、关注「AI智能系统」方向的读者。若你只需要单次聊天式问答,可先读概念;若要上生产,请重点看步骤、权限与风控相关段落。
关于「为什么「再提示一下」经常走不出有毒区」,本文给出了什么结论?
在「为什么「再提示一下」经常走不出有毒区」部分,要点是:成模型当裁判——验证往往比生成容易。裁判若只会判断不会生成,仍能产偏好对;若连判断都不稳,就别自动化。 五步按「先验在哪」选杠杆,而不是按论文热度 先问预训练语料里有没有你要的能力。有,先试提示。没有,必须微调。提示失败若是因为坏相关吸收,也算「有但拽不出来」,转微调。 有干净示范,走监督微调。示范难采,走人类偏好或模型裁判。算力紧,用参数高效微调,不要一上来全量。 现成模型若能生成可用数据,做合成;若只能当裁判,做偏好或反思;两样都不
关于「五步按「先验在哪」选杠杆,而不是按论文热度」,本文给出了什么结论?
「五步按「先验在哪」选杠杆,而不是按论文热度」是理解全文的关键切片:建议先读该节的结论句与列表项,再对照前后章节形成闭环。