把大模型从演示变成能值班的系统时,预训练目标几乎总会先露出工程缺口。下面按可执行的顺序来拆:先讲它解决什么、卡在哪,再讲选型时看哪些数字,最后落到智能体和网关该怎么接。本文面向要上线的工程师,不写空泛趋势。
一、预训练目标就是“让模型在自监督里学什么任务”
“预训练”这个词很容易把问题说得太宽。很多人会把它概括成一句话:先拿大量无标注文本训一遍,再做下游任务。这个说法只描述了训练阶段,却没有回答更关键的问题: 模型在预训练阶段到底被要求预测什么?
这不是小差别,而是直接决定了模型架构、推理方式、下游迁移路径,甚至决定了后来哪条路线能扩到几百亿参数、几万亿 token。
二、GPT 路线:自回归语言建模为什么最终赢成主航道
这一篇只做一件事:把 GPT、BERT、T5/BART 这三条主线放在同一张坐标系里,看清它们各自优化什么任务接口、为什么会推着模型架构分化、又为什么通用 LLM 最后大多落到 decoder-only 的 next-token prediction 上。
讨论范围 :本文只比较文本模型里的三类主流预训练目标:自回归语言建模(Causal Language Modeling, CLM)、掩码语言建模(Masked Language Modeling, MLM)与去噪式序列到序列(Denoising Seq2Seq)。ELECTRA、XLNet、UL2、PrefixLM、多模态预训练不在本文展开;模型家族本身放到 37|BERT 、 38|GPT 系列 、 39|T5 、 40|三大路线之争 细讲。
三、BERT 路线:掩码语言建模为什么一度统治理解任务
预训练的数据通常没有人工标签,所以监督信号必须从数据本身构造出来。这就是自监督学习。
对文本来说,最关键的不是“先训一下”,而是先决定模型通过什么接口接收上下文、又通过什么接口给出答案。先把结论压成一张表:
四、T5 / BART 路线:去噪序列到序列,其实更像“条件重建”
你训练时逼模型做什么,它就会把参数预算主要花在那件事上。所以预训练目标本身就会把后续架构、推理方式和微调习惯一起推向不同方向。
GPT-1(Radford et al., 2018)把预训练主线定义成左到右语言建模。给定 token 序列 \((x_1, x_2, \dots, x_T)\) ,训练目标是最大化:
五、三条路线的真正差别,不在名字,而在接口哲学
\[ \sum_{t=1}^{T} \log p(x_t \mid x_{<t}) \]
也就是:当前位置只能看左边,预测自己是什么。这正好对应 decoder-only 结构。
六、为什么最后是 GPT 路线越走越宽
给前缀,采样下一个 token 目标和用法天然一致,这让 CLM 路线特别容易扩展到通用生成模型。
网页、书籍、论坛、代码、对话记录,几乎都可以直接串成 token 流来做 next-token prediction,不需要额外构造 mask、span 或重写输入输出格式。
落地时建议先做的 5 件事
- 用自己的 20 条真实请求测 TTFT / TPOT / 失败原因,不要只看公开榜。
- 先写显存和 KV 缓存账,再决定卡数、量化和并发上限。
- 网关层把鉴权、配额、审计和模型路由收口,应用里不要各接各的 Key。
- 工具调用默认拒绝,按白名单放开,高风险动作必须人审。
- 模型升级准备回滚:旧权重、旧 Prompt、旧评测集要能一键切回。
和智能体产品怎么接
对龙虾PRO这类要把 OpenClaw 落到中国业务场景的平台来说,预训练目标决定的是延迟能不能进对话、成本能不能规模化、出了问题能不能追溯。技能市场、数字员工和网关都应该吃同一套观测与权限,而不是文章里的概念演示。
本文侧重智能体生命周期与技能边界。若你要动手验证,优先用 Playground 做小任务压测;权限与托管再单独规划,避免「先装一堆再治理」。 相关:Playground · 创建智能体 · 学习中心
常见问题 FAQ
什么是智能体栈里的预训?
「智能体栈里的预训」可概括为:这篇文章只比较文本模型里最重要的三类预训练目标:GPT 的自回归语言建模、BERT 的掩码语言建模、T5/BART 的去噪式序列到序列。重点不是背定义,而是看清它们各自优化什么接口、为什么迁移方式不同,以及为什么通用 LLM 最后大多落到 decoder-only 的 next-token prediction。 本文从定义、方法与实践要点展开说明。
为什么要关注智能体栈里的预训?
关注智能体栈里的预训,是因为它直接影响效率、风险与可复制性。文中指出:“预训练”这个词很容易把问题说得太宽。很多人会把它概括成一句话:先拿大量无标注文本训一遍,再做下游任务。这个说法只描述了训练阶段,却没有回答更关键的问题: 模型在预训练阶段到底被要求预测什么?
如何落地智能体栈里的预训?有哪些关键步骤?
建议按以下路径推进智能体栈里的预训:1) 用自己的 20 条真实请求测 TTFT / TPOT / 失败原因,不要只看公开榜。;2) 先写显存和 KV 缓存账,再决定卡数、量化和并发上限。;3) 网关层把鉴权、配额、审计和模型路由收口,应用里不要各接各的 Key。;4) 工具调用默认拒绝,按白名单放开,高风险动作必须人审。;5) 模型升级准备回滚:旧权重、旧 Prompt、旧评测集要能一键切回。。细节见正文对应章节。
智能体栈里的预训适合哪些人或团队?
智能体栈里的预训更适合:产品/技术负责人、运营与增长团队、需要落地智能体或自动化的中小团队、关注「AI智能系统」方向的读者。若你只需要单次聊天式问答,可先读概念;若要上生产,请重点看步骤、权限与风控相关段落。
关于「一、预训练目标就是“让模型在自监督里学什么任务”」,本文给出了什么结论?
在「一、预训练目标就是“让模型在自监督里学什么任务”」部分,要点是:、T5/BART 这三条主线放在同一张坐标系里,看清它们各自优化什么任务接口、为什么会推着模型架构分化、又为什么通用 LLM 最后大多落到 decoder-only 的 next-token prediction 上。 讨论范围 :本文只比较文本模型里的三类主流预训练目标:自回归语言建模(Causal Language Modeling, CLM)、掩码语言建模(Masked Language Modeling, MLM)与去噪式序列到
关于「二、GPT 路线:自回归语言建模为什么最终赢成主航道」,本文给出了什么结论?
在「二、GPT 路线:自回归语言建模为什么最终赢成主航道」部分,要点是:目标本身就会把后续架构、推理方式和微调习惯一起推向不同方向。 GPT-1(Radford et al., 2018)把预训练主线定义成左到右语言建模。给定 token 序列 ((x_1, x_2, dots, x_T)) ,训练目标是最大化: 五、三条路线的真正差别,不在名字,而在接口哲学 [ sum_{t=1}^{T} log p(x_t mid x_{