把大模型从演示变成能值班的系统时,预训练目标几乎总会先露出工程缺口。下面按可执行的顺序来拆:先讲它解决什么、卡在哪,再讲选型时看哪些数字,最后落到智能体和网关该怎么接。本文面向要上线的工程师,不写空泛趋势。

一、预训练目标就是“让模型在自监督里学什么任务”

“预训练”这个词很容易把问题说得太宽。很多人会把它概括成一句话:先拿大量无标注文本训一遍,再做下游任务。这个说法只描述了训练阶段,却没有回答更关键的问题: 模型在预训练阶段到底被要求预测什么?

这不是小差别,而是直接决定了模型架构、推理方式、下游迁移路径,甚至决定了后来哪条路线能扩到几百亿参数、几万亿 token。

二、GPT 路线:自回归语言建模为什么最终赢成主航道

这一篇只做一件事:把 GPT、BERT、T5/BART 这三条主线放在同一张坐标系里,看清它们各自优化什么任务接口、为什么会推着模型架构分化、又为什么通用 LLM 最后大多落到 decoder-only 的 next-token prediction 上。

讨论范围 :本文只比较文本模型里的三类主流预训练目标:自回归语言建模(Causal Language Modeling, CLM)、掩码语言建模(Masked Language Modeling, MLM)与去噪式序列到序列(Denoising Seq2Seq)。ELECTRA、XLNet、UL2、PrefixLM、多模态预训练不在本文展开;模型家族本身放到 37|BERT 、 38|GPT 系列 、 39|T5 、 40|三大路线之争 细讲。

三、BERT 路线:掩码语言建模为什么一度统治理解任务

预训练的数据通常没有人工标签,所以监督信号必须从数据本身构造出来。这就是自监督学习。

对文本来说,最关键的不是“先训一下”,而是先决定模型通过什么接口接收上下文、又通过什么接口给出答案。先把结论压成一张表:

四、T5 / BART 路线:去噪序列到序列,其实更像“条件重建”

你训练时逼模型做什么,它就会把参数预算主要花在那件事上。所以预训练目标本身就会把后续架构、推理方式和微调习惯一起推向不同方向。

GPT-1(Radford et al., 2018)把预训练主线定义成左到右语言建模。给定 token 序列 \((x_1, x_2, \dots, x_T)\) ,训练目标是最大化:

五、三条路线的真正差别,不在名字,而在接口哲学

\[ \sum_{t=1}^{T} \log p(x_t \mid x_{<t}) \]

也就是:当前位置只能看左边,预测自己是什么。这正好对应 decoder-only 结构。

六、为什么最后是 GPT 路线越走越宽

给前缀,采样下一个 token 目标和用法天然一致,这让 CLM 路线特别容易扩展到通用生成模型。

网页、书籍、论坛、代码、对话记录,几乎都可以直接串成 token 流来做 next-token prediction,不需要额外构造 mask、span 或重写输入输出格式。

落地时建议先做的 5 件事

  1. 用自己的 20 条真实请求测 TTFT / TPOT / 失败原因,不要只看公开榜。
  2. 先写显存和 KV 缓存账,再决定卡数、量化和并发上限。
  3. 网关层把鉴权、配额、审计和模型路由收口,应用里不要各接各的 Key。
  4. 工具调用默认拒绝,按白名单放开,高风险动作必须人审。
  5. 模型升级准备回滚:旧权重、旧 Prompt、旧评测集要能一键切回。

和智能体产品怎么接

对龙虾PRO这类要把 OpenClaw 落到中国业务场景的平台来说,预训练目标决定的是延迟能不能进对话、成本能不能规模化、出了问题能不能追溯。技能市场、数字员工和网关都应该吃同一套观测与权限,而不是文章里的概念演示。

效率龙虾 会带着下面这段开聊

按文章《智能体栈里的预训练目标:延迟、成本和翻车点》把卡点收成可执行步骤:先做什么、别踩哪条、怎么验证。

用效率龙虾试这篇

本文侧重智能体生命周期与技能边界。若你要动手验证,优先用 Playground 做小任务压测;权限与托管再单独规划,避免「先装一堆再治理」。 相关:Playground · 创建智能体 · 学习中心

常见问题 FAQ

什么是智能体栈里的预训?

「智能体栈里的预训」可概括为:这篇文章只比较文本模型里最重要的三类预训练目标:GPT 的自回归语言建模、BERT 的掩码语言建模、T5/BART 的去噪式序列到序列。重点不是背定义,而是看清它们各自优化什么接口、为什么迁移方式不同,以及为什么通用 LLM 最后大多落到 decoder-only 的 next-token prediction。 本文从定义、方法与实践要点展开说明。

为什么要关注智能体栈里的预训?

关注智能体栈里的预训,是因为它直接影响效率、风险与可复制性。文中指出:“预训练”这个词很容易把问题说得太宽。很多人会把它概括成一句话:先拿大量无标注文本训一遍,再做下游任务。这个说法只描述了训练阶段,却没有回答更关键的问题: 模型在预训练阶段到底被要求预测什么?

如何落地智能体栈里的预训?有哪些关键步骤?

建议按以下路径推进智能体栈里的预训:1) 用自己的 20 条真实请求测 TTFT / TPOT / 失败原因,不要只看公开榜。;2) 先写显存和 KV 缓存账,再决定卡数、量化和并发上限。;3) 网关层把鉴权、配额、审计和模型路由收口,应用里不要各接各的 Key。;4) 工具调用默认拒绝,按白名单放开,高风险动作必须人审。;5) 模型升级准备回滚:旧权重、旧 Prompt、旧评测集要能一键切回。。细节见正文对应章节。

智能体栈里的预训适合哪些人或团队?

智能体栈里的预训更适合:产品/技术负责人、运营与增长团队、需要落地智能体或自动化的中小团队、关注「AI智能系统」方向的读者。若你只需要单次聊天式问答,可先读概念;若要上生产,请重点看步骤、权限与风控相关段落。

关于「一、预训练目标就是“让模型在自监督里学什么任务”」,本文给出了什么结论?

在「一、预训练目标就是“让模型在自监督里学什么任务”」部分,要点是:、T5/BART 这三条主线放在同一张坐标系里,看清它们各自优化什么任务接口、为什么会推着模型架构分化、又为什么通用 LLM 最后大多落到 decoder-only 的 next-token prediction 上。 讨论范围 :本文只比较文本模型里的三类主流预训练目标:自回归语言建模(Causal Language Modeling, CLM)、掩码语言建模(Masked Language Modeling, MLM)与去噪式序列到

关于「二、GPT 路线:自回归语言建模为什么最终赢成主航道」,本文给出了什么结论?

在「二、GPT 路线:自回归语言建模为什么最终赢成主航道」部分,要点是:目标本身就会把后续架构、推理方式和微调习惯一起推向不同方向。 GPT-1(Radford et al., 2018)把预训练主线定义成左到右语言建模。给定 token 序列 ((x_1, x_2, dots, x_T)) ,训练目标是最大化: 五、三条路线的真正差别,不在名字,而在接口哲学 [ sum_{t=1}^{T} log p(x_t mid x_{