把大模型从演示变成能值班的系统时,为什么要从这里开始几乎总会先露出工程缺口。下面按可执行的顺序来拆:先讲它解决什么、卡在哪,再讲选型时看哪些数字,最后落到智能体和网关该怎么接。本文面向要上线的工程师,不写空泛趋势。
一、Transformer 在这个时代的位置
很多读者第一次接触 Transformer 是在 2022 年底。那一年 ChatGPT 上线之后的几个月里,「大语言模型」这个词从研究圈漏到了普通人的日常话题里:写邮件、写代码、改简历、做客服、做翻译、做总结,几乎每一项都能被一个对话框接住。再往后两年,Stable Diffusion、Sora、Claude、Gemini、LLaMA、Qwen、DeepSeek 一个接一个出现,背后都站着同一个看起来不太复杂的架构:一沓 attention 块、几沓 MLP 块、外加位置编码和归一化。从某种角度看,过去十年 AI 工程的所有新东西,几乎都是在这个架构上做加法。
但只要你试着去搞懂它,第一道门就能挡住一大半人。打开《Attention Is All You Need》原文,从第三页开始就是 Q、K、V、softmax、scaled dot-product、multi-head、positional encoding、层归一化、残差连接,再加一堆没解释清楚就直接用上的张量形状。你查 attention 是什么,得到的回答里有「query 和 key 做内积」「相似度加权求和」「类似数据库查询」「就是加权平均」「来自 NLP 中的对齐机制」,每一个解释都说了一点,但没有任何一个回答让人觉得「我懂了」。再往下看 paper,关键的那句 (text{Attention}(Q,K,V)=text{softmax}(QK^{top}/sqrt{d_k})V) 就像一个咒语,每个符号你都认识,连起来不知道在说什么。
二、为什么这套系列从数学讲起
我自己第一次读这篇 paper 是在 2018 年,那时它还没有今天这样的地位。当时的我也卡在同一个地方。后来花了大概两年的时间断断续续地补线性代数、补概率、补 RNN、补优化,再回头一段一段重读,才慢慢看明白。这个过程里我反复体会到一件事: Transformer 本身不难,难的是写它的人默认你已经会了一堆别的东西 。这套系列就是想把那「一堆别的东西」一起讲完,并且尽量按照一个真正没基础的读者的思考顺序往前走。
这一篇是序言,不会出现 attention 公式,不会讲 Q/K/V 是什么。它要回答四个问题:第一,为什么 Transformer 值得花这么大力气去搞懂;第二,这套系列是怎么编排的,每一部分各自解决什么问题;第三,不同背景的读者应该按什么顺序读;第四,读完之后你会、又仍然不会做什么。如果你看完这一篇还不确定要不要往下读,那一定是我没写好;如果你看完之后觉得「好,我愿意花两个月把这条线走一遍」,那这一篇就完成了它的任务。
三、这套系列的结构
很多人对 Transformer 的第一印象是「2017 年 Google 提出的、用来做翻译的、后来被推广到别的任务上的一个神经网络」。这个描述每一句都没错,但它把 Transformer 摆在了「众多深度学习模型之一」的位置上。从 2017 年到今天的整整八年里,几乎没有任何其他单一架构在 NLP、视觉、语音、代码、生物、机器人、检索、推荐这么多互不相邻的领域里同时成为主力。卷积神经网络(CNN)做不到,循环神经网络(RNN)做不到,图神经网络(GNN)也做不到。Transformer 的特殊之处不在于它在某一个 benchmark 上比 RNN 高几个点,而在于它是过去几十年里第一个在「形式上跨领域统一」的神经网络架构。
换一个具体一点的说法:今天你在 ChatGPT 里输入一句中文,它内部跑的是 Transformer;你打开 Google Translate 切到英汉互译,跑的也是 Transformer;你用 Cursor 让它补全一段 Python,它背后的代码模型是 Transformer 的变体;你打开 Stable Diffusion 生成一张图,里面那个负责把文字描述转成视觉特征的「文本编码器」是 Transformer,扩散过程里那个去噪网络在最近两年也越来越多地是 Transformer(DiT、SD3、FLUX 都是);你用 Sora 或者可灵生成一段视频,里面的核心生成器仍然是 Transformer;你用 Whisper 做语音识别,跑的是 encoder-decoder Transformer;你用 AlphaFold 做蛋白质结构预测,里面的 Evoformer 是 Transformer 的一个变体;你看一份推荐系
四、谁该读这套系列,谁不该读
更值得注意的是,Transformer 不只是「在新任务上效果更好」,它还把工程上的协作方式改了。在 Transformer 之前,做翻译的同学训练翻译模型,做图像分类的训练分类模型,做语音识别的训练语音模型,每个领域有自己的预处理、特征工程、骨干网络、损失函数,团队之间几乎不共享代码。Transformer 之后,行业默认的工作方式变成了「先训一个大的、能干很多事的基础模型(foundation model),再在上面做微调或 prompt」。换句话说,Transformer 把 AI 工程从「为每个任务写一个模型」变成了「为人类语言、图像、声音写一个底层引擎」。这不是一个模型的胜利,是一种工程范式的胜利。
这里有个常被忽略的事实:Transformer 之所以赢,并不是因为它在小数据小模型上比 RNN 或 CNN 显著聪明。事实上 2017 年它刚出来的时候,在很多任务上的表现只是和当时最好的 RNN 持平甚至略差。它真正的优势要等到 2019 年 GPT-2、2020 年 GPT-3、2022 年 ChatGPT 才彻底显现。换句话说,Transformer 的胜利是「规模放大之后」的胜利,而不是「天生聪明」的胜利。
五、读完之后你能做什么、不能做什么
为什么是 Transformer 适合规模?这件事会在第三部分(《Attention Is All You Need》逐段精读)和第四部分(训练范式与 Scaling Laws)反复回到。这里只提三个最关键的工程性原因,每一个后面都会有专门的章节展开:
第一是 并行性 。RNN 处理一个长度为 (n) 的序列时,必须从第一个 token 算到最后一个 token,每一步都依赖上一步的隐状态,没有办法把整个序列的计算同时铺到 GPU 上。Transformer 的注意力机制把同样的事变成了一个矩阵乘法 (QK^{top}) ,整个序列里所有位置之间的关系一次性算出来。这看起来只是「换了一种算法」,但它意味着你拿 1024 张 GPU 去训练时,Transformer 可以把这些 GPU 真正喂饱,RNN 不行。一旦工程上能把卡用满,模型规模和数据规模就可以一起涨。
六、与 llm-infra 系列的边界
第二是 对长距离依赖的友好 。RNN 把信息一格一格往后传,越往后越淡,再加上梯度的乘积特性,传到第 50 步左右基本就忘了第 1 步说了什么。LSTM 与 GRU 在这件事上做了一些缓解,但本质上都是「靠门控让信息少损失一点」,没有从根上解决。Transformer 的注意力让任何位置都可以「直接看」任何其他位置,距离不再带来信号衰减。这件事看起来只是省了几次梯度乘积,但实际效果是它把「一个段落里相隔 200 个词的两个名词指代同一个对象」这样的事情变成了模型能学的,而 RNN 做不到。
第三是 架构的「可堆叠性」与「可放大性」 。Transformer 一开始就被设计成「一层叠一层」的形式,每一层结构完全相同,只是参数不一样。残差连接(residual connection)和 LayerNorm 的引入,让你即便堆 96 层、堆 200 层也能稳定训练。RNN 也可以堆,但堆深之后梯度问题、状态稀释、并行性都会一起恶化。CNN 可以堆,ResNet 是这条路上的代表作,但卷积带的「局部性」假设在自然语言上显得不自然——一个词的语义不只受它周围 3 个词影响。Transformer 的「全连接 attention + 全连接 FFN」对深度堆叠几乎没有上限,工程师只要肯出 GPU、出数据、出时间就能继续推大。
落地时建议先做的 5 件事
- 用自己的 20 条真实请求测 TTFT / TPOT / 失败原因,不要只看公开榜。
- 先写显存和 KV 缓存账,再决定卡数、量化和并发上限。
- 网关层把鉴权、配额、审计和模型路由收口,应用里不要各接各的 Key。
- 工具调用默认拒绝,按白名单放开,高风险动作必须人审。
- 模型升级准备回滚:旧权重、旧 Prompt、旧评测集要能一键切回。
和智能体产品怎么接
对龙虾PRO这类要把 OpenClaw 落到中国业务场景的平台来说,为什么要从这里开始决定的是延迟能不能进对话、成本能不能规模化、出了问题能不能追溯。技能市场、数字员工和网关都应该吃同一套观测与权限,而不是文章里的概念演示。
本文侧重全链路风控方法论。落地时请用自身业务单据做回放验证,不要把示例阈值直接当生产策略。 相关:风控体检 · 方案资源
常见问题 FAQ
为什么 Transformer 架构在 AI 领域如此重要?
Transformer 是过去十年 AI 工程里第一个在形式上跨领域统一的神经网络架构,它在 NLP、视觉、语音、代码、生物等多领域都成为主力。关键优势包括并行性强能充分利用 GPU、处理长距离依赖更友好、架构可堆叠性高能稳定训练深达数百层,这些使得它在规模放大后超越 RNN 和 CNN,成为现代 AI 的基础引擎。
这套系列为什么从数学讲起?
因为理解 Transformer 需要先掌握线性代数、概率等基础数学知识,作者自己花了两年补这些才看懂论文。系列旨在按真正没基础的读者的思考顺序,把那些写论文的人默认你会的东西一起讲完,避免直接陷入 attention 公式等复杂概念。
这套系列的结构是怎样的?
系列按可执行顺序拆解:先讲 Transformer 解决什么、卡在哪,再讲选型时看哪些数字,最后落到智能体和网关该怎么接。具体章节包括 Transformer 的位置、为什么从数学讲起、系列结构、读者受众、读完后的收获,以及与 llm-infra 系列的边界划分。
谁应该读这套系列文章?
这套系列面向要上线的工程师,不写空泛趋势。如果你需要把大模型从演示变成能值班的系统,并且想从基础设施五层来拆解,应该读。适合有工程背景、想深入理解 Transformer 实现的人,不适合只想了解表面趋势或无相关基础的读者。
读完这套系列后,我能学到什么?
读完后,你能理解 Transformer 的核心概念、工程实现要点,如并行性、长距离依赖处理,并知道如何选择和部署大模型,以及如何与智能体产品集成。系列会帮你打下基础,但不会让你成为专家,实际应用时还需结合具体场景,类似龙虾PRO这样的工具可辅助落地。
Transformer 相比 RNN 和 CNN 有哪些关键优势?
Transformer 的关键优势包括:一是并行性,能将序列计算变成矩阵乘法,高效利用 GPU;二是对长距离依赖更友好,任何位置可直接关注其他位置,避免信息衰减;三是架构可堆叠性强,通过残差连接和 LayerNorm 能稳定训练数百层。这些让它在规模放大后超越其他架构。