把大模型从演示变成能值班的系统时,Transformer 的根本局限几乎总会先露出工程缺口。下面按可执行的顺序来拆:先讲它解决什么、卡在哪,再讲选型时看哪些数字,最后落到智能体和网关该怎么接。本文面向要上线的工程师,不写空泛趋势。
一、工程瓶颈与架构瓶颈:一条现在有理论支撑的分界线
Transformer 是过去十年最成功的深度学习架构之一。它取代 RNN 成为序列建模主力,支撑了 BERT、GPT、T5、ViT、多模态模型和今天的大语言模型生态。正因为它如此成功,它的问题也被放大到了前所未有的程度。
早期讨论 Transformer 局限时,最常见的一句话是:attention 是 \(O(n^2)\) 。这句话没错,但太粗,而且经常被当成”工程还没优化到位”的临时状态来理解——好像下一代 kernel 或者下一代硬件就能把它翻过去。2022 年以后陆续出现的一批复杂度理论工作说明,这个直觉是错的:在相当一般的假设下,标准 attention 的计算就是没有亚二次时间算法,这不是实现细节,是可以证明的下界。真正的限制因此分成两层——一层是可以被工程持续推远的瓶颈(FlashAttention 解决的 I/O 问题),另一层是工程推不动的架构瓶颈(关系数量、KV Cache 增长、自回归依赖,以及现在有了理论下界背书的计算复杂度本身)。除此之外还有一组更隐蔽的限制:长上下文不等于长期记忆、位置编码的结构性修复也有失效模式、模型的强大很大程度上是数据喂出来的、而喂养本身正在撞上供给上限。
二、O(n²) 不是”数字大”:它是一个可以证明的复杂度下界
这里不是为了宣布 Transformer 过时。相反,要理解后 Transformer 时代的各种路线,必须先准确理解 Transformer 到底卡在哪里,卡在哪一层意义上的”卡”。 56|状态空间模型 、 57|RWKV / RetNet / 线性注意力 、 58|后 Transformer 时代 要回答的问题,都是同一件事的不同侧面:能不能在不越过下面这些下界的前提下,换一种方式计算”序列建模”这件事。
讨论 Transformer 局限时,最容易混淆两类问题。第一类是工程瓶颈:同样的数学公式,现有实现太慢、太耗显存、没有充分利用硬件。第二类是架构瓶颈:即使实现已经足够优秀,模型本身的依赖结构仍然带来成本。
三、推理侧两条独立的代价:KV Cache 线性增长与自回归串行
42|FlashAttention 是工程瓶颈被系统解决的典型案例,也恰好给出了这条分界线的一个精确样本。Dao et al.( NeurIPS 2022 )的 Theorem 2 证明:设序列长度为 \(N\) 、头维为 \(d\) 、片上 SRAM 大小为 \(M\) ,标准 attention 需要 \(\Theta(Nd + N^2)\) 次 HBM 访问,而 FlashAttention 只需要 \(\Theta(N^2d^2M^{-1})\) 次——这是数量级的降低。但同一篇论文的 Proposition 3 同时证明了一个更少被引用、却更关键的结果: 不存在任何精确 attention 算法,能在所有 \(M\) 取值范围内进一步降低 HBM 访问次数 。也就是说,FlashAttention 不是”还没做到最好的工程近似”,它已经是 I/O 复杂度意义上的最优解——工程瓶颈被推到了理论允许的边界,但这个边界仍然留
这条区分不是事后总结出来的。Vaswani et al.( NeurIPS 2017 )的 Table 1 在提出 Transformer 的同一篇论文里,就把 self-attention 的 per-layer complexity( \(O(n^2 d)\) )、sequential operations( \(O(1)\) )、maximum path length( \(O(1)\) )和 recurrent layer(分别是 \(O(nd^2)\) 、 \(O(n)\) 、 \(O(n)\) )并排摆在一起:self-attention 用”任意两个位置一步直达”换来了并行训练,代价正是关系数量的平方增长——这是同一枚硬币的两面,论文作者自己写得很清楚。论文原文还补了一句容易被忽略的限定:当序列长度 \(n\) 小于表示维度 \(d\) 时(当年机器翻译场景下 word-piece/byte-pair 分句的常见情
四、长上下文 ≠ 长期记忆
理解这个区分很重要。否则每次出现新 kernel、新硬件、新 serving trick,人们就会误以为 Transformer 的根本问题已经解决。事实上,工程优化让 Transformer 继续保持竞争力,但也暴露了更深的架构问题:如果上下文继续变长、并发继续增加,现有结构还能撑多久。
标准 self-attention 中,每个 query 都要和所有 key 计算相似度,注意力分数矩阵是 \(n \times n\) 。序列长度翻倍,关系数量变成四倍,这件事本身没有争议。真正值得深挖的问题是:这个二次关系到底是”当前算法不够聪明”,还是”任何算法都逃不掉”?2022 年之后的两项细粒度复杂度理论工作,把这个问题从工程直觉变成了可以证明的命题。
五、位置外推:结构性修复不是终点
Alman 和 Song( NeurIPS 2023 ,“Fast Attention Requires Bounded Entries”)把注意力计算形式化为 \(\mathrm{Att}(Q,K,V) = \mathrm{diag}(A\mathbf{1}_n)^{-1}AV\) ,其中 \(A=\exp(QK^\top/d)\) , \(Q,K,V \in [-B,B]^{n\times d}\) 。他们证明了一个以 \(B=\Theta(\sqrt{\log n})\) 为界的尖锐相变:当 \(B=o(\sqrt{\log n})\) (矩阵元素幅度足够小)时,存在把 attention 近似到 \(1/\mathrm{poly}(n)\) 误差内的 \(n^{1+o(1)}\) 时间算法——接近线性;但当 \(B=\Theta(\sqrt{\log n})\) 或更大时,假设强指数时间假设(Strong Exponen
这两项结果的意义不在于”证明了 \(O(n^2)\) “——这早就是常识——而在于划清了这个下界的精确边界条件:它约束的是 计算标准稠密 softmax attention 本身 (精确或者要求特定误差保证的近似),并且需要输入矩阵元素幅度落在某个阈值以上。这和 43|稀疏与局部注意力 里 BigBird 证明的 \(\tilde\Omega(n^{1-o(1)})\) 层下界是两类不同的结果:BigBird 的下界针对的是”用固定边数的稀疏图能不能在少层内模拟 full attention 的某个具体任务”,回答的是稀疏化的代价;Alman & Song 与 Duman Keles 的下界针对的是”计算标准 attention 这件事本身能不能被加速”,回答的是这件事在算法上是否可能。两者合在一起说明一件更完整的事: 如果你坚持算的是标准稠密 softmax attention,二次时间几乎无法绕开;如果你想绕开,就必须换一个
六、数据效率:强大是喂出来的,喂养本身有硬约束
训练阶段的主要矛盾是并行计算一整段序列;推理阶段的主要矛盾是逐 token 生成,而且这里的成本结构和训练阶段完全不是同一件事。
49|KV Cache 给出的显存公式是 \(2 \times L \times B \times S \times H_{kv} \times D_h \times \text{bytes}\) :缓存大小随层数 \(L\) 、batch \(B\) 、上下文长度 \(S\) 、KV head 数 \(H_{kv}\) 和 head 维度 \(D_h\) 线性 增长。线性听起来比训练时的二次好,但在真实服务系统里,这个线性乘上并发请求数和长上下文窗口,同样会变成显存墙。MQA/GQA 通过压缩 \(H_{kv}\) 、量化通过压缩 bytes 都能把这条线性关系的系数变小,PagedAttention(Kwon et al., SOSP 2023 )通过分页管理消灭内存碎片,但没有一种方法能把 \(S\) 这一项从公式里去掉——只要模型架构要求”decode 时可以看到全部历史”,缓存量就必然随历史长度增长,这是同一类”关系不
落地时建议先做的 5 件事
- 用自己的 20 条真实请求测 TTFT / TPOT / 失败原因,不要只看公开榜。
- 先写显存和 KV 缓存账,再决定卡数、量化和并发上限。
- 网关层把鉴权、配额、审计和模型路由收口,应用里不要各接各的 Key。
- 工具调用默认拒绝,按白名单放开,高风险动作必须人审。
- 模型升级准备回滚:旧权重、旧 Prompt、旧评测集要能一键切回。
和智能体产品怎么接
对龙虾PRO这类要把 OpenClaw 落到中国业务场景的平台来说,Transformer 的根本局限决定的是延迟能不能进对话、成本能不能规模化、出了问题能不能追溯。技能市场、数字员工和网关都应该吃同一套观测与权限,而不是文章里的概念演示。
本文侧重全链路风控方法论。落地时请用自身业务单据做回放验证,不要把示例阈值直接当生产策略。 相关:风控体检 · 方案资源
常见问题 FAQ
什么是AI智能系统?
「AI智能系统」可概括为:FlashAttention 能把 attention 的 I/O 推到理论下界,却动不了 FLOPs;SETH 复杂度理论进一步证明标准 attention 在多数参数区间没有亚二次算法。本文区分工程瓶颈与架构瓶颈,用 RULER、Lost in the Middle 和数据受限 scaling law 说明长上下文非长期记忆、数据效率有硬约束,并给出新架 本文从定义、方法与实践要点展开说明。
为什么要关注AI智能系统?
关注AI智能系统,是因为它直接影响效率、风险与可复制性。文中指出:Transformer 是过去十年最成功的深度学习架构之一。它取代 RNN 成为序列建模主力,支撑了 BERT、GPT、T5、ViT、多模态模型和今天的大语言模型生态。正因为它如此成功,它的问题也被放大到了前所未有的程度。
如何落地AI智能系统?有哪些关键步骤?
建议按以下路径推进AI智能系统:1) 用自己的 20 条真实请求测 TTFT / TPOT / 失败原因,不要只看公开榜。;2) 先写显存和 KV 缓存账,再决定卡数、量化和并发上限。;3) 网关层把鉴权、配额、审计和模型路由收口,应用里不要各接各的 Key。;4) 工具调用默认拒绝,按白名单放开,高风险动作必须人审。;5) 模型升级准备回滚:旧权重、旧 Prompt、旧评测集要能一键切回。。细节见正文对应章节。
AI智能系统适合哪些人或团队?
AI智能系统更适合:产品/技术负责人、运营与增长团队、需要落地智能体或自动化的中小团队、关注「AI智能系统」方向的读者。若你只需要单次聊天式问答,可先读概念;若要上生产,请重点看步骤、权限与风控相关段落。
关于「一、工程瓶颈与架构瓶颈:一条现在有理论支撑的分界线」,本文给出了什么结论?
在「一、工程瓶颈与架构瓶颈:一条现在有理论支撑的分界线」部分,要点是:下一代 kernel 或者下一代硬件就能把它翻过去。2022 年以后陆续出现的一批复杂度理论工作说明,这个直觉是错的:在相当一般的假设下,标准 attention 的计算就是没有亚二次时间算法,这不是实现细节,是可以证明的下界。真正的限制因此分成两层——一层是可以被工程持续推远的瓶颈(FlashAttention 解决的 I/O 问题),另一层是工程推不动的架构瓶颈(关系数量、KV Cache 增长、自回归依赖,以及现在有了理论下界背书
关于「二、O(n²) 不是”数字大”:它是一个可以证明的复杂度下界」,本文给出了什么结论?
在「二、O(n²) 不是”数字大”:它是一个可以证明的复杂度下界」部分,要点是:tion 用”任意两个位置一步直达”换来了并行训练,代价正是关系数量的平方增长——这是同一枚硬币的两面,论文作者自己写得很清楚。论文原文还补了一句容易被忽略的限定:当序列长度 (n) 小于表示维度 (d) 时(当年机器翻译场景下 word-piece/byte-pair 分句的常见情 四、长上下文 ≠ 长期记忆 理解这个区分很重要。否则每次出现新 kernel、新硬件、新 serving trick,人们就会误以为 Transf