把大模型从演示变成能值班的系统时,RWKV / RetNet / 线性注意力几乎总会先露出工程缺口。下面按可执行的顺序来拆:先讲它解决什么、卡在哪,再讲选型时看哪些数字,最后落到智能体和网关该怎么接。本文面向要上线的工程师,不写空泛趋势。
一、线性注意力:把 softmax 拆成可累积的形式
56|状态空间模型 讲的是用可更新状态取代 full attention 的一条路径:Mamba/S4。这一篇讲另外两条并行的路径—— 直接改写 softmax attention 的数学形式 (线性注意力),以及 训练走 Transformer 的并行路、推理走 RNN 的循环路 (RWKV、RetNet)。三条路径目标一致:把 \(O(n^2)\) 降到 \(O(n)\) ,同时尽量不丢 Transformer 的训练效率。
常见的误区是把” \(O(n)\) “当成免费午餐:只要复杂度公式好看,就默认它在质量和吞吐上都不吃亏。这个误区有具体的反例。Zoology(Arora et al., ICLR 2024 )证明了标准 softmax attention 能用与序列长度无关的维度解出关联检索任务,而线性注意力、RWKV 等循环状态模型做不到,除非状态维度随序列长度增长;Gated Linear Attention(Yang et al., ICML 2024 )的论文摘要直接写道,”现有的线性注意力实现缺乏 I/O 感知,因此比高度优化的 softmax attention 实现更慢”——理论复杂度和真实吞吐是两件事。
二、RWKV:训练像 Transformer、推理像 RNN 的取舍
\[ o_i = \sum_{j=1}^{i} \frac{\exp(q_i^\top k_j/\sqrt{d})}{\sum_{l=1}^{i}\exp(q_i^\top k_l/\sqrt{d})}\, v_j \]
分母里的归一化常数必须扫过全部 \(j\le i\) ,这是 \(O(n^2)\) 的根源:每个 query 都要和所有历史 key 单独算一次相似度。
三、RetNet:retention 与三种计算模式
Katharopoulos et al.( ICML 2020 )的做法是把相似度函数从 \(\exp(q^\top k/\sqrt d)\) 换成一个可分解的核: \(\text{sim}(q,k)=\phi(q)^\top\phi(k)\) ,其中 \(\phi\) 是某个特征映射(论文用 \(\text{elu}(x)+1\) )。代入之后,利用矩阵乘法的结合律,输出可以写成
\[ o_i = \frac{\phi(q_i)^\top \sum_{j=1}^i \phi(k_j)v_j^\top}{\phi(q_i)^\top \sum_{j=1}^i \phi(k_j)} \]
四、理论 \(O(n)\) 不等于真实吞吐:kernel 和硬件生态的距离
定义累积量 \(S_i=\sum_{j\le i}\phi(k_j)v_j^\top\in\mathbb R^{d_k\times d_v}\) 、 \(z_i=\sum_{j\le i}\phi(k_j)\in\mathbb R^{d_k}\) ,则
\[ S_i = S_{i-1}+\phi(k_i)v_i^\top,\qquad z_i=z_{i-1}+\phi(k_i),\qquad o_i=\frac{\phi(q_i)^\top S_i}{\phi(q_i)^\top z_i} \]
五、和 Mamba/SSM 的对照:同一个目标,不同的机制分叉
这正是论文标题”Transformers are RNNs”的字面含义: \(S_i,z_i\) 就是循环状态, 形状是固定的 \(d_k\times d_v\) 矩阵和 \(d_k\) 向量,不随位置 \(i\) 增长 。这是它和标准 attention 的 KV Cache 的本质区别——KV Cache 的大小是 \(O(i\cdot d)\) ,随生成长度线性增长;线性注意力的状态大小是常数。论文报告在自回归图像生成和语音识别任务上,这种重写让推理速度提升最多三个数量级。
Performer(Choromanski et al., ICLR 2021 )走的是另一条子路径:不是任选一个核函数替代 softmax,而是用随机特征(FAVOR+)去 无偏估计 softmax 本身对应的核 ,理论上更接近原始 attention 的行为,但同样依赖特征维度的选择来控制近似误差。这两条子路径(换核 vs. 近似原核)在后续工作里常被一起归为”线性注意力”,但它们对表达力的取舍并不完全一样。
六、争论与开放问题
线性注意力把 attention 矩阵换成了一个固定维度的状态,这个状态能不能撑住”精确检索”是可以被形式化检验的。Zoology(Arora et al., ICLR 2024 )提出了 multi-query associative recall(MQAR)任务:在一段文本里多次、在不同位置、从大词表中检索之前出现过的键值对(例如同时记住”Hakuna Matata 意味着 no worries”和别的几组配对)。论文的核心结论:
Based(Arora et al., arXiv:2402.18668 , 2024,预印本,未见正式同行评审)在同一套 the Pile 评测(GPT-2 BPE 分词、10B token 预训练、约 360M 参数规模)上给出了具体数字,把整体测试集切成”关联检索(AR)token”和”其他 token”分别算困惑度:
落地时建议先做的 5 件事
- 用自己的 20 条真实请求测 TTFT / TPOT / 失败原因,不要只看公开榜。
- 先写显存和 KV 缓存账,再决定卡数、量化和并发上限。
- 网关层把鉴权、配额、审计和模型路由收口,应用里不要各接各的 Key。
- 工具调用默认拒绝,按白名单放开,高风险动作必须人审。
- 模型升级准备回滚:旧权重、旧 Prompt、旧评测集要能一键切回。
和智能体产品怎么接
对龙虾PRO这类要把 OpenClaw 落到中国业务场景的平台来说,RWKV / RetNet / 线性注意力决定的是延迟能不能进对话、成本能不能规模化、出了问题能不能追溯。技能市场、数字员工和网关都应该吃同一套观测与权限,而不是文章里的概念演示。
本文侧重全链路风控方法论。落地时请用自身业务单据做回放验证,不要把示例阈值直接当生产策略。 相关:风控体检 · 方案资源
常见问题 FAQ
什么是AI智能系统?
「AI智能系统」可概括为:线性注意力把 softmax attention 改写成可累积的矩阵状态,RWKV 让训练走 Transformer 的路、推理走 RNN 的路,RetNet 用 retention 统一 parallel/recurrent/chunkwise 三种计算。本文用 MQAR、Based、GLA、RULER 等论文的实测数据说明它们各自在哪里赢、在哪里输给 f 本文从定义、方法与实践要点展开说明。
为什么要关注AI智能系统?
关注AI智能系统,是因为它直接影响效率、风险与可复制性。文中指出:56|状态空间模型 讲的是用可更新状态取代 full attention 的一条路径:Mamba/S4。这一篇讲另外两条并行的路径—— 直接改写 softmax attention 的数学形式 (线性注意力),以及 训练走 Transformer 的并行路、推理走 RNN 的循环路 (RWKV、RetNet)。三条路径目标一致:把 (O(n^2)) 降到 (O(n)) ,同时尽量不丢 Transformer 的训练效率。
如何落地AI智能系统?有哪些关键步骤?
建议按以下路径推进AI智能系统:1) 用自己的 20 条真实请求测 TTFT / TPOT / 失败原因,不要只看公开榜。;2) 先写显存和 KV 缓存账,再决定卡数、量化和并发上限。;3) 网关层把鉴权、配额、审计和模型路由收口,应用里不要各接各的 Key。;4) 工具调用默认拒绝,按白名单放开,高风险动作必须人审。;5) 模型升级准备回滚:旧权重、旧 Prompt、旧评测集要能一键切回。。细节见正文对应章节。
AI智能系统适合哪些人或团队?
AI智能系统更适合:产品/技术负责人、运营与增长团队、需要落地智能体或自动化的中小团队、关注「AI智能系统」方向的读者。若你只需要单次聊天式问答,可先读概念;若要上生产,请重点看步骤、权限与风控相关段落。
关于「一、线性注意力:把 softmax 拆成可累积的形式」,本文给出了什么结论?
在「一、线性注意力:把 softmax 拆成可累积的形式」部分,要点是:rmer 的训练效率。 常见的误区是把” (O(n)) “当成免费午餐:只要复杂度公式好看,就默认它在质量和吞吐上都不吃亏。这个误区有具体的反例。Zoology(Arora et al., ICLR 2024 )证明了标准 softmax attention 能用与序列长度无关的维度解出关联检索任务,而线性注意力、RWKV 等循环状态模型做不到,除非状态维度随序列长度增长;Gated Linear Attention(Yang et
关于「二、RWKV:训练像 Transformer、推理像 RNN 的取舍」,本文给出了什么结论?
在「二、RWKV:训练像 Transformer、推理像 RNN 的取舍」部分,要点是:^top z_i} ] 五、和 Mamba/SSM 的对照:同一个目标,不同的机制分叉 这正是论文标题”Transformers are RNNs”的字面含义: (S_i,z_i) 就是循环状态, 形状是固定的 (d_ktimes d_v) 矩阵和 (d_k) 向量,不随位置 (i) 增长 。这是它和标准 attention 的 KV Cache 的本质区别——KV Cache 的大小是 (O(icdot d)