先给结论:注意力让每个词回看历史上每一个词,训练平方、生成线性、缓存随长度涨。状态空间模型把过去压进有界隐状态,长度改成线性,推理可以快数倍。关键不是又一套循环网络,而是选择机制:遗忘和记住随当前输入变,写入时就丢掉无关。短序列仍该用注意力的高保真;百万词、基因组、长视频、要跨小时记事的助手,该问状态里留了什么,不该只加窗口。

为什么只加窗口解决不了「历史太长」

痛点是通信成本。序列骨干要做两件事:词与词之间传信息,词内部做计算。注意力负责前者,多层感知机负责后者。全对全回看像摄影记忆,有效但昂贵。滑窗和内核优化能推迟崩溃,窗口到对话全历史或整部片子时,平方延迟和缓存会先把机器打满。循环网络另一极端:状态很小、很快,但丢掉的找不回来。

状态空间从连续时间的控制系统来:隐状态按线性动力学演化,新观测写进去,输出从状态读出。离散化之后,每一步像循环网络:新状态由旧状态加新输入,输出由状态读出。矩阵各有分工。转移矩阵问怎么忘;输入矩阵问新词该记住什么;读出矩阵问怎么用状态做下一步;直通项像跳连。步长是停留时间:大就盯住这个词,小就几乎不写进状态。

五步按「状态里有什么」而不是「窗口有多长」做设计

  1. 先定任务长度。短上下文、要对近期每个词保真,注意力仍是默认。长到窗口装不下,或生成延迟已经不可接受,再换有界状态。
  2. 选择机制必须开。没有选择,同一套遗忘和记住套在每个词上,等于流水线,该留的会被冲掉。选择让这些矩阵变成输入的函数,才在有界体积里做得到有效压缩。
  3. 状态当可插拔记忆来设计。把教材、规范、少样本过一遍,得到一份状态,之后提问不必再带长前缀。状态可分享、可检索,前向一遍即可,不必反传。把它当成卡带,而不是每次现场 few-shot。
  4. 解释性改打在状态上。注意力可以在词之间传送;这里信息只经隐状态走。补丁实验要换状态而不是只换残差。能完成「谁给谁苹果」这类上下文任务,说明状态在传该传的名字,不只是在平滑。
  5. 长程智能体把压缩写进训练目标。窗口满了再让另一个模型写摘要,是事后补丁。状态本来就在学「预测下一步该留什么」。视频、基因组、跨会话助手,优先让模型自己压,而不是先译成文字再塞回提示。
骨干 状态多大 何时决定丢什么 适合
注意力 整段历史缓存 回忆时 短中上下文、要高保真
传统循环 很小且固定 几乎一直在丢 短依赖、强效率
无选择的状态空间 有界 同一套遗忘套所有词 训练可卷积加速,效果有上限
有选择的状态空间 有界且按输入过滤 写入时 长序列、可复用状态卡带
两者叠用 近处注意力 + 远处状态 分层 长视频:近帧流畅、远线叙事

选择会关掉卷积形式:无选择时输出是输入的线性卷积,训练能用变换加速;一随输入变,这条捷径没了,要靠扫描和内核优化才能比得过同规模注意力。所以「纸上线性」不等于「卡上更快」,发布必须带扫描实现,不能只报理论复杂度。

状态卡带有一条产品细节:它不等于微调。微调改权重、要梯度;状态是一遍压缩,推理时可零成本复用。物理题库过一遍得到的状态,发给别人可以直接问,不必再带二十本教材。检索可以从「检索段落塞进提示」变成「检索状态插进模型」。状态会随时间变形,不是只读磁盘,版本和校验要单独做。

安全含义也要记账。短窗口聊天助手很难形成跨周工具性目标;有真正长记忆的系统可以。长程智能体的风险清单要重新打开:目标保持、自我复制、跨会话隐瞒。架构从「只有注意力」变成「注意力加状态」之后,评估不能只沿用八千词窗口那一套。

若只能改推理方案的一项:把反复粘贴的长系统提示,换成一次前向得到的状态,并在日志里记下状态哈希。提示每次计费,状态可以摊销。摊销不了,说明你还在用注意力的接口驱动状态模型。哈希对不上就当状态被污染,不准静默接着用;长记忆一旦写坏,后面所有回合都会带着这份坏压缩往前走。

结论:长上下文的预算在状态,不在窗口字数

注意力在回忆时聚焦,选择机制在写入时丢弃。有界状态换来线性长度,代价是保真不如全缓存。短任务不必换;长任务要把状态当成可插拔记忆来设计、来解释、来评估。只加窗口,是在用更贵的摄影记忆推迟问题。

你下次说要百万词上下文,先问丢掉发生在写入还是回忆。答成「窗口再开大一点」,方案就还没换骨架。

效率龙虾 会带着下面这段开聊

按文章《状态空间把过去压成有界状态:序列长度线性、不再跟着平方涨》把卡点收成可执行步骤:先做什么、别踩哪条、怎么验证。

用效率龙虾试这篇

本文侧重全链路风控方法论。落地时请用自身业务单据做回放验证,不要把示例阈值直接当生产策略。 相关:风控体检 · 方案资源

常见问题 FAQ

什么是AI智能系统?

「AI智能系统」可概括为:注意力在回忆时才决定看谁,所以缓存随长度涨。选择机制在写入时就丢掉无关,状态有界,长度线性。长上下文该问状态里留了什么,不该只加窗口。 本文从定义、方法与实践要点展开说明。

为什么要关注AI智能系统?

关注AI智能系统,是因为它直接影响效率、风险与可复制性。文中指出:痛点是通信成本。序列骨干要做两件事:词与词之间传信息,词内部做计算。注意力负责前者,多层感知机负责后者。全对全回看像摄影记忆,有效但昂贵。滑窗和内核优化能推迟崩溃,窗口到对话全历史或整部片子时,平方延迟和缓存会先把机器打满。循环网络另一极端:状态很小、很快,但丢掉的找不回来。

如何落地AI智能系统?有哪些关键步骤?

建议按以下路径推进AI智能系统:1) 先定任务长度。短上下文、要对近期每个词保真,注意力仍是默认。长到窗口装不下,或生成延迟已经不可接受,再换有界状态。;2) 选择机制必须开。没有选择,同一套遗忘和记住套在每个词上,等于流水线,该留的会被冲掉。选择让这些矩阵变成输入的函数,才在有界体积里做得到有效压缩。;3) 状态当可插拔记忆来设计。把教材、规范、少样本过一遍,得到一份状态,之后提问不必再带长前缀。状态可分享、可检索,前向一遍即可,不必反传。把它当成卡带,而不是每次…;4) 解释性改打在状态上。注意力可以在词之间传送;这里信息只经隐状态走。补丁实验要换状态而不是只换残差。能完成「谁给谁苹果」这类上下文任务,说明状态在传该传的名字,…

AI智能系统适合哪些人或团队?

AI智能系统更适合:产品/技术负责人、运营与增长团队、需要落地智能体或自动化的中小团队、关注「AI智能系统」方向的读者。若你只需要单次聊天式问答,可先读概念;若要上生产,请重点看步骤、权限与风控相关段落。

关于「为什么只加窗口解决不了「历史太长」」,本文给出了什么结论?

在「为什么只加窗口解决不了「历史太长」」部分,要点是:短上下文、要对近期每个词保真,注意力仍是默认。长到窗口装不下,或生成延迟已经不可接受,再换有界状态。 选择机制必须开。没有选择,同一套遗忘和记住套在每个词上,等于流水线,该留的会被冲掉。选择让这些矩阵变成输入的函数,才在有界体积里做得到有效压缩。 状态当可插拔记忆来设计。把教材、规范、少样本过一遍,得到一份状态,之后提问不必再带长前缀。状态可分享、可检索,前向一遍即可,不必反传。把它当成卡带,而不是每次现场 few-shot。 解释性改

关于「五步按「状态里有什么」而不是「窗口有多长」做设计」,本文给出了什么结论?

在「五步按「状态里有什么」而不是「窗口有多长」做设计」部分,要点是:状态,并在日志里记下状态哈希。提示每次计费,状态可以摊销。摊销不了,说明你还在用注意力的接口驱动状态模型。哈希对不上就当状态被污染,不准静默接着用;长记忆一旦写坏,后面所有回合都会带着这份坏压缩往前走。 结论:长上下文的预算在状态,不在窗口字数 注意力在回忆时聚焦,选择机制在写入时丢弃。有界状态换来线性长度,代价是保真不如全缓存。短任务不必换;长任务要把状态当成可插拔记忆来设计、来解释、来评估。只加窗口,是在用更贵的摄影记忆推迟问题。