实验室里能跑的模型和线上能撑住的服务,不是同一件事。大模型推理吃的是显存、延迟和并发。默认生成每个新词都要对整段历史重算注意力,长度 n 就是平方级。长文档和长对话会先把单卡打满。键值缓存把过去步的 K、V 留下,新词只跟缓存做注意力,复杂度从「整段重算」变成「对新词算一次」。公式上是对新查询做 softmax 再乘缓存的值。
朴素缓存会自己制造事故。并发会话长短不一,会话结束留下的空洞填不进去,80GB 里显示占用 40、真正能用的可能只有 20。下午只能服务早上的一半用户,最后靠重启清碎片。分页注意力把缓存切成固定页,按操作系统管虚拟内存那样分配和回收。页大小常用 16 或 32 个词。生产里利用率可以从六七成提到九成以上,同样硬件多塞两三倍会话。页表开销通常不到总显存的百分之一。会话一结束,页立刻给新人用。
静态组批假设请求成群到达。真实流量是流式的,短的十几词、长的两千词。固定批要么空转等凑满,要么用小批浪费算力,闲时利用率能掉到三四成。连续组批是请求来了就往空槽里塞:有人已经吐到第 50 个词,新人可以从第 1 个词插进来。实现要预估每条还要多少显存,留一成到一成五余量,估错就是 OOM。长请求占着槽会堵住短请求,需要抢占或按权重排队。可变长度场景吞吐量相对静态批常见有三到五倍,短请求多的负载收益更大。
70B 半精度大约 140GB,至少两张高端卡。层间切开通信能把有效吞吐砍掉四到六成。注意力头做张量并行,通信更齐、显存更匀。流水线并行只在大批时填得满气泡,交互小批会空转一半以上。同节点高速互连和跨节点带宽差一截,互相通信的块尽量放同一台机器。一张卡挂了,张量并行整实例都停,要健康检查和热副本。冷启动加载要几十秒到两分钟,轮询负载均衡会把请求打到还没热的卡上。
用户感知的是「有没有马上开始出字」,不是总耗时。流式把已生成的词立刻推出去。TCP 和小包缓冲能吞掉几十到两百毫秒,必须关延迟发送,代理也要关掉缓冲。JSON 不能按字符推,要攒到完整片段。半路失败要标明未完成。长连接会让并发连接数比请求-响应高好几倍。
落地清单
- 队列深度直接换成等待时间。交互场景积压到几百条,体验就已经不可接受。超阈值就拒、降级或分流。
- 按用户和请求设词预算。输入长文和输出生成可以分开限额。重复、低置信、自然句界都可以早停。
- GPU 利用率会在 0 和 100 之间跳,按 CPU 那套阈值扩缩会误判。看显存碎片、队列和延迟,而不是平均利用率。
- 故障按进程隔离。内存泄漏、死循环、个别输入崩溃,只能干掉一个实例,不能拖垮整池。
量化、融合内核和专用运行时能再挖一截算力,但选错校准数据会在长生成里慢慢走样。先把缓存和组批做对,再谈编译器。
本文侧重全链路风控方法论。落地时请用自身业务单据做回放验证,不要把示例阈值直接当生产策略。 相关:风控体检 · 方案资源
常见问题 FAQ
什么是AI智能系统?
「AI智能系统」可概括为:自注意力默认按序列平方重算。缓存键值能把每步变成对新词的一次查询,但连续分配会把显存撕成碎片。分页和动态组批,才是生产里能多塞两三倍用户的原因。 本文从定义、方法与实践要点展开说明。
为什么要关注AI智能系统?
关注AI智能系统,是因为它直接影响效率、风险与可复制性。文中指出:朴素缓存会自己制造事故。并发会话长短不一,会话结束留下的空洞填不进去,80GB 里显示占用 40、真正能用的可能只有 20。下午只能服务早上的一半用户,最后靠重启清碎片。分页注意力把缓存切成固定页,按操作系统管虚拟内存那样分配和回收。页大小常用 16 或 32 个词。生产里利用率可以从六七成提到九成以上,同样硬件多塞两三倍会话。页表开销通常不到总显存的百分之一。会话一结束,页立刻给新人用。
如何落地AI智能系统?有哪些关键步骤?
建议按以下路径推进AI智能系统:1) 队列深度直接换成等待时间。交互场景积压到几百条,体验就已经不可接受。超阈值就拒、降级或分流。;2) 按用户和请求设词预算。输入长文和输出生成可以分开限额。重复、低置信、自然句界都可以早停。;3) GPU 利用率会在 0 和 100 之间跳,按 CPU 那套阈值扩缩会误判。看显存碎片、队列和延迟,而不是平均利用率。;4) 故障按进程隔离。内存泄漏、死循环、个别输入崩溃,只能干掉一个实例,不能拖垮整池。。细节见正文对应章节。
AI智能系统适合哪些人或团队?
AI智能系统更适合:产品/技术负责人、运营与增长团队、需要落地智能体或自动化的中小团队、关注「AI智能系统」方向的读者。若你只需要单次聊天式问答,可先读概念;若要上生产,请重点看步骤、权限与风控相关段落。
关于「落地清单」,本文给出了什么结论?
「落地清单」是理解全文的关键切片:建议先读该节的结论句与列表项,再对照前后章节形成闭环。
实践AI智能系统时常见误区有哪些?
常见误区包括:① 只追工具不建流程;② 没有权限/审计边界就上生产;③ 缺少指标与回滚方案;④ 把演示效果当成稳定 SLA。针对AI智能系统,请以正文中的检查清单与约束条件为准,小范围验证后再扩面。