人工智能推理要拆成两段,不能用同一档硬件包办。预填阶段吃算力,内存带宽用得很轻;逐段生成反过来,卡在带宽上。把预填放在堆满昂贵高带宽内存的芯片上,是在为用不到的带宽付钱。2026年的验收至少要有两列:预填时延、生成速度。只有一个吞吐数字,方案作废。

人工智能推理痛点在用一个吞吐数字盖住两段完全不同的活

预填是把整段上下文一次性算完,算术密度高,每一步搬的数据相对少。生成是每吐一段就要把大块状态从内存里读出来,算术单元经常在等数据。两段的短板不在同一个零件上。用为生成准备的高带宽内存去跑预填,带宽空着,算力也不一定够;用为预填准备的便宜内存去跑生成,算力看起来很肥,生成速度起不来。

已经有人把两段拆开做:预填用算力肥、带宽瘦、内存更便宜的芯片,带宽可以只有同代高带宽方案的大约十分之一;生成仍留在高带宽芯片上。这不是多买一种型号那么简单。整柜如果只重复同一种芯片,两段就只能将就其中一段的短板。别人刚把机柜抄成「一种芯片铺满」,下一代已经按两段重做了路线,抄来的那一版还没跑顺就过期。

对外材料最喜欢一个数:每秒能处理多少、成本是多少。这个数把长上下文的预填和短对话的生成揉在一起。长上下文时,预填时延决定用户要等多久;短对话时,生成速度决定吐字顺不顺。揉完之后,两头都看不出来哪一段在烧钱。

人工智能两段验收五步:分列时延和速度、预填不占贵内存、短板分开报、路线按两段重做、一个吞吐数退回

  1. 预填时延和生成速度必须分列。只有一个吞吐数字的报告退回。
  2. 预填使用的内存档位要写明。高带宽内存跑预填,必须附浪费说明,不能默认划算。
  3. 长上下文和短对话分开测。不许用短对话的分数代表长上下文。
  4. 整柜只装一种芯片,禁止写成两段都已合适。两段硬件的路线要单独有一页。
  5. 追上上一版机柜形态,不算追上推理。对方已拆两段时,路线图要重做,不能沿用旧页。
测到的现象 容易写成 两段里实际发生的 2026分列
每秒吞吐很高 推理已经够用 可能只是短对话的生成快 预填时延单独一列
芯片算力标称很大 长上下文也快 预填在等算力,或生成在等带宽 长上下文、短对话各测一次
全用高带宽内存 配置拉满所以最好 预填用不到那么宽的带宽 预填内存档位和费用
整柜一种芯片 架构统一、好维护 两段短板被绑在同一零件上 两段是否允许不同芯片
机柜形态和对方上一版一样 已经追上 对方已把预填和生成拆开 路线图日期,不是外形相似

上表让费用落在真正短板的那段上。拉满配置如果落在用不到的带宽上,就是贵,不是稳。

人工智能现场怎么把两段拆开测

同一模型准备两套题。一套上下文很长,输出很短,主要测预填时延。一套上下文很短,输出很长,主要测生成速度。两套分数禁止平均成一个数再去报价。报价单上也要能指出:这笔钱买的是预填的算力,还是生成的带宽。

硬件清单加一列「这段用哪种内存」。预填若用了高带宽内存,旁边写明生成是否同时在这块内存上跑。如果预填独占昂贵内存,而带宽利用率很低,这列标浪费,不能标为高端配置。我们在复盘里见过清单只写「全系高带宽」,预填的带宽利用率长期个位数,费用却按整柜记忆体计价。

路线图评审看对方是不是已经把两段拆成两种芯片。如果是,自己仍只有「一种芯片铺满机柜」的一页,这一页作废,退回重做,不能带着「外形已对齐」过会。软件栈也要能把两段调度到不同机器上。调度做不到,硬件拆了也是摆设,报告里写「尚未拆调度」,不要写「架构已支持」。

人工智能常见翻车是用短对话分数采购整柜高带宽

演示用的都是几轮短对话,生成速度很好看,采购就按这个速度去买最贵的内存。上线之后用户丢进长文档,等待时间卡在预填,贵内存帮不上。账单已经按高带宽签了。

另一类翻车是追机柜。上一版整柜方案刚仿出来,对方公布了预填专用芯片。仿制计划仍按旧图纸往下做,理由是「不能再改」。图纸过期这件事,要写在路线图的第一行,不能留到量产之后。

结论:人工智能推理先拆预填和生成,再谈一个吞吐数字

两段的短板不在同一个零件上。一个数字、一种芯片、一种内存,都会把钱花在用不到的地方,或把该花的地方漏掉。

你下次报推理性能,先交预填时延、生成速度、各自用的内存档位。三格空着,先不要给一个总吞吐。

效率龙虾 会带着下面这段开聊

按文章《人工智能推理预填禁止用生成那档硬件:2026算力和带宽必须拆开验收》把卡点收成可执行步骤:先做什么、别踩哪条、怎么验证。

用效率龙虾试这篇

本文侧重全链路风控方法论。落地时请用自身业务单据做回放验证,不要把示例阈值直接当生产策略。 相关:风控体检 · 方案资源

常见问题 FAQ

人工智能推理中的预填和生成阶段分别指什么?

预填阶段是把整段上下文一次性算完,算术密度高,每一步搬的数据相对少,主要吃算力;生成阶段是每吐一段就要把大块状态从内存里读出来,算术单元经常在等数据,卡在带宽上。简单说,预填像读完一整本书,生成像逐字讲故事,短板不在同一个零件。

为什么人工智能推理验收不能只用一个吞吐数字?

因为预填和生成是两段完全不同的活:预填时延决定用户等多久,生成速度决定输出顺不顺。用一个吞吐数字会掩盖各自瓶颈,比如预填慢但生成快,数字好看却实际体验差,导致钱花在用不到的带宽或算力上,方案作废。

如何现场拆分测试人工智能推理的预填和生成?

准备两套测试题:一套上下文很长、输出很短,主要测预填时延;一套上下文很短、输出很长,主要测生成速度。两套分数必须分开报,禁止平均成一个数。报价单要指出钱买的是预填的算力还是生成的带宽,硬件清单也需标明内存档位。

人工智能推理中常见的翻车情况是什么?

常见翻车是用短对话的生成速度分数采购整柜高带宽内存,演示时生成快很好看,但上线后用户丢进长文档,预填时延卡住,贵内存带宽帮不上忙,账单却按高带宽签了,费用浪费。另一类是追旧机柜形态,对方已拆两段硬件,自己方案过期还不重做。

预填和生成阶段对内存带宽的要求有何不同?

预填吃算力,内存带宽用得很轻,可以用便宜内存;生成反过来,卡在带宽上,需要高带宽内存。如果把预填放在高带宽芯片上,带宽空着浪费钱;用便宜内存跑生成,算力看起来肥但速度起不来。验收时预填内存档位必须写明浪费说明。

2026年人工智能推理硬件路线图应该如何规划?

路线图要按预填和生成两段重做:预填用算力肥、带宽瘦、内存便宜的芯片,生成留在高带宽芯片上。如果对方已拆成两种芯片,自己仍只铺满一种芯片的方案要作废退回,路线图日期而非外形相似才算追上。软件栈也需能调度到不同机器。