人工智能推理要拆成两段,不能用同一档硬件包办。预填阶段吃算力,内存带宽用得很轻;逐段生成反过来,卡在带宽上。把预填放在堆满昂贵高带宽内存的芯片上,是在为用不到的带宽付钱。2026年的验收至少要有两列:预填时延、生成速度。只有一个吞吐数字,方案作废。
人工智能推理痛点在用一个吞吐数字盖住两段完全不同的活
预填是把整段上下文一次性算完,算术密度高,每一步搬的数据相对少。生成是每吐一段就要把大块状态从内存里读出来,算术单元经常在等数据。两段的短板不在同一个零件上。用为生成准备的高带宽内存去跑预填,带宽空着,算力也不一定够;用为预填准备的便宜内存去跑生成,算力看起来很肥,生成速度起不来。
已经有人把两段拆开做:预填用算力肥、带宽瘦、内存更便宜的芯片,带宽可以只有同代高带宽方案的大约十分之一;生成仍留在高带宽芯片上。这不是多买一种型号那么简单。整柜如果只重复同一种芯片,两段就只能将就其中一段的短板。别人刚把机柜抄成「一种芯片铺满」,下一代已经按两段重做了路线,抄来的那一版还没跑顺就过期。
对外材料最喜欢一个数:每秒能处理多少、成本是多少。这个数把长上下文的预填和短对话的生成揉在一起。长上下文时,预填时延决定用户要等多久;短对话时,生成速度决定吐字顺不顺。揉完之后,两头都看不出来哪一段在烧钱。
人工智能两段验收五步:分列时延和速度、预填不占贵内存、短板分开报、路线按两段重做、一个吞吐数退回
- 预填时延和生成速度必须分列。只有一个吞吐数字的报告退回。
- 预填使用的内存档位要写明。高带宽内存跑预填,必须附浪费说明,不能默认划算。
- 长上下文和短对话分开测。不许用短对话的分数代表长上下文。
- 整柜只装一种芯片,禁止写成两段都已合适。两段硬件的路线要单独有一页。
- 追上上一版机柜形态,不算追上推理。对方已拆两段时,路线图要重做,不能沿用旧页。
| 测到的现象 | 容易写成 | 两段里实际发生的 | 2026分列 |
|---|---|---|---|
| 每秒吞吐很高 | 推理已经够用 | 可能只是短对话的生成快 | 预填时延单独一列 |
| 芯片算力标称很大 | 长上下文也快 | 预填在等算力,或生成在等带宽 | 长上下文、短对话各测一次 |
| 全用高带宽内存 | 配置拉满所以最好 | 预填用不到那么宽的带宽 | 预填内存档位和费用 |
| 整柜一种芯片 | 架构统一、好维护 | 两段短板被绑在同一零件上 | 两段是否允许不同芯片 |
| 机柜形态和对方上一版一样 | 已经追上 | 对方已把预填和生成拆开 | 路线图日期,不是外形相似 |
上表让费用落在真正短板的那段上。拉满配置如果落在用不到的带宽上,就是贵,不是稳。
人工智能现场怎么把两段拆开测
同一模型准备两套题。一套上下文很长,输出很短,主要测预填时延。一套上下文很短,输出很长,主要测生成速度。两套分数禁止平均成一个数再去报价。报价单上也要能指出:这笔钱买的是预填的算力,还是生成的带宽。
硬件清单加一列「这段用哪种内存」。预填若用了高带宽内存,旁边写明生成是否同时在这块内存上跑。如果预填独占昂贵内存,而带宽利用率很低,这列标浪费,不能标为高端配置。我们在复盘里见过清单只写「全系高带宽」,预填的带宽利用率长期个位数,费用却按整柜记忆体计价。
路线图评审看对方是不是已经把两段拆成两种芯片。如果是,自己仍只有「一种芯片铺满机柜」的一页,这一页作废,退回重做,不能带着「外形已对齐」过会。软件栈也要能把两段调度到不同机器上。调度做不到,硬件拆了也是摆设,报告里写「尚未拆调度」,不要写「架构已支持」。
人工智能常见翻车是用短对话分数采购整柜高带宽
演示用的都是几轮短对话,生成速度很好看,采购就按这个速度去买最贵的内存。上线之后用户丢进长文档,等待时间卡在预填,贵内存帮不上。账单已经按高带宽签了。
另一类翻车是追机柜。上一版整柜方案刚仿出来,对方公布了预填专用芯片。仿制计划仍按旧图纸往下做,理由是「不能再改」。图纸过期这件事,要写在路线图的第一行,不能留到量产之后。
结论:人工智能推理先拆预填和生成,再谈一个吞吐数字
两段的短板不在同一个零件上。一个数字、一种芯片、一种内存,都会把钱花在用不到的地方,或把该花的地方漏掉。
你下次报推理性能,先交预填时延、生成速度、各自用的内存档位。三格空着,先不要给一个总吞吐。
本文侧重全链路风控方法论。落地时请用自身业务单据做回放验证,不要把示例阈值直接当生产策略。 相关:风控体检 · 方案资源
常见问题 FAQ
人工智能推理中的预填和生成阶段分别指什么?
预填阶段是把整段上下文一次性算完,算术密度高,每一步搬的数据相对少,主要吃算力;生成阶段是每吐一段就要把大块状态从内存里读出来,算术单元经常在等数据,卡在带宽上。简单说,预填像读完一整本书,生成像逐字讲故事,短板不在同一个零件。
为什么人工智能推理验收不能只用一个吞吐数字?
因为预填和生成是两段完全不同的活:预填时延决定用户等多久,生成速度决定输出顺不顺。用一个吞吐数字会掩盖各自瓶颈,比如预填慢但生成快,数字好看却实际体验差,导致钱花在用不到的带宽或算力上,方案作废。
如何现场拆分测试人工智能推理的预填和生成?
准备两套测试题:一套上下文很长、输出很短,主要测预填时延;一套上下文很短、输出很长,主要测生成速度。两套分数必须分开报,禁止平均成一个数。报价单要指出钱买的是预填的算力还是生成的带宽,硬件清单也需标明内存档位。
人工智能推理中常见的翻车情况是什么?
常见翻车是用短对话的生成速度分数采购整柜高带宽内存,演示时生成快很好看,但上线后用户丢进长文档,预填时延卡住,贵内存带宽帮不上忙,账单却按高带宽签了,费用浪费。另一类是追旧机柜形态,对方已拆两段硬件,自己方案过期还不重做。
预填和生成阶段对内存带宽的要求有何不同?
预填吃算力,内存带宽用得很轻,可以用便宜内存;生成反过来,卡在带宽上,需要高带宽内存。如果把预填放在高带宽芯片上,带宽空着浪费钱;用便宜内存跑生成,算力看起来肥但速度起不来。验收时预填内存档位必须写明浪费说明。
2026年人工智能推理硬件路线图应该如何规划?
路线图要按预填和生成两段重做:预填用算力肥、带宽瘦、内存便宜的芯片,生成留在高带宽芯片上。如果对方已拆成两种芯片,自己仍只铺满一种芯片的方案要作废退回,路线图日期而非外形相似才算追上。软件栈也需能调度到不同机器。