人工智能把卡数加总,得不到一个集群。单园区的电力和冷却到顶之后,大训练会拆到多个园区去做,这件事已经在发生。多园区一起训,和单园区里加速器彼此同步成一体,是两种做法。液冷如果只到了芯片、园区水系统没接上,或者机房之间的同步比单园区慢一个数量级,卡数表都仍然很好看。2026年要先写最慢的那一跳,再允许使用「一个集群」这四个字。

人工智能集群痛点在用地图片上的楼当一个训练域

单栋楼的功率有上限。训练要的规模超过这个上限时,就得把一个作业拆到几座园区,中间用网络把梯度或激活对上。能对上,不等于和对面机柜一样快。一体集群里,卡和卡在同一套高速互联里,步长由机柜内部决定。跨园区时,步长由最远、最慢的那一跳决定。用卡数乘单卡速度去报整场算力,等于假设这跳不存在。

冷却也是分层的。热从芯片进液体,液体再到园区的水系统,水系统再经冷却塔排出去。只说液冷到了芯片,园区水管和冷却塔可以还是旧的、按低密度机房设计的。高密度机柜放进去,芯片侧的液体没有地方把热交出去,密度优势用不上。有的场地因此拆掉在建的低密度楼,改成能接高密度的设计。没拆、也没改水管,却把楼算进人工智能容量,是把土建进度当成了集群进度。

电力到顶和训练停止不是一回事。到顶的是这一座园区。方案可以是第二座园区,也可以是承认只能做较小的一体作业。两种方案的网络、同步和故障域完全不同,必须分列,不能都叫「我们有一个大集群」。

人工智能集群验收五步:卡数不是集群、到顶要写去向、同步单列、水系统单列、步长先核

  1. 卡数合计禁止叫一个集群。先标明是一体互联,还是跨园区拼起来的。
  2. 单园区功率或冷却到顶时,写下去向:缩小作业,还是多园区。不许写训练因此已解决。
  3. 多园区方案必须单列同步方式、故障时怎么切、最慢一跳的延迟。
  4. 液冷到芯片,和园区水系统、冷却塔,分列验收。芯片侧有液体不等于热出得去。
  5. 机房之间光是连通,禁止写成延迟可忽略。同步步长用实测,不用连通与否。
汇报用语 实际可能只是 还缺的证据 没有证据时怎么叫
我们有十万张卡 若干园区的库存合计 这些卡在不在同一次作业里同步 库存,不是集群
训练已跨园区 作业被拆开跑 最慢一跳的步长、失败怎么恢复 多园区试验,不是一体集群
已上液冷 液体到了芯片 园区水系统和冷却塔的容量 芯片侧液体,园区未验收
两栋楼已连网 有一条链路 同步步长是否还跟得上迭代 链路存在,延迟未核
这座园区电力到顶 不能再在此地加大 下一座园区的四格日期 本地到顶,去向未定

上表把库存、链路、液体和作业切开。四个词都能出现在同一篇周报里,仍可能没有一次跑完的跨园区作业。

人工智能现场怎么判断是不是一个集群

给每次大作业发一张范围卡:卡在哪些楼、哪些园区,同步走的是机柜内互联还是园区之间的链路,允许的最大步长是多少。实测步长超过允许值,这张范围卡上的卡数不能加进「一体算力」。可以加进「参与过试验的卡数」,两个数禁止共用一个名字。

冷却验收走热的路径,不走采购清单。清单上有液冷接头,只说明芯片侧可能接了。要量的是:满负载时芯片液体的进出温差、热交到园区水系统之后冷却塔还有没有余量。余量没有记录,高密度机柜按不能满载记。旧楼若密度不够,要么改水系统和电力,要么不要把这栋的面积算进人工智能容量。改和没改,用竣工日期区分,不用设计稿区分。

多园区作业另做故障演练:切断最慢的那一跳,作业是停、是降级到单园区,还是静默地用旧数据继续。三种结果都要写进运行说明。没演练过的跨园区,保持「试验」状态,不能在容量总表里和一体集群加在一起。我们见过总表只有一个数,底下既有同一机房的一体柜,也有只做过连通测试的第二园区,评审按这个数去排训练,第二园区在第一次集合通信时把步长拖穿。

人工智能常见翻车是一张地图加上一个卡数

地图上画了三座园区,箭头表示「将会互联」。箭头是计划。卡数是已下单或已上架的合计。计划和库存相加,得到一个比任何一次真实作业都大的数。这个数一旦进了对外材料,后面的电力和网络都被迫去圆它。

另一类翻车是液冷项目验收看了机柜内部的管路照片,没看楼外的冷却塔。照片过了,夏天满载时热交不出去,密度又退回旧机房的水平。芯片侧的投入还在账上,容量却回来了。

结论:人工智能集群以一次作业里最慢的那跳为准,不以卡数合计为准

一体互联、跨园区同步、芯片液体、园区水系统,是四件器具。器具没齐,楼可以很多,卡可以很多,仍是若干堆设备,不是一个训练域。

你下次报集群规模,先交这次数作业的范围、最慢一跳的实测步长、热是否交到了园区水系统。三样空着,先不要把卡数加总叫成一个集群。

效率龙虾 会带着下面这段开聊

按文章《人工智能卡数相加禁止当成已经一个集群:2026跨园区必须单独验收》把卡点收成可执行步骤:先做什么、别踩哪条、怎么验证。

用效率龙虾试这篇

本文侧重全链路风控方法论。落地时请用自身业务单据做回放验证,不要把示例阈值直接当生产策略。 相关:风控体检 · 方案资源

常见问题 FAQ

人工智能集群验收五步具体指什么?

验收五步包括:卡数不是集群,不能简单把卡数加总当集群;到顶要写去向,电力或冷却到顶时需明确是缩小作业还是多园区方案;同步单列,多园区方案要单独列出同步方式、故障切换和最慢一跳延迟;水系统单列,液冷到芯片和园区水系统、冷却塔分开验收;步长先核,用实测步长而非连通性判断。这能确保集群定义真实。

为什么卡数相加不能当成一个集群?

因为卡数只是库存合计,不代表这些卡在同一次作业中同步运行。文章强调,集群以一次作业里最慢的一跳为准,跨园区时步长由最远最慢链路决定,卡数乘单卡速度会忽略这跳,导致虚报算力。卡数表好看但实际同步可能很慢,所以禁止把卡数直接加总当集群。

如何现场判断一个系统是不是人工智能集群?

给每次大作业发一张范围卡,标明卡在哪些楼、哪些园区,同步走的是机柜内互联还是园区间链路,以及允许的最大步长。如果实测步长超过允许值,这些卡数就不能加进一体算力,只能算参与过试验的卡数。两者名字不能混用,以避免误判。

人工智能集群常见翻车有哪些?

常见翻车是只看地图画了园区和卡数合计,计划互联和库存相加得到虚数,进了对外材料后电力和网络被迫圆谎。另一翻车是液冷验收只看机柜内部管路,没验楼外冷却塔容量,满载时热交不出去,密度退回旧水平。这些都因忽略实际作业限制导致。

跨园区训练和单园区集群有什么区别?

跨园区训练是把作业拆到多个园区,中间用网络同步,步长由最慢一跳决定,网络、同步和故障域完全不同;单园区集群里卡在同一套高速互联中,步长由机柜内部决定。两者必须分列,不能都叫大集群,否则会混淆算力评估和运行风险。

2026年跨园区验收必须先做什么?

2026年要先写最慢那一跳的实测步长,再允许使用一个集群这个词。汇报集群规模时,必须先提供作业范围、最慢一跳步长、热是否交到园区水系统,这三样空着就不能把卡数加总叫集群。这是为了确保验收基于真实作业数据,而非计划或库存。