把大模型从演示变成能值班的系统时,Checkpoint 与故障容忍几乎总会先露出工程缺口。下面按可执行的顺序来拆:先讲它解决什么、卡在哪,再讲选型时看哪些数字,最后落到智能体和网关该怎么接。本文面向要上线的工程师,不写空泛趋势。
一、引子:万卡训练,为什么每天都在断
如果只看论文,LLM 预训练像是一段优雅的长跑:给定数据、给定超参、给定 N 天的时间,loss 曲线就会优雅地下降。但真正在万卡集群里跑过一次 100B+ 模型预训练的人都知道,现实根本不是那样。
Meta 在 LLaMA-3 技术报告里诚实地披露了一组数字:在 16K H100 的集群上训练 405B 模型的 54 天窗口期内,一共发生了 466 次作业中断 ,其中 419 次是”非预期中断”,平均下来大约每 3 小时一次。GPU 相关故障占比最高(约 58%),其中 HBM ECC、NVLink、SM 故障是前三名。xAI 的 Colossus 集群规模到了 10 万卡量级,按线性外推,MTBF(平均无故障时间)只会更短;公开的分享里,xAI 工程师说他们一开始几乎每几分钟就要处理一次故障报警。
二、故障谱系:一台训练机到底会怎么坏
这就是万卡训练的第一性现实: 硬件从统计上是”一定会坏”的 ,问题不是坏不坏,而是坏的时候你能多快恢复。一次 1 小时的中断,在 1.6 万卡 H100 上按 2 美元/小时算,直接成本就是 32,000 美元;如果恢复要半小时,再乘以一半。真正的代价还不止这些:训练时间被拉长会让模型晚上线,而在 LLM 竞赛里,晚上线一个月等于直接少赚一个数量级的钱。
所以这一篇讲 checkpoint 与故障容忍——它不是训练流水线里最”性感”的模块,却是决定一次千亿级训练能不能按期跑完的关键工程。落地时可以覆盖:常见故障谱系、checkpoint 的大小与写入路径、异步与分布式 checkpoint、健康检查、弹性训练、以及 Meta / xAI / DeepSeek 的公开经验,最后给一份可以照着落地的 checklist。
三、Checkpoint 的第一性问题:它有多大
在正式进入分类之前,先给一个直观的数字感。假设单颗 GPU 的年故障率(AFR)是 2%——这是业界比较乐观的估计。对一个 16,000 卡的集群,整体 每天 发生至少一次 GPU 硬故障的概率是:
[ 1 – (1 – 0.02/365)^{16000} approx 1 – e^{-16000 times 0.02/365} approx 1 – e^{-0.877} approx 58% ]
四、代码示例:PyTorch DCP 异步保存
每天 58% 意味着”几乎每天都有事”。而真实的 H100 大规模集群 AFR 显著高于 2%(新硬件磨合期尤甚),加上 GPU 不是唯一故障源,LLaMA-3 那个”平均 3 小时一次中断”就不奇怪了。
HBM ECC(Error-Correcting Code)错误 :H100 单卡 80 GB HBM3,粒子翻转(bit flip)是物理事实。可纠正的(SBE, single-bit error)会被硬件自动修复并上报;不可纠正的(DBE, double-bit error)会触发 CUDA ERROR_ECC_UNCORRECTABLE,当前 CUDA context 整个作废。LLaMA-3 报告里 HBM 故障占 GPU 故障的相当大比例。
五、恢复时间(RTO)优化
TDR(Timeout Detection and Recovery) / GPU hang:某个 kernel 长时间不返回,驱动复位 GPU。通常是死锁(比如 NCCL 集合通信挂起)、非法访问、硬件卡死。复位后 CUDA context 丢失,必须整个进程重来。
SM 故障 :H100 有 132 个 SM,个别 SM 出现永久故障时,驱动会把这颗卡标为不健康。Nvidia 的 nvidia-smi -q -d ECC,ROW_REMAPPER 可以看到行重映射(row remapping)发生了多少次——这是 HBM 老化的强信号。
六、健康检查:启动前、运行中、结束后
温度/功耗 :H100 TDP 700 W,液冷故障时很快热失控降频,整排机柜的 step time 会一起变慢,形成”隐性故障”。
NVLink 降级 :H100 上 18 条 NVLink 单向 450 GB/s,个别链路挂掉时 NCCL 还能跑,但 all-reduce 带宽腰斩。这类故障极其隐蔽,它不会让作业崩,只会让每步时间从 3.2 秒涨到 4.5 秒。
落地时建议先做的 5 件事
- 用自己的 20 条真实请求测 TTFT / TPOT / 失败原因,不要只看公开榜。
- 先写显存和 KV 缓存账,再决定卡数、量化和并发上限。
- 网关层把鉴权、配额、审计和模型路由收口,应用里不要各接各的 Key。
- 工具调用默认拒绝,按白名单放开,高风险动作必须人审。
- 模型升级准备回滚:旧权重、旧 Prompt、旧评测集要能一键切回。
和智能体产品怎么接
对龙虾PRO这类要把 OpenClaw 落到中国业务场景的平台来说,Checkpoint 与故障容忍决定的是延迟能不能进对话、成本能不能规模化、出了问题能不能追溯。技能市场、数字员工和网关都应该吃同一套观测与权限,而不是文章里的概念演示。
本文侧重全链路风控方法论。落地时请用自身业务单据做回放验证,不要把示例阈值直接当生产策略。 相关:风控体检 · 方案资源
常见问题 FAQ
什么是万卡训练每天都会?
「万卡训练每天都会」可概括为:万卡集群训练每天都在断:从 GPU HBM ECC、NVLink 降级到 SDC,本篇系统讲 checkpoint、恢复与弹性容错的工程实践。 本文从定义、方法与实践要点展开说明。
为什么要关注万卡训练每天都会?
关注万卡训练每天都会,是因为它直接影响效率、风险与可复制性。文中指出:如果只看论文,LLM 预训练像是一段优雅的长跑:给定数据、给定超参、给定 N 天的时间,loss 曲线就会优雅地下降。但真正在万卡集群里跑过一次 100B+ 模型预训练的人都知道,现实根本不是那样。
如何落地万卡训练每天都会?有哪些关键步骤?
建议按以下路径推进万卡训练每天都会:1) 用自己的 20 条真实请求测 TTFT / TPOT / 失败原因,不要只看公开榜。;2) 先写显存和 KV 缓存账,再决定卡数、量化和并发上限。;3) 网关层把鉴权、配额、审计和模型路由收口,应用里不要各接各的 Key。;4) 工具调用默认拒绝,按白名单放开,高风险动作必须人审。;5) 模型升级准备回滚:旧权重、旧 Prompt、旧评测集要能一键切回。。细节见正文对应章节。
万卡训练每天都会适合哪些人或团队?
万卡训练每天都会更适合:产品/技术负责人、运营与增长团队、需要落地智能体或自动化的中小团队。若你只需要单次聊天式问答,可先读概念;若要上生产,请重点看步骤、权限与风控相关段落。
关于「一、引子:万卡训练,为什么每天都在断」,本文给出了什么结论?
在「一、引子:万卡训练,为什么每天都在断」部分,要点是:大约每 3 小时一次。GPU 相关故障占比最高(约 58%),其中 HBM ECC、NVLink、SM 故障是前三名。xAI 的 Colossus 集群规模到了 10 万卡量级,按线性外推,MTBF(平均无故障时间)只会更短;公开的分享里,xAI 工程师说他们一开始几乎每几分钟就要处理一次故障报警。 二、故障谱系:一台训练机到底会怎么坏 这就是万卡训练的第一性现实: 硬件从统计上是”一定会坏”的 ,问题不是坏不坏,而是坏的时候你能多快恢
关于「二、故障谱系:一台训练机到底会怎么坏」,本文给出了什么结论?
在「二、故障谱系:一台训练机到底会怎么坏」部分,要点是:怪了。 HBM ECC(Error-Correcting Code)错误 :H100 单卡 80 GB HBM3,粒子翻转(bit flip)是物理事实。可纠正的(SBE, single-bit error)会被硬件自动修复并上报;不可纠正的(DBE, double-bit error)会触发 CUDA ERROR_ECC_UNCORRECTABLE,当前 CUDA context 整个作废。LLaMA-3 报告里 HBM 故障占 GP