-
并行不是开得越多越好:DP/TP/PP 要按瓶颈组合
万卡训练的基石:从 DP、TP、PP、SP、EP 到 ZeRO/FSDP,再到 DualPipe 的零气泡流水,一篇讲透并行策略的工程选型与通信…
-
预训练只是第一段:SFT、对齐和蒸馏各自在解决什么
以工程视角串联现代 LLM 的四阶段训练栈——预训练、中训、SFT 与对齐——覆盖数据、Tokenizer、优化器、精度、Scaling Law…
-
万卡训练先问网络:NVLink、IB 和国产互联怎么选
从 NVLink / NVSwitch / NVL72 到 InfiniBand NDR 与 RoCEv2,再到华为 CloudMatrix、阿…
-
CUDA 栈不是黑盒:从算子库到集合通信,性能掉在哪一层
从 nvcc 到 Triton,把 NVIDIA 软件栈的每一层拆给大模型工程师看,顺便谈谈 ROCm、CANN 为什么一直追不上。
-
一张 GPU 到底能跑多大模型:算力、显存和带宽怎么一起看
从 CPU 与 GPU 的架构差异出发,讲清楚 SM、Warp、Tensor Core、HBM、NVLink 的工程含义,并结合 Rooflin…
-
大模型不是多起一个服务:基础设施要从五层来拆
面向工程师的大模型基础设施开篇地图,覆盖 2022 到 2026 的工程分水岭、五层工程栈、训练与推理的工程差异、中国与全球行业版图以及成本曲线…
-
隐私计算碰上大模型:现在能做的和还做不到的
AI 与密码学的交叉正在重塑两个领域——本文讲解隐私保护机器学习(PPML)的密码学工具箱、联邦学习中的安全聚合、差分隐私训练,以及 AI 辅助…
-
AI 原生架构不是把模型塞进旧单体
当 LLM 从离线批处理变成在线运行时组件,超时预算、按 token 计费、非确定性输出与多轮 Agent 编排必须进入架构的一等公民。本文从依…
-
Agent 网关怎么放:身份、策略和工具调用的落地骨架
IdP + Policy Engine + Agent Gateway + MCP Host 参考架构,Keycloak/OPA/Envoy 能…
-
哪个用户委托的哪个 Agent 读了哪条记录:审计最小集
Agent 最小审计字段集、OpenTelemetry span 建模 tool 调用、PII 清洗点,以及与 PAM/IGA 审计和零信任可观…