-
上下文开到百万,账单和 KV 会先爆:长上下文工程怎么做
从 4K 到 1M+ 上下文的训练与推理工程——位置编码扩展、稀疏 attention、Ring Attention、KV 压缩与长上下文评测
-
一次多吐几个 token:推测解码真正受什么限制
从经典 Speculative Decoding 到 Medusa、EAGLE、Lookahead、MTP 与自推测——系统梳理让大模型”一次多…
-
量化不是越小越好:精度、吞吐和硬件指令的交易
从数据类型、PTQ/QAT 算法、KV Cache 量化到 H100/B200/MI300/昇腾硬件支持,覆盖 AutoAWQ、GPTQ、Smo…
-
推理引擎没有银弹:vLLM、SGLang 和 TRT-LLM 怎么分工
主流推理引擎的架构、性能、生态深度对比,给出工程选型与落地决策依据。
-
KV 缓存把显存打爆之前:分页注意力和持续批处理
PagedAttention 与 Continuous Batching 如何抬高推理吞吐:KV Cache 分页、批调度与工程取舍。
-
推理不是一次函数调用:Prefill 和 Decode 为什么不能同一套参
从 Prefill/Decode 两阶段、KV Cache、Continuous Batching 到 PD 分离,系统讲清楚大模型推理的工程基…
-
万卡训练每天都会断:分钟级恢复靠什么
万卡集群训练每天都在断:从 GPU HBM ECC、NVLink 降级到 SDC,本篇系统讲 checkpoint、恢复与弹性容错的工程实践。
-
对齐不是一次微调:SFT、奖励模型和 GRPO 怎么串
从 SFT、奖励模型到 PPO、DPO、GRPO 的完整对齐流水线工程实践,覆盖 OpenAI o1、DeepSeek-R1 等推理模型的 RL…
-
MoE 便宜的是激活,贵的是路由和通信
混合专家(MoE)模型训练工程实战:从 GShard、Switch、Mixtral 到 DeepSeek-V3,覆盖门控、负载均衡、Expert…
-
训练框架怎么选:Megatron 和 DeepSpeed 的职责边界
开源训练框架双雄对比,覆盖 Megatron-LM、DeepSpeed、FSDP2、torchtitan、Colossal-AI,含选型与工程实…