把大模型从演示变成能值班的系统时,Diffusion + Transformer几乎总会先露出工程缺口。下面按可执行的顺序来拆:先讲它解决什么、卡在哪,再讲选型时看哪些数字,最后落到智能体和网关该怎么接。本文面向要上线的工程师,不写空泛趋势。

一、扩散模型留给 backbone 的接口有多窄

上一篇 46|多模态融合 讲的是”把图像塞进语言模型”。DiT(Diffusion Transformer)做的是另一件事:把语言模型最熟悉的模块——Transformer——塞进扩散模型,替掉图像生成里用了近十年的 U-Net。

这次替换容易被两种方式误读。一种是”GPT 直接画图了”——不是,DiT 仍然是标准的扩散模型,从噪声逐步去噪,Transformer 只是接管了”预测噪声”这一个子任务。另一种是把它当成理所当然的架构升级——也不是,U-Net 阵营在 DiT 论文发表半年后就拿出了真实的反例,说明这不是一次单方面碾压,而是一场仍在拉锯的争论。

二、DiT 拆开看:patchify 和四种条件注入方式

DDPM(Ho et al., NeurIPS 2020 )的前向过程给真实样本 \(x_0\) 逐步加噪:

\[ q(x_t \mid x_0) = \mathcal{N}\!\left(x_t;\ \sqrt{\bar\alpha_t}\, x_0,\ (1-\bar\alpha_t)\, I\right) \]

三、scaling 叙事说的到底是什么

\(\bar\alpha_t\) 是噪声调度(noise schedule)在第 \(t\) 步累积下来的信噪比: \(t\) 越大, \(\bar\alpha_t\) 越小, \(x_t\) 越接近纯噪声。反向过程要学的是从 \(x_t\) 恢复 \(x_{t-1}\) ,Ho et al. 发现直接用网络预测噪声 \(\epsilon\) 比预测 \(x_0\) 更稳定,简化训练目标(论文 Eq. 14)就是:

\[ L_{\text{simple}} = \mathbb{E}_{x_0,\,\epsilon,\,t}\left[\left\|\epsilon – \epsilon_\theta(x_t, t)\right\|^2\right] \]

四、争论:U-Net 真的被 Transformer 淘汰了吗

这条式子里 \(\theta\) ——去噪网络——只被要求做一件事:输入带噪样本 \(x_t\) 和时间步 \(t\) (条件生成再加上类别或文本 \(c\) ),输出一个和 \(x_t\) 形状相同的噪声预测。这个接口窄得几乎不挑 backbone:只要网络能吃一个张量、吃一个标量/向量条件、吐出同形状张量,CNN、U-Net、Transformer 都能填进去。

早期图像扩散选 U-Net(Ronneberger et al., MICCAI 2015 的分割网络改的),是因为它天然带图像归纳偏置:卷积的局部性、多尺度下采样-上采样带 skip connection,正好匹配图像去噪”既要局部纹理又要全局结构”的需求。Dhariwal & Nichol 的 ADM( Diffusion Models Beat GANs on Image Synthesis , NeurIPS 2021)把这条路线的 U-Net 消融到很细:归一化方式、通道数、attention 插在哪一层分辨率,最终确立了当时的强基线。

五、从图像 token 到时空 token:视频为什么比”长文本”更痛

真正给 Transformer 让出位置的是另一件事:Rombach et al. 的 Latent Diffusion Model(LDM, CVPR 2022 )把扩散过程从像素空间搬进 VAE 的 latent 空间。一张 \(256 \times 256 \times 3\) 的图像先被预训练 VAE 编码成 \(32 \times 32 \times 4\) 的 latent(空间降采样因子 \(f=8\) ),扩散只在这个小得多的张量上跑。这一步的意义常被低估:它不只是”省显存”,而是把原本上万像素的输入压到了一千多个数,序列长度终于落进了 Transformer 能负担的范围——这正是第二节要说的 patchify 的前提。

DiT(Peebles & Xie, Scalable Diffusion Models with Transformers , ICCV 2023,arXiv:2212.09748)做的事是:在 LDM 框架里,把 U-Net 换成一个几乎标准的 ViT。

六、Sora:公开材料能确认到什么、不能确认到什么

patchify :输入是 VAE 编码后的带噪 latent,形状 \(I \times I \times C\) (256×256 图像对应 \(32\times32\times4\) )。第一层把它切成 patch size \(p\times p\) 的小块,线性投影成 \(d\) 维 token,token 数

论文 Figure 4 把这个关系画得很直接: \(p\) 减半, \(T\) 变成 4 倍,Gflops 至少变成 4 倍。这是后面”scaling 靠什么调”的关键旋钮之一。

落地时建议先做的 5 件事

  1. 用自己的 20 条真实请求测 TTFT / TPOT / 失败原因,不要只看公开榜。
  2. 先写显存和 KV 缓存账,再决定卡数、量化和并发上限。
  3. 网关层把鉴权、配额、审计和模型路由收口,应用里不要各接各的 Key。
  4. 工具调用默认拒绝,按白名单放开,高风险动作必须人审。
  5. 模型升级准备回滚:旧权重、旧 Prompt、旧评测集要能一键切回。

和智能体产品怎么接

对龙虾PRO这类要把 OpenClaw 落到中国业务场景的平台来说,Diffusion + Transformer决定的是延迟能不能进对话、成本能不能规模化、出了问题能不能追溯。技能市场、数字员工和网关都应该吃同一套观测与权限,而不是文章里的概念演示。

效率龙虾 会带着下面这段开聊

按文章《别只背名词:Diffusion + Transformer怎么用到生产》把卡点收成可执行步骤:先做什么、别踩哪条、怎么验证。

用效率龙虾试这篇

本文侧重全链路风控方法论。落地时请用自身业务单据做回放验证,不要把示例阈值直接当生产策略。 相关:风控体检 · 方案资源

常见问题 FAQ

什么是AI智能系统?

「AI智能系统」可概括为:DiT 把扩散模型的去噪网络从 U-Net 换成 Transformer,靠的是把图像压成 latent patch token、用 adaLN-Zero 注入时间步与类别条件。本文用论文原始 Gflops-FID 数据讲清这次替换的收益边界,用 O(n²) 公式解释视频时空 token 为什么比长文本更贵,并交代 U-Net 阵营的真实反驳证据。 本文从定义、方法与实践要点展开说明。

为什么要关注AI智能系统?

关注AI智能系统,是因为它直接影响效率、风险与可复制性。文中指出:上一篇 46|多模态融合 讲的是”把图像塞进语言模型”。DiT(Diffusion Transformer)做的是另一件事:把语言模型最熟悉的模块——Transformer——塞进扩散模型,替掉图像生成里用了近十年的 U-Net。

如何落地AI智能系统?有哪些关键步骤?

建议按以下路径推进AI智能系统:1) 用自己的 20 条真实请求测 TTFT / TPOT / 失败原因,不要只看公开榜。;2) 先写显存和 KV 缓存账,再决定卡数、量化和并发上限。;3) 网关层把鉴权、配额、审计和模型路由收口,应用里不要各接各的 Key。;4) 工具调用默认拒绝,按白名单放开,高风险动作必须人审。;5) 模型升级准备回滚:旧权重、旧 Prompt、旧评测集要能一键切回。。细节见正文对应章节。

AI智能系统适合哪些人或团队?

AI智能系统更适合:产品/技术负责人、运营与增长团队、需要落地智能体或自动化的中小团队、关注「AI智能系统」方向的读者。若你只需要单次聊天式问答,可先读概念;若要上生产,请重点看步骤、权限与风控相关段落。

关于「一、扩散模型留给 backbone 的接口有多窄」,本文给出了什么结论?

在「一、扩散模型留给 backbone 的接口有多窄」部分,要点是:这一个子任务。另一种是把它当成理所当然的架构升级——也不是,U-Net 阵营在 DiT 论文发表半年后就拿出了真实的反例,说明这不是一次单方面碾压,而是一场仍在拉锯的争论。 二、DiT 拆开看:patchify 和四种条件注入方式 DDPM(Ho et al., NeurIPS 2020 )的前向过程给真实样本 (x_0) 逐步加噪: [ q(x_t mid x_0) = mathcal{N}!left(x_t; sq

关于「二、DiT 拆开看:patchify 和四种条件注入方式」,本文给出了什么结论?

在「二、DiT 拆开看:patchify 和四种条件注入方式」部分,要点是:(x_t) 形状相同的噪声预测。这个接口窄得几乎不挑 backbone:只要网络能吃一个张量、吃一个标量/向量条件、吐出同形状张量,CNN、U-Net、Transformer 都能填进去。 早期图像扩散选 U-Net(Ronneberger et al., MICCAI 2015 的分割网络改的),是因为它天然带图像归纳偏置:卷积的局部性、多尺度下采样-上采样带 skip connection,正好匹配图像去噪”既要局部纹理又要全