把大模型从演示变成能值班的系统时,多模态融合几乎总会先露出工程缺口。下面按可执行的顺序来拆:先讲它解决什么、卡在哪,再讲选型时看哪些数字,最后落到智能体和网关该怎么接。本文面向要上线的工程师,不写空泛趋势。

一、CLIP:对比学习到底在优化什么

45|ViT 说明图像可以被切成 patch token。下一步的问题是:图像 token 和文本 token 放进同一个系统里之后,谁对齐谁、怎么对齐、代价是什么?

“多模态”这个词经常被简化成”给图片配一句 caption 再喂给语言模型”。这个简化会漏掉三件真正决定模型能力和失败模式的事:CLIP 的对比学习为什么依赖 batch 大小和温度、视觉信息接入语言模型的三种主流方式各自在哪里出问题、以及”分割”和”聊天”为什么至今是两条没有合并的产品线。本文只讲透 CLIP、Flamingo、LLaVA、SAM 这四条代表线,不逐年追每次刷榜的多模态 SOTA。

二、三种接法,三种失败模式:projector、cross-attention、指令微调

CLIP(Radford et al., ICML 2021 )训练两个独立 encoder:图像 encoder \(f_I\) 和文本 encoder \(f_T\) 。对一个 batch 里的 \(N\) 个图文对 \((I_i, T_i)\) ,先各自归一化成单位向量:

\[u_i = \frac{f_I(I_i)}{\|f_I(I_i)\|}, \qquad v_i = \frac{f_T(T_i)}{\|f_T(T_i)\|}\]

三、SAM:promptable segmentation 为什么不是聊天 VLM 的另一版本

再算出一个 \(N \times N\) 的相似度矩阵 \(S_{ij} = u_i \cdot v_j\) 。训练目标不是”生成 caption”,而是让对角线上的正确配对 \(S_{ii}\) 在这一整行、这一整列里都是最大值。损失是双向的 InfoNCE:

\[\mathcal{L} = \frac{1}{2N}\sum_{i=1}^{N}\left[-\log\frac{\exp(S_{ii}/\tau)}{\sum_{j=1}^{N}\exp(S_{ij}/\tau)} \;-\; \log\frac{\exp(S_{ii}/\tau)}{\sum_{j=1}^{N}\exp(S_{ji}/\tau)}\right]\]

四、融合时机决定部署成本:early / late / hybrid fusion

前一项是”给定图像找文本”(image-to-text),后一项是”给定文本找图像”(text-to-image)。两个方向都算,是因为图像 encoder 和文本 encoder 是独立训练的两套参数,只优化一个方向会让另一个方向的检索质量掉下去。

温度 \(\tau\) 不是可以随手设的超参。 CLIP 把 \(1/\tau\) (论文里叫 logit scale)设成一个可学习的标量,训练中不断更新,并裁剪上限使其不超过 100(即 \(\tau\) 不小于 0.01),避免训练早期梯度爆炸。从损失形式上可以直接看出温度的作用: \(\tau\) 越小,softmax 越尖锐,梯度集中在少数”最容易混淆的负样本”上,模型被迫把最像的负例推得更远; \(\tau\) 越大,损失对所有负样本一视同仁,训练更稳但区分度更弱。这是从上面 softmax 公式直接推出的性质,不依赖额外实验。

五、争论:统一 token 接口是否掩盖模态特有噪声

batch 大小决定负样本数量,而负样本数量决定这套方法能不能学到细粒度区分。 对每个正样本 \((I_i, T_i)\) ,batch 内剩下的 \(N-1\) 个都是负样本。CLIP 用的 batch size 是 32768,相当于每一步给每个正样本配了 32767 个负样本去对比——这个规模的负样本池,才能让模型在”金毛”和”拉布拉多”这种细分类别之间学出区分,而不只是学会”狗”和”车”的粗糙区分。这也是对比学习(contrastive learning)从 SimCLR、MoCo 一路延续下来的共同结论:负样本越多、越难,学到的表示越精细。

但大 batch 负样本会引入图文错配(false negative)。 如果一个 batch 里恰好有两张不同的金毛犬照片 \(I_i\) 和 \(I_j\) ,它们的文本描述 \(T_i\) 、 \(T_j\) 可能都是”a golden retriever running on grass”这类高度相似的句子。损失函数会强行把 \(I_i\) 和 \(T_j\) (本来语义上也匹配)当作负样本推远,因为 InfoNCE 假设 batch 内除对角线外都是负样本,不检查语义重叠。这不是实现 bug,而是 batch 内负样本采样这个方法本身自带的系统性噪声:batch 越大,越容易采到这种”看起来是负样本、语义上其实是正样本”的组合。

六、开放问题:评测与幻觉

这个问题促成了后续工作的分叉。SigLIP(Zhai et al., ICCV 2023 )把 softmax 换成 sigmoid:每个 \((I_i, T_j)\) 对被当成独立的二分类问题(是/不是一对),不再要求”batch 内所有其他样本都必须被推远”这种全局归一化约束。这样做的直接后果是损失不再依赖整个 batch 的归一化项,训练对 batch size 的敏感度显著降低,小 batch 也能训得动——这是对 CLIP 大 batch依赖的直接工程反驳,而不是另一种无关的改进。

零样本分类的机制也值得说清楚:CLIP 并不”知道”标签叫什么,而是把类别名套进模板(例如”a photo of a {label}“)变成文本,算出文本向量后和图像向量比 cosine 相似度,取最大值。这意味着零样本效果对模板措辞敏感——本质原因是训练数据的文本分布是网页 alt text 和 caption 风格的短句,如果目标任务的文本形式(比如纯类别词、专业术语缩写)离这个分布太远,模型看到的”文本”就和训练时见过的分布不匹配,需要靠 prompt engineering 把查询文本拉回训练分布附近。

落地时建议先做的 5 件事

  1. 用自己的 20 条真实请求测 TTFT / TPOT / 失败原因,不要只看公开榜。
  2. 先写显存和 KV 缓存账,再决定卡数、量化和并发上限。
  3. 网关层把鉴权、配额、审计和模型路由收口,应用里不要各接各的 Key。
  4. 工具调用默认拒绝,按白名单放开,高风险动作必须人审。
  5. 模型升级准备回滚:旧权重、旧 Prompt、旧评测集要能一键切回。

和智能体产品怎么接

对龙虾PRO这类要把 OpenClaw 落到中国业务场景的平台来说,多模态融合决定的是延迟能不能进对话、成本能不能规模化、出了问题能不能追溯。技能市场、数字员工和网关都应该吃同一套观测与权限,而不是文章里的概念演示。

效率龙虾 会带着下面这段开聊

按文章《别只背名词:多模态融合怎么用到生产》把卡点收成可执行步骤:先做什么、别踩哪条、怎么验证。

用效率龙虾试这篇

本文侧重全链路风控方法论。落地时请用自身业务单据做回放验证,不要把示例阈值直接当生产策略。 相关:风控体检 · 方案资源

常见问题 FAQ

什么是AI智能系统?

「AI智能系统」可概括为:CLIP 靠 batch 负样本和温度做对比学习,不是拼 caption;projector、Flamingo cross-attention、LLaVA 指令微调三种接法各有幻觉、OCR、分辨率失败模式;SAM 的 promptable segmentation 与聊天 VLM 是两条产品线。 本文从定义、方法与实践要点展开说明。

为什么要关注AI智能系统?

关注AI智能系统,是因为它直接影响效率、风险与可复制性。文中指出:45|ViT 说明图像可以被切成 patch token。下一步的问题是:图像 token 和文本 token 放进同一个系统里之后,谁对齐谁、怎么对齐、代价是什么?

如何落地AI智能系统?有哪些关键步骤?

建议按以下路径推进AI智能系统:1) 用自己的 20 条真实请求测 TTFT / TPOT / 失败原因,不要只看公开榜。;2) 先写显存和 KV 缓存账,再决定卡数、量化和并发上限。;3) 网关层把鉴权、配额、审计和模型路由收口,应用里不要各接各的 Key。;4) 工具调用默认拒绝,按白名单放开,高风险动作必须人审。;5) 模型升级准备回滚:旧权重、旧 Prompt、旧评测集要能一键切回。。细节见正文对应章节。

AI智能系统适合哪些人或团队?

AI智能系统更适合:产品/技术负责人、运营与增长团队、需要落地智能体或自动化的中小团队、关注「AI智能系统」方向的读者。若你只需要单次聊天式问答,可先读概念;若要上生产,请重点看步骤、权限与风控相关段落。

关于「一、CLIP:对比学习到底在优化什么」,本文给出了什么结论?

在「一、CLIP:对比学习到底在优化什么」部分,要点是:分割”和”聊天”为什么至今是两条没有合并的产品线。本文只讲透 CLIP、Flamingo、LLaVA、SAM 这四条代表线,不逐年追每次刷榜的多模态 SOTA。 二、三种接法,三种失败模式:projector、cross-attention、指令微调 CLIP(Radford et al., ICML 2021 )训练两个独立 encoder:图像 encoder (f_I) 和文本 encoder (f_T) 。对一个 bat

关于「二、三种接法,三种失败模式:projector、cross-attention、指令微调」,本文给出了什么结论?

在「二、三种接法,三种失败模式:projector、cross-attention、指令微调」部分,要点是:图像找文本”(image-to-text),后一项是”给定文本找图像”(text-to-image)。两个方向都算,是因为图像 encoder 和文本 encoder 是独立训练的两套参数,只优化一个方向会让另一个方向的检索质量掉下去。 温度 (tau) 不是可以随手设的超参。 CLIP 把 (1/tau) (论文里叫 logit scale)设成一个可学习的标量,训练中不断更新,并裁剪上限使其不超过 100(即 (ta