范叶亮写智能体、模型和数据系统时,习惯先把定义和边界钉死。把「模型压缩和推理加速」整理成可落地的中文笔记:问题在哪、默认做法会踩什么坑、该怎么选。原站导航和广告已去掉。

模型压缩

随着深度神经网络模型的复杂度越来越高,除了训练阶段需要大量算力外,模型推理阶段也较多的资源。在深度学习落地应用中,受部署环境的影响,尤其是在边缘计算场景中,有限的计算资源成为了复杂模型的应用壁垒。

针对上述三类问题,可以从 模型压缩 和 推理加速 两个角度出发,在保持一定模型精度的情况下,让模型速度更快、体积更小、能耗更低。

剪裁

剪裁 ( Pruning )的核心思想是在尽量保持模型精度不受影响的前提下减少网络的参数量,例如减少网络中连接或神经元的数量,如下图所示:

非结构化剪裁 是细粒度的剪裁方法,一般通过设定一个阈值,高于该阈值的权重得以保留,低于该阈值的权重则被去除。非结构化剪裁虽然方法简单、模型压缩比高,但也存在诸多问题。例如:全局阈值设定未考虑不同层级的差异性,剪裁信息过多有损模型精度且无法还原,剪裁后的稀疏权重矩阵需要硬件层支持方可实现压缩和加速的效果等。

量化

结构化剪裁 是粗粒度的剪裁方法,例如对网络层、通道、滤波器等进行剪裁。在滤波器剪裁中,通过评估每个滤波器的重要性(例如:Lp 范数)确定是否保留。结构化剪裁算法相对复杂、控制精度较低,但剪裁策略更为有效且不需要硬件层的支持,可以在现有深度学习框架上直接应用。

神经网络中的计算通常采用浮点数(FP32)进行计算, 量化 ( Quantization )的基本思想是将浮点计算替换为更低比特(例如:FP16,INT8 等)的计算,从而降低模型体积加快模型推理速度。

神经结构搜索

$$ \begin{aligned} r &= S \left(q – Z\right) \\ q &= round \left(\dfrac{r}{S} + Z\right) \end{aligned} $$

其中, $r, q$ 分别表示量化前和量化后的值, $S, Z$ 为量化系数。一般化的非对称映射如下图所示:

知识蒸馏

$$ \begin{aligned} S &= \dfrac{r_{max} – r_{min}}{q_{max} – q_{min}} \\ Z &= q_{min} – \dfrac{r_{min}}{S} \end{aligned} $$

非线性映射 考虑了数据本身的分布情况。以分位量化方法为例,其基本思想是通过分位点对数据进行划分,使得各个区间之间的数据量相等,然后将同一个区间的数据映射为相同值,从而实现量化。

参考

量化粒度 是指控制多少个待量化的参数共享一组量化系数,通常粒度越大,精度损失越大。以 Transformer 模型为例,不同粒度的量化方式如下图所示:

神经结构搜索 ( Network Architecture Search,NAS )旨在以一种自动化的方式,解决高难度的复杂神经网络设计问题。根据预先定义的搜索空间,神经结构搜索算法在一个庞大的神经网络集合中评估结构性能并寻找到表现最佳的网络结构。整个架构如下图所示:

值得单独记下的点

  • 速度 :实时响应效率的要求,过长的响应耗时会严重影响用户体验。
  • 存储 :有限的内存空间要求,无法加载超大模型的权重从而无法使用模型。
  • 能耗 :移动场景的续航要求,大量的浮点计算导致移动设备耗电过快。
  • 训练 :在整个剪裁过程中,该步骤主要为预训练过程,同时为后续的剪裁工作做准备。
  • 修剪 :通过具体的方法对网络进行剪裁,并对网络重新进行评估以确定是否符合要求。
  • 微调 :通过微调恢复由于剪裁对模型带来的性能损耗。
  • 定点近似 :通过缩小浮点数表示中指数部分和小数部分的位宽实现。映射过程不需要额外的参数,实现相对简单,但针对较大数值的精度损失较大。
  • 范围近似 :通过统计分析,经过缩放和平移映射浮点数。映射过程需要存储额外的参数,计算时需要先反量化,计算相对复杂,但精度更高。

落地时建议先做的 5 件事

  1. 先写清任务能不能被自动验证:能验证的交给系统和评测,不能验证的留给人审。
  2. 本地部署先算显存、延迟和失败回滚,不要只看能跑通一次。
  3. 多智能体只在单智能体触到上下文或专业边界时再拆。
  4. Token、微调和压缩都要有对照数字,避免口号式优化。
  5. 结论写成可检查清单:接口、超时、评测集、回滚版本。

和智能体产品怎么接

龙虾PRO做 OpenClaw 落地时,最该拿走的是「单智能体先做好工具和提示,再谈编排」。数字员工、技能市场和网关应共用同一套评测与权限,而不是各写一套角色人设。

本文侧重全链路风控方法论。落地时请用自身业务单据做回放验证,不要把示例阈值直接当生产策略。 相关:风控体检 · 方案资源

常见问题 FAQ

什么是AI智能系统?

「AI智能系统」可概括为:随着深度神经网络模型的复杂度越来越高,除了训练阶段需要大量算力外,模型推理阶段也较多的资源。在深度学习落地应用中,受部署环境的影响,尤其是在边缘计算场景中,有限的计算资源成为了复杂模型的应用壁垒。 本文从定义、方法与实践要点展开说明。

为什么要关注AI智能系统?

关注AI智能系统,是因为它直接影响效率、风险与可复制性。文中指出:随着深度神经网络模型的复杂度越来越高,除了训练阶段需要大量算力外,模型推理阶段也较多的资源。在深度学习落地应用中,受部署环境的影响,尤其是在边缘计算场景中,有限的计算资源成为了复杂模型的应用壁垒。

如何落地AI智能系统?有哪些关键步骤?

建议按以下路径推进AI智能系统:1) 速度 :实时响应效率的要求,过长的响应耗时会严重影响用户体验。;2) 存储 :有限的内存空间要求,无法加载超大模型的权重从而无法使用模型。;3) 能耗 :移动场景的续航要求,大量的浮点计算导致移动设备耗电过快。;4) 训练 :在整个剪裁过程中,该步骤主要为预训练过程,同时为后续的剪裁工作做准备。;5) 修剪 :通过具体的方法对网络进行剪裁,并对网络重新进行评估以确定是否符合要求。。细节见正文对应章节。

AI智能系统适合哪些人或团队?

AI智能系统更适合:产品/技术负责人、运营与增长团队、需要落地智能体或自动化的中小团队、关注「AI智能系统」方向的读者。若你只需要单次聊天式问答,可先读概念;若要上生产,请重点看步骤、权限与风控相关段落。

关于「模型压缩」,本文给出了什么结论?

在「模型压缩」部分,要点是:络模型的复杂度越来越高,除了训练阶段需要大量算力外,模型推理阶段也较多的资源。在深度学习落地应用中,受部署环境的影响,尤其是在边缘计算场景中,有限的计算资源成为了复杂模型的应用壁垒。 针对上述三类问题,可以从 模型压缩 和 推理加速 两个角度出发,在保持一定模型精度的情况下,让模型速度更快、体积更小、能耗更低。 剪裁 剪裁 ( Pruning )的核心思想是在尽量保持模型精度不受影响的前提下减少网络的参数量,例如减少网络中连接或神经元的

关于「剪裁」,本文给出了什么结论?

在「剪裁」部分,要点是:\left(q – Z\right) \\ q &= round \left(\dfrac{r}{S} + Z\right) \end{aligned} $$ 其中, $r, q$ 分别表示量化前和量化后的值, $S, Z$ 为量化系数。一般化的非对称映射如下图所示: 知识蒸馏 $$ \begin{aligned} S &= \dfrac{r_{max} – r_{min}}{q_{max} – q_{min}} \\ Z &= q_