范叶亮写智能体、模型和数据系统时,习惯先把定义和边界钉死。把「卷积神经网络」整理成可落地的中文笔记:问题在哪、默认做法会踩什么坑、该怎么选。原站导航和广告已去掉。

发展史

卷积神经网络 (Convolutional Neural Network, CNN) 是一种目前广泛用于图像,自然语言处理等领域的深度神经网络模型。1998 年,Lecun 等人 1 提出了一种基于梯度的反向传播算法用于文档的识别。在这个神经网络中,卷积层 (Convolutional Layer) 扮演着至关重要的角色。

随着运算能力的不断增强,一些大型的 CNN 网络开始在图像领域中展现出巨大的优势,2012 年,Krizhevsky 等人 2 提出了 AlexNet 网络结构,并在 ImageNet 图像分类竞赛 3 中以超过之前 11% 的优势取得了冠军。随后不同的学者提出了一系列的网络结构并不断刷新 ImageNet 的成绩,其中比较经典的网络包括:VGG (Visual Geometry Group) 4 ,GoogLeNet 5 和 ResNet 6 。

模型原理

CNN 在图像分类问题上取得了不凡的成绩,同时一些学者也尝试将其应用在图像的其他领域,例如:物体检测 7 8 9 ,语义分割 10 ,图像摘要 11 ,行为识别 12 等。除此之外,在非图像领域 CNN 也取得了一定的成绩 13 。

LeNet-5 解决的手写数字分类问题的输入为一张 32×32 像素的灰度图像 (Gray Scale)。日常生活中计算机常用的图像的表示方式为 RGB,即将一张图片分为红色通道 (Red Channel),绿色通道 (Green Channel) 和蓝色通道 (Blue Channel),其中每个通道的每个像素点的数值范围为 $\left[0, 255\right]$ 。灰度图像表示该图片仅包含一个通道,也就是不具备彩色信息,每个像素点的数值范围同 RGB 图像的取值范围相同。

输入层

因此,一张图片在计算机的眼里就是一个如下图所示的数字矩阵 (示例图片来自于 MNIST 数据集 14 ):

在将图像输入到 CNN 网络之前,通常我们会对其进行预处理,因为每个像素点的最大取值为 $255$ ,因此将每个像素点的值除以 $255$ 则可以将其归一化到 $\left[0, 1\right]$ 的范围。

卷积层

在了解卷积层之前,让我们先来了解一下什么是卷积?设 $f\left(x\right), g\left(x\right)$ 是 $\mathbb{R}$ 上的两个可积函数,则卷积定义为:

$$ \left(f * g\right) \left(x\right) = \int_{- \infty}^{\infty}{f \left(\tau\right) g \left(x – \tau\right) d \tau} $$

非线性层

$$ \left(f * g\right) \left(x\right) = \sum_{\tau = – \infty}^{\infty}{f \left(\tau\right) g \left(x – \tau\right)} $$

我们用一个示例来形象的理解一下卷积的含义,以离散的形式为例,假设我们有两个骰子, $f\left(x\right), g\left(x\right)$ 分别表示投两个骰子, $x$ 面朝上的概率。

池化层

$$ f \left(x\right) = g \left(x\right) = \begin{cases} 1/6 & x = 1, 2, 3, 4, 5, 6 \\ 0 & \text{otherwise} \end{cases} $$

卷积 $\left(f * g\right) \left(x\right)$ 表示投两个骰子,朝上数字之和为 $x$ 的概率。则和为 $4$ 的概率为:

值得单独记下的点

  • 网络包含了 5 个卷积层和 3 个全连接层,网络规模变大。
  • 应用了 Data Augmentation,Dropout,Momentum,Weight Decay 等策略改进训练。
  • 在算力有限的情况下,对模型进行划分为两部分并行计算。
  • 增加局部响应归一化 (LRN, Local Response Normalization)。
  • tensorflow/models , tflearn/examples
  • pytorch/torchvision/models
  • incubator-mxnet/example
  • 网络层级更深,从 AlexNet 的 8 层增加至 16 层和 19 层,更深的网络层级意味着更强的学习能力,但也需要更多的算力对模型进行优化。

落地时建议先做的 5 件事

  1. 先写清任务能不能被自动验证:能验证的交给系统和评测,不能验证的留给人审。
  2. 本地部署先算显存、延迟和失败回滚,不要只看能跑通一次。
  3. 多智能体只在单智能体触到上下文或专业边界时再拆。
  4. Token、微调和压缩都要有对照数字,避免口号式优化。
  5. 结论写成可检查清单:接口、超时、评测集、回滚版本。

和智能体产品怎么接

龙虾PRO做 OpenClaw 落地时,最该拿走的是「单智能体先做好工具和提示,再谈编排」。数字员工、技能市场和网关应共用同一套评测与权限,而不是各写一套角色人设。

本文侧重全链路风控方法论。落地时请用自身业务单据做回放验证,不要把示例阈值直接当生产策略。 相关:风控体检 · 方案资源

常见问题 FAQ

什么是AI智能系统?

「AI智能系统」可概括为:卷积神经网络 (Convolutional Neural Network, CNN) 是一种目前广泛用于图像,自然语言处理等领域的深度神经网络模型。1998 年,Lecun 等人 1 提出了一种基于梯度的反向传播算法用于文档的识别。在这个神经网络中,卷积层 (Convolutional Layer) 扮演着至关重要的角色。 本文从定义、方法与实践要点展开说明。

为什么要关注AI智能系统?

关注AI智能系统,是因为它直接影响效率、风险与可复制性。文中指出:卷积神经网络 (Convolutional Neural Network, CNN) 是一种目前广泛用于图像,自然语言处理等领域的深度神经网络模型。1998 年,Lecun 等人 1 提出了一种基于梯度的反向传播算法用于文档的识别。在这个神经网络中,卷积层 (Convolutional Layer) 扮演着至关重要的角色。

如何落地AI智能系统?有哪些关键步骤?

建议按以下路径推进AI智能系统:1) 网络包含了 5 个卷积层和 3 个全连接层,网络规模变大。;2) 应用了 Data Augmentation,Dropout,Momentum,Weight Decay 等策略改进训练。;3) 在算力有限的情况下,对模型进行划分为两部分并行计算。;4) 增加局部响应归一化 (LRN, Local Response Normalization)。;5) tensorflow/models , tflearn/examples。细节见正文对应章节。

AI智能系统适合哪些人或团队?

AI智能系统更适合:产品/技术负责人、运营与增长团队、需要落地智能体或自动化的中小团队、关注「AI智能系统」方向的读者。若你只需要单次聊天式问答,可先读概念;若要上生产,请重点看步骤、权限与风控相关段落。

关于「发展史」,本文给出了什么结论?

在「发展史」部分,要点是:。 随着运算能力的不断增强,一些大型的 CNN 网络开始在图像领域中展现出巨大的优势,2012 年,Krizhevsky 等人 2 提出了 AlexNet 网络结构,并在 ImageNet 图像分类竞赛 3 中以超过之前 11% 的优势取得了冠军。随后不同的学者提出了一系列的网络结构并不断刷新 ImageNet 的成绩,其中比较经典的网络包括:VGG (Visual Geometry Group) 4 ,GoogLeNet 5 和 Re

关于「模型原理」,本文给出了什么结论?

在「模型原理」部分,要点是:, g\left(x\right)$ 是 $\mathbb{R}$ 上的两个可积函数,则卷积定义为: $$ \left(f * g\right) \left(x\right) = \int_{- \infty}^{\infty}{f \left(\tau\right) g \left(x – \tau\right) d \tau} $$ 非线性层 $$ \left(f * g\right) \left(x\right) = \sum_{