先给结论:神经切线核把够宽的网络看成参数处的线性化,小步长下能证明训到零训练损失、泛化像无限宽核机器。实际训练不在这个球里:大学习率下线性化轨迹会偏,无限宽核在标准分类上也略弱于完整训练。要走出线性区,给权重增量乘随机符号,一次项期望被杀掉,二次项留下。低秩多项式上,样本复杂度能从维数的高次降一阶,三层分层还能再省到平方根。
为什么「再加宽一点」补不了切线核的样本账
痛点是切线核把成功归因于「宽到几乎不动参数、只动一阶」。一阶模型是随机特征的核机器,能插值任意有限、非退化训练集,测试误差却跟着真函数在该核再生核空间里的范数走。单个整流单元这种不光滑却简单的函数,范数可以随特征维数指数涨,理论样本上界会差到不能用;实践里网络用不了那么多样本就能学。无限宽核在标准图像分类上已经略弱,有限宽再加大学习率,线性化更跟不上完整训练的轨迹。泰勒图上,二次项对轨迹的贴合明显好于纯一次。
按泰勒习惯,一次项量级大于二次项,似乎永远轮不到二次。关键是随机化耦合:每个神经元的可训练增量乘上独立的正负号,号的期望为零、平方恒一。一次项含号,期望被杀掉;二次项含号的平方,原样留下。每步重新抽号,一次项围着零抖,拟合数据的主力变成二次。这和训练时随机丢节点不同:丢的是增量,不是整份权重。景观因此非凸,但在二次近似加正则下,带噪声的随机梯度等能逃鞍点的算法,仍能多项式时间找到全局最小。
五步把「超出切线核」写成可核对的样本账
- 先画清工作区。切线核球:网络约等于一次项。二次区:一次加二次,但宽度一大一次项会爆。随机符号把一次项的期望打掉,二次区才站得住。实验对比必须标明学习率和是否线性化,混在一起没有意义。
- 任务写成低秩多项式:输出只依赖输入在少数方向上的幂。秩和次数都是常数时,才谈得上「简单函数、高维输入」。切线核及任何内积核,在球面上学次数 p 的多项式,样本是维数的 p 次,上下界匹配。
- 二次泰勒或带随机符号的两层网,在略各向同性的输入上,样本是维数的 p−1 次乘上秩和次数的多项式。泛化不再只看特征的欧氏范,而看输入二阶矩的算子范数乘权重外积的核范数。输入略各向同性时算子范数有 1/√d 的便宜,正好省下一阶维数。
- 分层再省。把二次模型接到一个固定的宽表示 h(x)∈R^D 上,D 远大于输入维。表示要够富、也够各向同性。学次数 p 时取 D 为维数的 p/2 次,样本降到大约 D,也就是维数的平方根次。这是在把「省一阶维数」用到更宽的特征上,不是再加一层装饰。
- 优化门禁:每步新抽符号,目标是符号期望损失加正则。只会在固定符号下做全批量梯度,一次项会回来主导。逃鞍点是必需品,因为景观已经非凸。
| 模型 | 工作区 | 学低秩 p 次的样本 | 门禁 |
|---|---|---|---|
| 切线核 / 一次线性化 | 小步、极宽 | 维数的 p 次 | 大学习率下禁止当近似 |
| 完整训练的有限宽网 | 实际超参 | 经验上更省 | 不要用核上界代替 |
| 随机符号 + 二次项 | 一次项期望为零 | 维数的 p−1 次 | 每步重抽符号 |
| 三层分层二次 | 固定宽表示 + 可训二次 | 约维数的 p/2 次 | 表示必须够各向同性 |
| 平均场 / 切线层级 | 另一套超出一次的理论 | 各有角度 | 常缺多项式时间保证 |
现场有三条。其一,切线核不是错,是工作区太窄。小学习率、极宽、几乎不动特征时,它仍然是对的证明工具。把它写成「深度学习成功的原因」,等于把实际用的大学习率和特征学习排除在外。其二,随机符号是分析装置,也可以当实验接口:冻结一次、释放二次,看轨迹是否贴近完整训练。三次及以上同理,只是优化保证更难。其三,样本账的改进来自范数分解,不是魔术。各向同性一旦被破坏,算子范数的便宜消失,二次模型不必再优于核。分层表示若本身高度相关,D 再大也省不下来。
超出切线核的路线不只这一条。切线层级和平均场各有优点,但往往不给多项式时间。泰勒化的好处是:景观非凸但良性、泛化可证优于核、能写分层、还有现成的实验接口。现在缺的是把二次区从多项式教师扩到现代架构的特征学习,而不是再把宽度加到切线核球里。
若只能改理论对照一处:禁止只用切线核上界给某任务判死刑。至少并列二次模型或完整训练的样本曲线。核上界差、网络不难学,说明工作区已经不在一次项。
结论:一次线性化是核机器,二次加随机符号才开始像网络
切线核解释极宽小步。实际训练走出该球。随机符号杀掉一次项,二次项用更省的样本学低秩多项式,分层还能再省。仍把成功写成无限宽核,是在用错误工作区的上界描述真实算法。
你下次说某函数网络学不会,先报这是切线核上界还是二次区上界。只有核上界,学不会就不能写进结论。
本文侧重全链路风控方法论。落地时请用自身业务单据做回放验证,不要把示例阈值直接当生产策略。 相关:风控体检 · 方案资源
常见问题 FAQ
什么是AI智能系统?
「AI智能系统」可概括为:够宽时网络像核机器,但大学习率下线性化跟不上轨迹。给权重增量随机符号可杀掉一次项、留下二次项,低秩多项式的样本复杂度能降一阶。 本文从定义、方法与实践要点展开说明。
为什么要关注AI智能系统?
关注AI智能系统,是因为它直接影响效率、风险与可复制性。文中指出:痛点是切线核把成功归因于「宽到几乎不动参数、只动一阶」。一阶模型是随机特征的核机器,能插值任意有限、非退化训练集,测试误差却跟着真函数在该核再生核空间里的范数走。单个整流单元这种不光滑却简单的函数,范数可以随特征维数指数涨,理论样本上界会差到不能用;实践里网络用不了那么多样本就能学。无限宽核在标准图像分类上已经略弱,有限宽再加大学习率,线性化更跟不上完整训练的轨迹。泰勒图上,二次项对轨迹的贴合明显好于纯一次。
如何落地AI智能系统?有哪些关键步骤?
建议按以下路径推进AI智能系统:1) 先画清工作区。切线核球:网络约等于一次项。二次区:一次加二次,但宽度一大一次项会爆。随机符号把一次项的期望打掉,二次区才站得住。实验对比必须标明学习率和是否线…;2) 任务写成低秩多项式:输出只依赖输入在少数方向上的幂。秩和次数都是常数时,才谈得上「简单函数、高维输入」。切线核及任何内积核,在球面上学次数 p 的多项式,样本…;3) 二次泰勒或带随机符号的两层网,在略各向同性的输入上,样本是维数的 p−1 次乘上秩和次数的多项式。泛化不再只看特征的欧氏范,而看输入二阶矩的算子范数乘权重外积…;4) 分层再省。把二次模型接到一个固定的宽表示 h(x)∈R^D 上,D 远大于输入维。表示要够富、也…
AI智能系统适合哪些人或团队?
AI智能系统更适合:产品/技术负责人、运营与增长团队、需要落地智能体或自动化的中小团队、关注「AI智能系统」方向的读者。若你只需要单次聊天式问答,可先读概念;若要上生产,请重点看步骤、权限与风控相关段落。
关于「为什么「再加宽一点」补不了切线核的样本账」,本文给出了什么结论?
在「为什么「再加宽一点」补不了切线核的样本账」部分,要点是:二次。这和训练时随机丢节点不同:丢的是增量,不是整份权重。景观因此非凸,但在二次近似加正则下,带噪声的随机梯度等能逃鞍点的算法,仍能多项式时间找到全局最小。 五步把「超出切线核」写成可核对的样本账 先画清工作区。切线核球:网络约等于一次项。二次区:一次加二次,但宽度一大一次项会爆。随机符号把一次项的期望打掉,二次区才站得住。实验对比必须标明学习率和是否线性化,混在一起没有意义。 任务写成低秩多项式:输出只依赖输入在少数方向上的幂。秩和次
关于「五步把「超出切线核」写成可核对的样本账」,本文给出了什么结论?
在「五步把「超出切线核」写成可核对的样本账」部分,要点是:层还能再省。仍把成功写成无限宽核,是在用错误工作区的上界描述真实算法。 你下次说某函数网络学不会,先报这是切线核上界还是二次区上界。只有核上界,学不会就不能写进结论。