先给结论:经典机器学习用范数做显式正则,于是有人希望梯度下降的隐式正则也在找最小范数解。过参数线性回归从零出发确实落到最小欧氏解。深度矩阵分解不是这样:存在简单补全任务,隐式过程把所有范数一起推向无穷。行列式符号沿小步近零初始化不变,观测要求和符号冲突时,未观测项只能发散。更像在贪心压秩,而不是压范数。

为什么「再写成某种范数」补不了深度分解

痛点是测试床被选成矩阵补全:看见一部分元素,恢复其余,并假设真矩阵低秩。凸基线是核范数最小化。深度做法是把矩阵写成 L 个因子相乘,对因子做梯度下降,不对乘积矩阵做显式低秩约束。深度二、近零初始化、小学习率时,经验上会给出低秩解,曾被猜想成「其实在做核范数最小化」,并在一些受限情形得到证明。反方向的猜想是:任意范数,都能找到补全任务,让该深度的梯度下降不最小化它。

两边形式陈述因技术细节不必互相矛盾,但代表完全相反的解释。新结果更强:不只是每个范数都能被某个任务打脸,而是存在任务同时打脸所有范数;不只是范数没被最小化,而是范数在涨。关键引理简单:学习率够小、初始化够近原点时,乘积矩阵的行列式不改变符号。合理初始化下符号为正的概率一半,于是全程为正。看任务「对角未观测、反对角为 1、右下为 0」:所有满足观测的矩阵行列式都是 −1。下降若要拟合观测,又不许行列式变号,未观测的那一格只能发散到无穷,所有范数跟着涨。实验上损失下降时,未观测项的绝对值确实在涨。

五步把隐式正则从「某个范数」改成「可观测的秩过程」

  1. 先把线性回归的最小欧氏解单列。那是深度一、无因子分解、从零出发的特例,不能当深度 L≥2 的默认故事。
  2. 用行列式符号当不变量。小步近零时符号冻结。任何要求相反符号的补全,都预测未观测项发散、范数上涨。这是可证伪的:若未观测项收敛到有限值且拟合成功,引理或实现有问题。
  3. 不要用「换一个范数」来挽救。同时打脸所有范数的任务已经存在。继续找「真正被最小化的范数」是在证明一个空集。
  4. 改看秩。上述任务里所有有限解都是秩二,把未观测项送到无穷可以把有效秩压到一。动力学刻画和实验都像贪心的低秩搜索:先用低秩去拟合,再必要时抬秩。同一思想迁到张量补全:对张量因子做梯度下降,终解的张量秩随观测变少而变低,直接参数化(未观测填零)做不到这一点。
  5. 把秩从矩阵迁到网络的输入输出映射。矩阵分解对应线性网络预测矩阵元素;张量分解对应一类非线性网络(卷积算术电路)预测张量元素。两类架构的隐式过程都在压映射的秩。要解释现代网络的泛化,缺的是给常用架构定义可计算的映射秩,而不是再给权重发明一种范数。
故事 适用 失败时 门禁
最小欧氏范数 过参数线性回归、从零出发 深度因子分解 禁止当深度默认
最小核范数 部分深度二的受限情形 符号冲突的补全 不能当一般机制
某个尚未发现的范数 存在任务让一切范数发散 停止寻找
贪心压秩 矩阵 / 张量分解 完整刻画仍缺 用未观测项是否发散来测
映射秩 线性网与算术电路 现代架构尚无定义 优先定义,而不是换范数

现场有三条。其一,符号不变量只在小学习率、近零初始化下证明。大学习率或远离原点的初始化,可以走出该叙事,那正好说明隐式正则依赖轨迹,而不是依赖「模型类的某个范数」。其二,压秩可以牺牲范数。未观测项发散在任何范数下都难看,却把有效秩压下去。用验证集上的核范数当隐式正则的探针,会把成功的压秩判成失败。其三,张量实验的对照必须是「直接参数化未观测为零」,而不是另一个范数程序。后者本来就会压范数,比的是另一套算法,不是同一参数化下的隐式过程。

若隐式正则是压秩,工程上可以主动把架构写成因子图或算术电路,让秩有定义、可监测。只在权重上加 ℓ₂,是在用显式范数覆盖一个可能相反的隐式过程。

若只能改解释一处:停止把「深度网络在找最小范数解」写进综述。至少加上行列式符号冲突实验:未观测项若发散,范数故事已经破产,改报秩。

结论:隐式过程可以让范数爆炸,同时把秩压下去

线性回归的最小欧氏解不能外推到深度分解。符号冻结让部分补全只能靠未观测项发散来拟合,所有范数上涨。矩阵和张量上都更像贪心压秩。仍用范数讲隐式正则,是在用深度一的特例覆盖深度二以上的反例。

你下次说模型在隐式正则,先指出被压的是哪个秩、范数是在涨还是在跌。范数在涨还讲最小范数,机制就不能写进论文。

效率龙虾 会带着下面这段开聊

按文章《隐式正则不是在最小化范数:矩阵分解会把所有范数推向无穷》把卡点收成可执行步骤:先做什么、别踩哪条、怎么验证。

用效率龙虾试这篇

本文侧重全链路风控方法论。落地时请用自身业务单据做回放验证,不要把示例阈值直接当生产策略。 相关:风控体检 · 方案资源

常见问题 FAQ

什么是AI智能系统?

「AI智能系统」可概括为:过参数线性回归从零出发会落到最小欧氏解,深度矩阵分解不会。行列式符号沿梯度下降不变,观测对不上就让未观测项发散,所有范数一起涨。 本文从定义、方法与实践要点展开说明。

为什么要关注AI智能系统?

关注AI智能系统,是因为它直接影响效率、风险与可复制性。文中指出:痛点是测试床被选成矩阵补全:看见一部分元素,恢复其余,并假设真矩阵低秩。凸基线是核范数最小化。深度做法是把矩阵写成 L 个因子相乘,对因子做梯度下降,不对乘积矩阵做显式低秩约束。深度二、近零初始化、小学习率时,经验上会给出低秩解,曾被猜想成「其实在做核范数最小化」,并在一些受限情形得到证明。反方向的猜想是:任意范数,都能找到补全任务,让该深度的梯度下降不最小化它。

如何落地AI智能系统?有哪些关键步骤?

建议按以下路径推进AI智能系统:1) 先把线性回归的最小欧氏解单列。那是深度一、无因子分解、从零出发的特例,不能当深度 L≥2 的默认故事。;2) 用行列式符号当不变量。小步近零时符号冻结。任何要求相反符号的补全,都预测未观测项发散、范数上涨。这是可证伪的:若未观测项收敛到有限值且拟合成功,引理或实现有问…;3) 不要用「换一个范数」来挽救。同时打脸所有范数的任务已经存在。继续找「真正被最小化的范数」是在证明一个空集。;4) 改看秩。上述任务里所有有限解都是秩二,把未观测项送到无穷可以把有效秩压到一。动力学刻画和实验都像贪心的低秩搜索:先用低秩去拟合,再必要时抬秩。同一思想迁到张量…;5) 把秩从矩阵迁到网络的输入输出映射。矩阵分…

AI智能系统适合哪些人或团队?

AI智能系统更适合:产品/技术负责人、运营与增长团队、需要落地智能体或自动化的中小团队、关注「AI智能系统」方向的读者。若你只需要单次聊天式问答,可先读概念;若要上生产,请重点看步骤、权限与风控相关段落。

关于「为什么「再写成某种范数」补不了深度分解」,本文给出了什么结论?

在「为什么「再写成某种范数」补不了深度分解」部分,要点是:号。合理初始化下符号为正的概率一半,于是全程为正。看任务「对角未观测、反对角为 1、右下为 0」:所有满足观测的矩阵行列式都是 −1。下降若要拟合观测,又不许行列式变号,未观测的那一格只能发散到无穷,所有范数跟着涨。实验上损失下降时,未观测项的绝对值确实在涨。 五步把隐式正则从「某个范数」改成「可观测的秩过程」 先把线性回归的最小欧氏解单列。那是深度一、无因子分解、从零出发的特例,不能当深度 L≥2 的默认故事。 用行列式符号当不变量。

关于「五步把隐式正则从「某个范数」改成「可观测的秩过程」」,本文给出了什么结论?

「五步把隐式正则从「某个范数」改成「可观测的秩过程」」是理解全文的关键切片:建议先读该节的结论句与列表项,再对照前后章节形成闭环。