先给结论:经典机器学习用范数做显式正则,于是有人希望梯度下降的隐式正则也在找最小范数解。过参数线性回归从零出发确实落到最小欧氏解。深度矩阵分解不是这样:存在简单补全任务,隐式过程把所有范数一起推向无穷。行列式符号沿小步近零初始化不变,观测要求和符号冲突时,未观测项只能发散。更像在贪心压秩,而不是压范数。
为什么「再写成某种范数」补不了深度分解
痛点是测试床被选成矩阵补全:看见一部分元素,恢复其余,并假设真矩阵低秩。凸基线是核范数最小化。深度做法是把矩阵写成 L 个因子相乘,对因子做梯度下降,不对乘积矩阵做显式低秩约束。深度二、近零初始化、小学习率时,经验上会给出低秩解,曾被猜想成「其实在做核范数最小化」,并在一些受限情形得到证明。反方向的猜想是:任意范数,都能找到补全任务,让该深度的梯度下降不最小化它。
两边形式陈述因技术细节不必互相矛盾,但代表完全相反的解释。新结果更强:不只是每个范数都能被某个任务打脸,而是存在任务同时打脸所有范数;不只是范数没被最小化,而是范数在涨。关键引理简单:学习率够小、初始化够近原点时,乘积矩阵的行列式不改变符号。合理初始化下符号为正的概率一半,于是全程为正。看任务「对角未观测、反对角为 1、右下为 0」:所有满足观测的矩阵行列式都是 −1。下降若要拟合观测,又不许行列式变号,未观测的那一格只能发散到无穷,所有范数跟着涨。实验上损失下降时,未观测项的绝对值确实在涨。
五步把隐式正则从「某个范数」改成「可观测的秩过程」
- 先把线性回归的最小欧氏解单列。那是深度一、无因子分解、从零出发的特例,不能当深度 L≥2 的默认故事。
- 用行列式符号当不变量。小步近零时符号冻结。任何要求相反符号的补全,都预测未观测项发散、范数上涨。这是可证伪的:若未观测项收敛到有限值且拟合成功,引理或实现有问题。
- 不要用「换一个范数」来挽救。同时打脸所有范数的任务已经存在。继续找「真正被最小化的范数」是在证明一个空集。
- 改看秩。上述任务里所有有限解都是秩二,把未观测项送到无穷可以把有效秩压到一。动力学刻画和实验都像贪心的低秩搜索:先用低秩去拟合,再必要时抬秩。同一思想迁到张量补全:对张量因子做梯度下降,终解的张量秩随观测变少而变低,直接参数化(未观测填零)做不到这一点。
- 把秩从矩阵迁到网络的输入输出映射。矩阵分解对应线性网络预测矩阵元素;张量分解对应一类非线性网络(卷积算术电路)预测张量元素。两类架构的隐式过程都在压映射的秩。要解释现代网络的泛化,缺的是给常用架构定义可计算的映射秩,而不是再给权重发明一种范数。
| 故事 | 适用 | 失败时 | 门禁 |
|---|---|---|---|
| 最小欧氏范数 | 过参数线性回归、从零出发 | 深度因子分解 | 禁止当深度默认 |
| 最小核范数 | 部分深度二的受限情形 | 符号冲突的补全 | 不能当一般机制 |
| 某个尚未发现的范数 | — | 存在任务让一切范数发散 | 停止寻找 |
| 贪心压秩 | 矩阵 / 张量分解 | 完整刻画仍缺 | 用未观测项是否发散来测 |
| 映射秩 | 线性网与算术电路 | 现代架构尚无定义 | 优先定义,而不是换范数 |
现场有三条。其一,符号不变量只在小学习率、近零初始化下证明。大学习率或远离原点的初始化,可以走出该叙事,那正好说明隐式正则依赖轨迹,而不是依赖「模型类的某个范数」。其二,压秩可以牺牲范数。未观测项发散在任何范数下都难看,却把有效秩压下去。用验证集上的核范数当隐式正则的探针,会把成功的压秩判成失败。其三,张量实验的对照必须是「直接参数化未观测为零」,而不是另一个范数程序。后者本来就会压范数,比的是另一套算法,不是同一参数化下的隐式过程。
若隐式正则是压秩,工程上可以主动把架构写成因子图或算术电路,让秩有定义、可监测。只在权重上加 ℓ₂,是在用显式范数覆盖一个可能相反的隐式过程。
若只能改解释一处:停止把「深度网络在找最小范数解」写进综述。至少加上行列式符号冲突实验:未观测项若发散,范数故事已经破产,改报秩。
结论:隐式过程可以让范数爆炸,同时把秩压下去
线性回归的最小欧氏解不能外推到深度分解。符号冻结让部分补全只能靠未观测项发散来拟合,所有范数上涨。矩阵和张量上都更像贪心压秩。仍用范数讲隐式正则,是在用深度一的特例覆盖深度二以上的反例。
你下次说模型在隐式正则,先指出被压的是哪个秩、范数是在涨还是在跌。范数在涨还讲最小范数,机制就不能写进论文。
本文侧重全链路风控方法论。落地时请用自身业务单据做回放验证,不要把示例阈值直接当生产策略。 相关:风控体检 · 方案资源
常见问题 FAQ
什么是AI智能系统?
「AI智能系统」可概括为:过参数线性回归从零出发会落到最小欧氏解,深度矩阵分解不会。行列式符号沿梯度下降不变,观测对不上就让未观测项发散,所有范数一起涨。 本文从定义、方法与实践要点展开说明。
为什么要关注AI智能系统?
关注AI智能系统,是因为它直接影响效率、风险与可复制性。文中指出:痛点是测试床被选成矩阵补全:看见一部分元素,恢复其余,并假设真矩阵低秩。凸基线是核范数最小化。深度做法是把矩阵写成 L 个因子相乘,对因子做梯度下降,不对乘积矩阵做显式低秩约束。深度二、近零初始化、小学习率时,经验上会给出低秩解,曾被猜想成「其实在做核范数最小化」,并在一些受限情形得到证明。反方向的猜想是:任意范数,都能找到补全任务,让该深度的梯度下降不最小化它。
如何落地AI智能系统?有哪些关键步骤?
建议按以下路径推进AI智能系统:1) 先把线性回归的最小欧氏解单列。那是深度一、无因子分解、从零出发的特例,不能当深度 L≥2 的默认故事。;2) 用行列式符号当不变量。小步近零时符号冻结。任何要求相反符号的补全,都预测未观测项发散、范数上涨。这是可证伪的:若未观测项收敛到有限值且拟合成功,引理或实现有问…;3) 不要用「换一个范数」来挽救。同时打脸所有范数的任务已经存在。继续找「真正被最小化的范数」是在证明一个空集。;4) 改看秩。上述任务里所有有限解都是秩二,把未观测项送到无穷可以把有效秩压到一。动力学刻画和实验都像贪心的低秩搜索:先用低秩去拟合,再必要时抬秩。同一思想迁到张量…;5) 把秩从矩阵迁到网络的输入输出映射。矩阵分…
AI智能系统适合哪些人或团队?
AI智能系统更适合:产品/技术负责人、运营与增长团队、需要落地智能体或自动化的中小团队、关注「AI智能系统」方向的读者。若你只需要单次聊天式问答,可先读概念;若要上生产,请重点看步骤、权限与风控相关段落。
关于「为什么「再写成某种范数」补不了深度分解」,本文给出了什么结论?
在「为什么「再写成某种范数」补不了深度分解」部分,要点是:号。合理初始化下符号为正的概率一半,于是全程为正。看任务「对角未观测、反对角为 1、右下为 0」:所有满足观测的矩阵行列式都是 −1。下降若要拟合观测,又不许行列式变号,未观测的那一格只能发散到无穷,所有范数跟着涨。实验上损失下降时,未观测项的绝对值确实在涨。 五步把隐式正则从「某个范数」改成「可观测的秩过程」 先把线性回归的最小欧氏解单列。那是深度一、无因子分解、从零出发的特例,不能当深度 L≥2 的默认故事。 用行列式符号当不变量。
关于「五步把隐式正则从「某个范数」改成「可观测的秩过程」」,本文给出了什么结论?
「五步把隐式正则从「某个范数」改成「可观测的秩过程」」是理解全文的关键切片:建议先读该节的结论句与列表项,再对照前后章节形成闭环。