-
树的事后收缩不要改结构:每个节点往祖先均值缩,一个系数就够
叶子样本少方差大。事后把每个节点往父节点样本均值缩,不改树形、不重训。随机森林也能这么做。交叉验证选一个收缩强度。
-
监督要靠可自验证的专用助手:通用聊天模型要等全面超人就太晚
人标奖励会越来越不可靠。找坏行为难、核对比容易,用语言模型当裁判就能把搜索做成强化学习。专用解释器能打败更大的通用模型。
-
深度网络是复杂适应系统:可靠性模块化冗余挡不住涌现目标和反馈环
传统工程的可靠性、模块化、冗余对付不了适应和涌现。坏行为不要给连续斜坡。大安全系统要从小安全系统长出来,预训练偏了微调救不回来。
-
优化力度要拆成内外两层来量:外层看奖被设错会差多少,内层看一生能适应多少
基准分数不是测量。外层优化力度是目标稍偏再优化会差多少。内层适应是一生相对梯度步能改多少。起飞快慢是两条时间尺度,不是连不连续。
-
表示相似度不要靠直觉测验:要对齐功能差别,普氏距离往往更稳
换一套直觉测验就能让任何指标好看。好的相似度应随任务正确率差一起动。中心核对齐和典型相关各霸一项,跨任务更稳的是普氏距离。
-
低损失解往往能用折线连起来:丢弃稳定就够,不必爬过高损失山脊
过参数化不够保证连通。典型训练解能丢掉一半节点还不崩,就能用分段折线连到另一个低损失解,沿途损失几乎不升。直线插值会拼出人头马。
-
神经切线核解释不了实际训练:二次展开加随机符号才能走出线性区
够宽时网络像核机器,但大学习率下线性化跟不上轨迹。给权重增量随机符号可杀掉一次项、留下二次项,低秩多项式的样本复杂度能降一阶。
-
归一化网络上小学习率也能泛化:真正控制速度的是学习率乘权重衰减
批归一化让损失尺度不变,原点附近不光滑,全批量下降会振荡。学习率乘权重衰减才是内禀学习率。混匀发生在函数空间,不在参数空间。
-
隐式正则不是在最小化范数:矩阵分解会把所有范数推向无穷
过参数线性回归从零出发会落到最小欧氏解,深度矩阵分解不会。行列式符号沿梯度下降不变,观测对不上就让未观测项发散,所有范数一起涨。
-
特征可视化要先压住高频作弊:从噪声优化出来的图不等于真实检测
从噪声优化能把因果和相关拆开,数据集例子做不到。不约束会得到对抗式高频。要压频率、做变换稳健,再用多样性项露出多面。