-
积分梯度的基线不是装饰参数:它定义了「缺失」,选错颜色就看不见
路径归因要把特征从缺失插值到现值。全黑基线会对黑色失明。缺失该用分布,期望梯度对训练分布积分。热力图好看不等于解释对。
-
回路才是可反推的算法:特征由权重连成子图,不是一堆不可读的浮点
特征可视化说明单元在找什么,回路说明它们怎么拼起来。圆由曲线拼,狗头由眼鼻毛舌拼,高层特征上找得到与或异或。规模要小到能逐步验证。
-
反卷积默认就会画出棋盘格:核不能被步长整除时重叠不均匀
转置卷积用低分辨率去粉刷高分辨率,核与步长不能整除时有的位置被刷多次。二维会平方放大。先放大再卷积,随机初始化就不带棋盘。
-
专家时间表别只报一个中位年:要同时报区间和专家之间的分歧
每人给的是几个年份—概率点,问法和口径会把曲线推晚或推早。该同时报聚合区间和专家分歧。只报任务口径中位年,会被选择性引用。
-
十年量级的技术跳跃很少见:通用智能附近的突变论证目前站不住
自然指标上一次进步顶过去十年以上的情况很少。人猿差距、脑容量、智能爆炸、一条算法、部署复制,目前都还站不稳。大跳跃的先验应很低。
-
图像分类越过人类区间只要三年:新手到训练人很快,之前爬坡更长
未训练人大约八成对,训练标注员错误率约百分之五。从第一次认真尝试到新手要十四年以上,越过人类带只要三年。过线之后增益变慢,不能直接写成部署跳变。
-
全球产出几乎总是先完成四倍时长的翻倍:更快的起飞在历史上极少
若慢起飞是一年翻倍之前必须先有四年翻倍,有记录的全球产出几乎总满足。例外在农业开始前后,更像新活动进入统计,不是现代产能跳变。
-
白盒估计要比随机抽样更省算力:灾难概率不能靠抽到才算数
灾难检测器再好,稀有事件也抽不到。机械估计按网络结构推理期望,最差打平抽样,有结构时才能明显胜过。解释要跟训练并行长出来,时间和找参数同量级才付…
-
稀有输出不能靠盲抽:重要性抽样用梯度把概率质量推到会出事的区域
部署次数远多于训练、分布会偏、还会装对齐时,盲抽看不到的行为仍可能出现。用梯度重加权输入,或在激活上外推,才能在六万次前向里估千万分之一到十亿分…
-
大网络别追求可证保证:启发式解释加意外记账才量得动解释质量
形式证明在大模型上会先垮。启发式解释不必写成科普,但要把解释没覆盖的惊讶记账;账清了才能拿去估分布外和异常。紧凑证明只是跳板。