-
人工智能优化器稀疏数据用自适应:2026默认矩估计,挤最后半个点再上动量随机梯度
批量梯度稳但一次看完全部,随机噪声大但能逃鞍点。稀疏输入用按参数自适应步长。自适应梯度会把步长衰减到几乎停,均方根传播用滑动平均修好。矩估计再加…
-
人工智能语言训练别只丢弃一半:2026全局范数裁剪比逐坐标砍更稳
预训练词向量对句法任务维数可以更小,对语义任务往往要更大。丢弃率零点五仍是语言网常用正则。梯度不要逐个坐标砍,按全局范数裁到一附近更稳。变分丢弃…
-
人工智能多任务先硬共享:2026辅助任务要能提供归纳偏置否则就是抢梯度
同时优化一个以上损失就是多任务。硬共享隐藏层、各任务自己的输出头,过拟合风险按任务数下降。软共享各有一套参数再互相拉近,成本随任务线性涨。辅助任…
-
人工智能语言迁移先预训练再适配:2026顺序迁移样本需求能降一个数量级
语言迁移按是否同一任务、域是否相同、学习顺序分成几档。带来最大涨幅的是顺序迁移:无标大库上预训练表示,再拿到有标目标任务上适配。预训练常能用十分…
-
人工智能模块化网络先写路由再聚合:2026适配器固定路由,专家混合才学选谁
模块化把计算拆成可独立的参数高效单元,按输入决定激活哪些,再把输出聚合。四个维度:计算怎么实现、路由怎么选、聚合怎么合、训练怎么走。固定路由的适…
-
人工智能智能别绑在单一主体上:2026预训练生成器更像叉车不是代理人
智能常被画成随脑容量单调上涨、同时变成自主行动者。预训练生成器把绝大多数算力花在续写下一步,可以当任意智能的叉车,由人或别的系统来开。多极比单极…
-
人工智能同架构比智能看运算次数:2026预训练占九成九对齐该对适配器
同属内脑更大往往更智。同架构同训法下,训练运算次数是本地智力单位。预训练万亿步,适配不到百万步。好用来自樱桃,智力来自蛋糕。对齐的是司机,不是叉…
-
人工智能对齐先求忠实服从:2026技术可解仍怕诡异谷和只内部部署
技术对齐可以定义为:任意智力都按字面和意图办事,并且能被探针忠实地读出推理和行动。这不等于爱人类,也不保证所有系统都服从好人。过渡期仍有诡异谷、…
-
人工智能失控场景先分控制还是分发:2026热乱局比单一末日更常见
若未来十年通才过渡对人类很糟,未必是单一事件。误用、错位、权力集中、地缘失稳、千刀热乱局会叠在一起。有的干预往控制收,有的往分发铺。收得太宽会把…
-
人工智能任务时长大约半年翻倍:2026斜率比截距更能预报增长节奏
长程任务时长在对数轴上近乎直线,翻倍大约半年。截距受可靠性、任务类型和凌乱税影响,斜率更稳。一旦某能力到前沿,同样水平的推理成本可以一年降一个数…