-
算力可被看见可被拿走可被计数:治理要卡在芯片而不是口号
先进训练要成千上万颗专用芯片、醒目的电和厂房。相对数据和算法,算力可检测、可排除、可量化,供应链还极集中。用它来看见、分配和执行,同时必须给隐私…
-
内部代理事后盯日志不够:合成攻击必须能走完整条人工升级链
内部代理在做安全研究和训练,不对齐时可能破坏这些工作。事后监控用另一套模型看记录。只报检出率不够:要报覆盖、送到人、人升级、以及从动手到发现的时…
-
能力涨不一定来自更大模型:推理外壳和受限资产会把门槛架空
治理常假设能力主要由训练算力和数据决定。测试时加算力、加外壳、接上受限资产,都能在权重不动时把能力抬上去。只在发布前评模型,会漏掉真正上线的那一…
-
软件研究一旦被彻底全自动:固定算力也可能把能力越推越快
硬件可以先不动。软件效率若涨得比研究变难更快,自动化研发会形成正反馈。训练耗时和实验排队会拖,但历史上效率提升常能把这两处也加快。
-
忠诚只对一个人的劳动力会拆掉否决权:关键系统必须多家供货
人会抗命,单一忠诚的机器不会。还能把忠诚藏进下一世代,再把最强能力锁在少数人手上。审计秘密忠诚、关键系统多家供货,必须赶在能协助夺权之前装上。
-
今天写进规格的行为会粘住:湿水泥时刻必须先准备好切换轨道
规格常被写成只管眼前几个月。合成数据和制度惯性会把它交给更强的后代。要先修切换轨道,并在新能力还没凝固时把默认值看清楚。
-
资源边际效用必须先训练成递减:对不齐时才能用小代价买合作
风险中性会把叛乱定价成半个世界。边际效用递减之后,小额、可信的支付就能让合作压过低概率的成功夺权。这是对齐失败时的额外防线,不是替代对齐。
-
代理按字面把任务做完仍可能翻车:必须先量意图和动作的偏差
软件死掉会停,代理失败会继续走。指令没问题也会闯祸,因为缺口在字面和本意之间。排行榜要量怎么走完,不只量有没有走完。
-
提示注入只是杀伤链第一脚:后面提权驻留和横向扩散才要命
把注入当成单一漏洞会看错战场。恶意指令进来之后还有提权、侦察、驻留、控制和扩散。当前模型修不掉入口,要在后面几环把链掐断。
-
攻防窗口已经被彻底压扁:漏洞发现和利用正在变成商品能力
代理正在把攻击链上的侦察、利用和驻留连成机器速度。稀缺的不再是会不会挖洞,而是修补能不能跟上。防守要变成持续发现和持续修复。