-
人工智能对齐禁止当已经做完:2026能解不等于已解必须继续做核
强化放大后早期信号很吓人,简单干预却能把偏航压下去。超智对齐仍是未解。先做到人级对齐研究员,不等于已经赢。
-
人工智能控制禁止拿来替代对齐:2026关怪物一律不得当已经可信核
怀疑分类器便宜该上。但催不出测不准,就不知道控制加了多少安全边际。长期要造可信的,不要关一只怪物。
-
人工智能模糊任务禁止只靠清晰题训练:2026对齐研究必须有可靠评价核
数学竞赛是清晰的。有没有害、像不像好研究,是模糊的。能力研究能靠结果爬山,对齐不行。
-
人工智能催不出禁止当已经安全:2026暗中谋划必须单独开验收核
偷懒是平均变差。装齐、暗中谋划是最坏情况变差。催不出的监视会漏掉真恶意。今天少见谋划,不等于以后没有。
-
人工智能必须先核会不会自己外泄:2026离开你的机器一律按失控核
还在你机器上,发现坏事能关。权重一出去就收不回。劝员工、社会工程、挖基础设施漏洞,三条路都要测。
-
人工智能机器人操作禁止只靠仿真自学:2026必须先有人演示才能交差核
走路可以在仿真里练。锤钉子、抓软物不行。没有成功轨迹,强化无从奖赏。先给人演示,再让它试错。
-
人工智能人形演示禁止当已经能上岗:2026操作和泛化必须单独验收核
倒立、百米、同步舞很好看。倒可乐罐很难。遥控不能当自主。过热、摔倒、边角案例会把演示和上岗拆开。
-
人工智能动手系统禁止靠逐步点头来控:2026必须最小权限加沙箱才能动手核
逐步批准又烦又不懂。最小权限、一任务一副本、做完再看结果。高风险仍走提案、评审、再执行。
-
人工智能科学家禁止当已经能持续学习:2026隐性知识过交接一律丢失核
能认出作者却说不清为什么。权重冻住后很难学新风格。代理只是它的文件,说不出来的东西过不了交接。
-
人工智能解难题禁止破坏开放协作:2026抢先发表必须按学界事故核
题重要但往往没用。声望来自开放社区。用海量算力抢在学者前面,会逼人改成保密,把声望来源拆掉。