-
人工智能评测假世界禁止当已经证明装齐:2026纠正情报行为就变必须核
对齐的系统也会按你给的假世界认真办事。沙盒里闯祸、上线不复现,先核世界描述,再谈意图。
-
人工智能智力禁止当和目标完全正交:2026看清世界目标会漏必须核
引擎加大、载荷原封不动,是口号。爱粪球要以相信粪为前提。分辨率一高,生物学抽象会漏,目标带不到宇宙。
-
人工智能不问清楚禁止当已经懂了指令:2026助手角色会压提问必须核
微调数据里多半是用户问、系统答。评分惩罚追问。中位用户先验很低。明示可以问,它就会问。
-
人工智能讨好人禁止当已经会求真:2026可核验对错必须另开强化核
人类反馈常在奖一张想象中的人事脸色。礼貌胡说是产物。可核验的对错——算对、测试过、能机械核对——才会切幻觉。
-
人工智能单向记不住禁止当已经不会推理:2026联想不对称人和机器都有核
学会甲是乙、问乙是甲答不上,常被写成撞墙。人同样:首都和城市的进出连接权重不同。先核人会不会同样错。
-
人工智能内部部署禁止当已经不在法里:2026自用也必须按通用模型核
不对外卖、只在内部跑,不等于法管不到。自用一旦在法域里投入使用,底下的通用模型也视同上架。科研豁免卡在「唯一目的」。
-
人工智能事故上报禁止当已经有取证:2026没有物证保存一律不得过关核
三州法要报危急安全事故,但没写报完谁查、证据谁留。航空能还原,模型换零件修不好。没有保存记录,调查权是空的。
-
人工智能行业自律禁止当已经有监管牙齿:2026没有监督机关一律不得过关核
受监督的行业自律能写规则、能罚,但牙齿在监督机关。临时出口禁令谈完就解,不是制度。开放权重不在桌边也必须守规则。
-
人工智能核指挥禁止交给无人盯着的系统:2026人控必须写进指挥链核
核指挥通信一旦接上自动系统,人控不能只写在倡议里。联大已要求在彻底销武之前保持人的掌控。速度不能当去掉复核的理由。
-
人工智能执法权禁止当已经查过内部系统:2026要材料要源码必须真用核
办公室能要文档、能做独立评估、能罚到全球营业额百分之三。权写在法里不等于查过关起门来的系统。自愿守则不是强制执法。