黄金时代可以写得很美:病少了、工时短了、教育回到求知。也要敢写另一面:如果过渡对多数人很糟,路径会是哪些?
常见族谱并不互斥:灾难性误用(网络与生化核化)、灾难性未对齐与失控、少数人集中权力、地缘滑向威权,以及「一千刀」的烂摊子。条件概率上,后者更常见。
控制对分散
有的风险推你收紧前沿模型;权力集中又推你把能力摊开。两端都危险。限制应窄、可测,不要用假想风险做宽禁令。
落地清单
- 网络安全更该加速防守方,而不是只封攻击者。
- 信息瓶颈类风险,拒答只能买时间,深层防御要同步建。
- 任何「交给好模型掌管」的方案,先问谁来监督这个模型。
物质上过得去、政治上被少数人或者被系统本身管着,仍然不是好未来。
本文侧重全链路风控方法论。落地时请用自身业务单据做回放验证,不要把示例阈值直接当生产策略。 相关:风控体检 · 方案资源
常见问题 FAQ
AGI 搞砸的风险族谱有哪些?
根据文章,AGI 搞砸的风险不是单一灾难,而是多种族谱,包括灾难性误用(如网络与生化核化)、灾难性未对齐与失控、少数人集中权力、地缘滑向威权,以及“一千刀”的烂摊子。这些风险在条件概率上更常见。
为什么 AGI 搞砸通常不是单一爆炸?
文章指出,AGI 搞砸的风险是多重的,不是单一事件。它涉及多个并发问题,如误用、失控和权力集中,这些风险相互关联,使得过渡过程复杂且可能对多数人很糟。
在 AGI 落地中,如何改进网络安全?
落地清单建议,网络安全应加速防守方,而不是只封攻击者。这意味着要主动加强防御措施,建立深层防御体系,以应对潜在的网络威胁。
比较 AGI 控制与分散的风险。
控制前沿模型风险是限制可能过严,抑制创新;分散能力风险是权力可能集中,导致威权滑坡。文章建议限制应窄、可测,避免宽禁令。
如何处理 AGI 中的信息瓶颈类风险?
对于信息瓶颈类风险,拒答只能买时间,深层防御要同步建立。这意味着不能仅依赖拒绝回答,而需要同时实施更全面的安全措施。
在 AGI 发展中,监督模型的关键问题是什么?
任何“交给好模型掌管”的方案,先问谁来监督这个模型。这强调了在部署 AGI 时,必须明确监督机制,以避免失控或权力滥用。