-
公共服务禁止自动做价值判断:必须先把客观公开问责拆开守
资格、处罚、救助里的对错,不是把分数调光滑就能交给机器。客观会被偏见吃掉,公开会被不透明吃掉,问责和领导会一起空转。价值权衡要留在能改口径、能给…
-
基础模型发布不能一套规矩走天下:必须先按能力和开放程度改门禁
窄任务、通用生成、前沿能力不是同一档风险;权重公开、接口托管、封闭内测也不是同一档可控。公开权重后原厂收不回别人做出的系统。门禁要按这两轴改,不…
-
智能体失败检测必须卡在动作发生时:必须先看赌注可否撤回和能力边界
智能体是对环境动手,不是只生成文本。失败发生在动作链上。高赌注、不可撤回、工具和记忆不受约束时,必须分层实时拦截。只在事后看日志,损失已经造成。
-
部署后透明不能只报用量:必须先把事故违规和用户反馈公开到可核对
私下披露建不成公共问责。用量和劳动力市场故事变多了,伤害发生率、严重事故、更广的社会影响仍然看不清。领先者和其余机构之间的缺口,本身就是风险。
-
合成内容披露不能只贴一张标:必须把直接间接水印和元数据叠着用
观众能看见的标签会疲劳、会被裁掉;藏在文件里的信号会被剥。单一机制过不了伪造、可达、规模化三关。要按用途把直接披露和间接披露叠起来,并分开测「生…
-
可信不能把七项特征一起拉满:必须先把治理测绘测量处置拆开跑
有效可靠、安全、抗攻击、可问责、可解释、隐私、有害偏见,七项不能同时最大。没有治理,测绘测量处置会对不齐组织口径。没有测绘,测量是在给错误上下文…
-
生成式风险不能套通用清单:必须先按编造隐私供应链和人机配置分列
自信说错、训练记忆、价值链拼装、人过度信任,是生成式系统放大或独有的风险。通用风险管理只说管偏见,管不住编造率和第三方组件。要按风险类和角色给动…
-
测评验证确认不能一份卷考所有系统:必须先用事件工具和数据块自建赛程
统计学习、长文本、多模态、智能体,目标和伤害面不同,不能共用一张卷。按组织目标搭事件和工具,产出与测量概念对应的数据块,赛程才能改、才能复用。
-
可解释不能只给一段话术:必须先满足有意义准确和知识边界四条
解释要存在、要对这个人有意义、要准确描述系统、还要承认不会的边界。四条缺一,话术会把不会装成会。抗攻击和可解释还会互挤,权衡要写进同一张表。
-
对齐不能只看外在行为过关:必须先给内在结构可检验的定量界
可解释工具在拆零件,理论却说不清什么算机制、什么算假象。归纳偏置、数据潜结构、稀有灾难和尺度突变,都还缺可检验的界。没有这些界,外在过关只是还没…