先给结论:公共服务里的价值判断,不能自动拍板。资格、处罚、救助、风险提示,都会碰到什么叫公平、什么该公开、出了错谁来认。机器可以算相关、排顺序、提建议,但不能把权衡做成不可追的分数。客观会被偏见吃掉,公开会被不透明吃掉,问责和领导会一起空转。权衡要留在能改口径、能给理由的人手里。

为什么「更中立所以更公平」会把原则掏空

痛点是把自动当成去人情。去人情听起来客观。训练数据和标签里已经有旧的人情和旧的歧视,模型会把它们磨光滑,光滑得像中立。中立一旦写进决定,当事人更难争:争的不是某个人的偏见,是一张说不清的表。说不清,客观就死了。

公开也会死。模型内部难讲,采购合同难讲,风险分数更难讲。公务若讲不清依据,开放就变成「我们用了先进工具」。先进工具不是依据。依据要能指到规则、指到输入、指到如果反着来会怎样。指不到,领导无法带队,问责无法落地。无法落地的问责,会在出事时砸到最底层的窗口人员。

价值判断之所以不能自动,是因为它会在原则之间打架。救一个人可能慢另一群人;公开一个分数可能伤害被评的人;收紧客观可能让灵活消失。打架只能由能被问责的人当场取舍,并留下可复查的理由。交给模型,取舍会藏进权重。权重不会来开会,也不会在听证会上坐着。

五步把价值判断从自动分数收成可守的原则

  1. 先标哪些决定是价值判断。资格、处罚、救助、强制措施,默认算。算相关、填表、检索,可以自动。标错了,后面全错。
  2. 客观要测偏见,不能自称中立。分群误差、拒真、放过,都要报。报不出来,客观栏空白。空白不准上。
  3. 公开要能讲清三条:用了哪类输入、卡在哪条规则、人如何改。讲不清,系统只许建议,不许决定。
  4. 问责绑到能改口径的人。窗口人员可以执行,不能当唯一被告。被告必须够得到设计、采购和规则。
  5. 领导要有否决和改口的实权。实权包括停用某一类自动建议。停不了,领导只是封面。
原则 自动之后容易变成 它伤害什么 门禁
客观 光滑的旧偏见 更难争 分群误差必报
公开 先进工具四个字 依据消失 三条讲不清就停
问责 只砸窗口 设计免责 要追得到规则主人
领导 封面签字 无人能停 要有停用权
价值权衡 藏进权重 听证缺席 禁止自动拍板

现场有三条。其一,建议和决定必须切开。建议可以快,决定必须慢到能写理由。理由进档案,建议进草稿。草稿混进档案,假客观会变成真处分。其二,不透明有好几种:技术上难讲、合同上不让讲、组织上不愿讲。三种都要记账。不愿讲不能用难讲当借口。借口一经成立,公开原则就只剩年度报告里的一段。

其三,自动一旦进入处罚和资格,当事人面对的是无法对质的对手。对质需要知道卡在哪一条。知道了,才能补材料、才能申诉、才能要求人审。不知道,申诉会变成对着空气说话。空气不会改口。

度量五件事:价值判断是否被标出、分群误差是否报、三条依据是否能讲、问责是否够得到规则主人、领导是否能停。五件说不清,中立是光滑偏见的马甲。马甲不能当公务决定。

有人会说人工也有偏见。有。人工偏见可以被点名、被培训、被处分、被改规则。自动偏见要先被看见,才能走同一条路。看不见,连改规则的把手都没有。没有把手,原则只是墙上的字。

建设者该把「禁止自动拍价值板」写进系统默认,而不是写进伦理课件。管公务流程的人该拒收只有综合公平分的方案。综合分会把打架的原则揉成一个绿点。绿点不是取舍。

若只能改一处:先把决定权从分数里拿出来,改成「建议加人工理由」。改完之后,客观、公开、问责才有地方挂。不改,讨论会漂回「我们上了智能工具」。

理由要限格式。格式不是为了官僚,是为了后来人能复查:当时看见了什么、选了哪条、放弃了哪条。放弃的那条尤其要写。不写放弃,下次会假装没有打架。假装没有打架,价值判断就会再次被交给分数。

救助和处罚的自动排序特别危险。排序看起来只是效率,其实已经在分配稀缺和痛苦。分配是价值判断。判断要能被社区看见,至少被当事人看见。看见了才能争。争得了,公务才还在公共里,而不是在模型里。

领导的否决权要配日志。否决了什么、为什么、何时恢复,都要留。不留,否决会变成私下交易。私下交易比自动拍板更难追。难追的权,不是领导,是另一套不公开。

结论:价值判断要留在能给理由的人手里,分数只能当建议

客观、公开、问责、领导,会在自动拍板时一起空。先标出哪些是价值判断,偏见要报,依据要能讲,停用权要在。仍把光滑分数写成更公平,当事人会失去对质的对手。

你下次看公务智能方案,先问决定能不能写成三条依据。写不成,分数不准进决定栏。

效率龙虾 会带着下面这段开聊

按文章《公共服务禁止自动做价值判断:必须先把客观公开问责拆开守》把卡点收成可执行步骤:先做什么、别踩哪条、怎么验证。

用效率龙虾试这篇

本文侧重全链路风控方法论。落地时请用自身业务单据做回放验证,不要把示例阈值直接当生产策略。 相关:风控体检 · 方案资源

常见问题 FAQ

为什么公共服务中的价值判断不能由AI自动决定?

因为AI自动决定会隐藏偏见、缺乏透明度和问责。训练数据中可能包含旧的人情和歧视,模型会把它们磨得光滑,看起来中立但实际不公。自动决策让当事人难以争辩,公开依据不足,问责难以落实。价值判断涉及原则之间的权衡,必须由能给理由的人类负责,不能只靠算法分数。

在公共服务中,哪些决定属于价值判断?

根据文章,资格、处罚、救助、强制措施等默认算价值判断。这些决定涉及公平、公开和问责,不能简单自动化。例如,决定某人是否符合救助资格或是否接受处罚,需要权衡不同原则,如公开分数可能伤害被评的人,所以必须由能给理由的人类处理。

如何防止自动分数变成价值判断的决定?

文章提出五步方法:首先标出哪些决定是价值判断;其次测试偏见并报告分群误差;第三,公开依据要能讲清输入、规则和修改方式;第四,问责绑到能改口径的人;最后,领导要有否决和改口的实权。建议和决定必须切开,建议可以快,决定必须慢到能写理由。

自动偏见和人工偏见有什么不同?

人工偏见可以被点名、培训、处分和改规则,因为人能被问责。自动偏见隐藏在模型权重中,难以发现和纠正。文章指出,自动偏见要先被看见才能走同样的修正路径,但往往连看见都难,导致原则失效,当事人无法对质。

公共服务中使用自动价值判断的常见陷阱有哪些?

陷阱包括:客观性被旧偏见掩盖,看起来中立但实际不公;公开原则因技术难讲或合同限制而失效;问责只砸到窗口人员,设计者免责;领导失去实权,变成封面签字;价值权衡藏进权重,听证缺席。这些会让原则空转,自动分数伪装成公平。

领导在确保公共服务中价值判断由人类负责方面,应该做什么?

领导必须拥有否决和改口的实权,包括停用某一类自动建议。实权要配日志,记录否决内容、原因和恢复时间,防止私下交易。领导要带队确保系统依据可讲、问责可落地,不能只依赖智能工具,而要拒收只有综合公平分的方案,以守住客观、公开和问责原则。