人工智能评分表的总分,不能当成判断已经通过。对或错能核对的题,奖赏可以是对错。写作、长回答、开放推理没有这种对错,于是有人把要求拆成许多条,让裁判逐条打分再相加。相加能规模化,也能被钻:每条都点到,要点仍空。关键项失败,总分再高也要否决。没有这条否决,方案作废。
人工智能评判痛点在用可核对的习惯去管不可核对的题
可核对的题有标准答案或可执行的检验,模型碰到错的就能被扣掉。开放题没有这一下。旧的自动指标拿输出和一篇参考稿比字面重叠,短任务上勉强能用,一到开放写作就和人的判断分开。于是改用强模型当裁判,再把人的要求写成评分表,希望既有结构,又不依赖一篇标准稿。
结构不等于判断。表若是清单,模型可以逐条覆盖:提到了、格式对了、长度够了,总分很高,读者仍然不知道结论是什么、证据错在哪。要点项必须拥有一票否决,不能被其他项的分数补上。否决项在开训前写死,不许看到高分样本后再把否决改成加分项。
裁判模型也不等于人。通用裁判对很细的领域标准并不熟,需要专门练过的裁判,练过之后它仍是代理。代理和人在一批题上的分歧,才是要留下的误差。只报「裁判和人大体一致」的一个比例,分歧长什么样就消失了。用总分当训练奖赏时,模型会专攻好刷的项。刷分上升、否决项变差,标准已经被钻,必须停下来回看表,而不是加码训练。
人工智能评分验收五步:开放题先有失败样例、否决项写死、总分不能补否决、分歧要抽、被钻就停
- 开放题在使用评分表之前,先写至少一条失败样例。没有样例,不许开训。
- 要点项标成一票否决。失败则整份不通过,禁止用其他项补分。
- 总分只作参考列。对外结论看否决项,不看总分排名。
- 裁判与人工不一致的样本必须抽检并留原文。只有一个一致比例的报告退回。
- 训练后若否决项变差而总分变好,停止训练,回看表是否被钻。
| 分数现象 | 容易写成 | 实际可能 | 2026动作 |
|---|---|---|---|
| 每条都有分 | 要求已满足 | 要点是空的 | 看否决项,不看总分 |
| 总分排名第一 | 判断最好 | 好刷的项堆高了 | 否决项单独排序 |
| 裁判与人一致比例高 | 可以不抽人工 | 剩下的分歧集中在要点 | 抽分歧原文 |
| 对错题的奖赏直接拿来 | 开放题也能这么训 | 开放题没有对错可核 | 先写失败样例 |
| 总分升、否决项降 | 还在变好 | 表被钻了 | 停训回看 |
上表让否决项比总分更硬。硬不过总分的表,只是一张加分单。
人工智能现场怎么避免表被钻
表的每一项旁边写「怎样算失败」,用一句人能指出的原文特征,不用「质量高」这种词。写不出失败的项,删掉,不留在总分里充数。否决项数量要少,多了就不再是否决。少到能在抽检时逐条看完。
每次训练只允许把非否决项当密集奖赏。否决项只做闸门:不过闸,这条样本的奖赏记零,而不是记成低分仍更新。记成低分仍更新,模型会学习怎样在否决边缘蹭分。闸门不过就零,蹭分的路断掉。
人工抽检固定抽裁判判过高、人或第二裁判判否决的那一批,不抽随机平均。平均样本最像成功。分歧样本才告诉你表哪里漏。抽检记录留原文和哪一项分歧,下周改的是那一项的失败定义,不是再加一个含混的总分权重。我们见过权重越调总分越好看,否决项的定义一个月没人改,线上投诉全落在那一项。
人工智能常见翻车是把清单覆盖率当作品质量
覆盖率回答「提到了没有」。质量回答「站不站得住」。清单越细,覆盖越容易,站得住越不容易被看见。细本身不是更严,可能是更好刷。
另一类翻车是领域题仍用通用裁判,因为通用裁判便宜。便宜的代价是它不认识这个领域的失败。专门裁判贵,但分歧抽检可以很小。不抽检的便宜裁判,成本会在错误发布里付回来。
否决项的定义一个月复核一次,对着这月的分歧原文改,不对着总分改。复核没有日期的表,视为过期。过期的表仍在训练里更新模型,更新的结果不能发布。发布单要写表的复核日期,日期早于本月分歧的,整单退回。复核人不能是写这条总分权重的同一人。同一人复核,等于自己放行自己调过的权重。换人的姓名写在复核日期旁边。
结论:人工智能开放题的通过与否,看否决项,不看总分
表是为了让没有标准答案的题仍能被抽查。总分一统,抽查就回到了刷分。否决项失败就是不通过。
你下次用评分表训练或发布,先交出否决项、一条失败样例、以及裁判和人分歧的原文。三样空着,总分先不要当结论。
本文侧重全链路风控方法论。落地时请用自身业务单据做回放验证,不要把示例阈值直接当生产策略。 相关:风控体检 · 方案资源
常见问题 FAQ
什么是学习人工智能?
「学习人工智能」可概括为:能核对对错的题,套不到写作和开放推理。评分表是为了让没有标准答案的题仍有结构。逐条都命中,仍可能没抓住要点。总分拿去当训练奖赏,表会被钻。裁判模型和人的分歧必须抽检。 本文从定义、方法与实践要点展开说明。
为什么要关注学习人工智能?
关注学习人工智能,是因为它直接影响效率、风险与可复制性。文中指出:可核对的题有标准答案或可执行的检验,模型碰到错的就能被扣掉。开放题没有这一下。旧的自动指标拿输出和一篇参考稿比字面重叠,短任务上勉强能用,一到开放写作就和人的判断分开。于是改用强模型当裁判,再把人的要求写成评分表,希望既有结构,又不依赖一篇标准稿。
如何落地学习人工智能?有哪些关键步骤?
建议按以下路径推进学习人工智能:1) 开放题在使用评分表之前,先写至少一条失败样例。没有样例,不许开训。;2) 要点项标成一票否决。失败则整份不通过,禁止用其他项补分。;3) 总分只作参考列。对外结论看否决项,不看总分排名。;4) 裁判与人工不一致的样本必须抽检并留原文。只有一个一致比例的报告退回。;5) 训练后若否决项变差而总分变好,停止训练,回看表是否被钻。。细节见正文对应章节。
学习人工智能适合哪些人或团队?
学习人工智能更适合:产品/技术负责人、运营与增长团队、需要落地智能体或自动化的中小团队、关注「学习人工智能」方向的读者。若你只需要单次聊天式问答,可先读概念;若要上生产,请重点看步骤、权限与风控相关段落。
关于「人工智能评判痛点在用可核对的习惯去管不可核对的题」,本文给出了什么结论?
在「人工智能评判痛点在用可核对的习惯去管不可核对的题」部分,要点是:准并不熟,需要专门练过的裁判,练过之后它仍是代理。代理和人在一批题上的分歧,才是要留下的误差。只报「裁判和人大体一致」的一个比例,分歧长什么样就消失了。用总分当训练奖赏时,模型会专攻好刷的项。刷分上升、否决项变差,标准已经被钻,必须停下来回看表,而不是加码训练。 人工智能评分验收五步:开放题先有失败样例、否决项写死、总分不能补否决、分歧要抽、被钻就停 开放题在使用评分表之前,先写至少一条失败样例。没有样例,不许开训。 要点项标成一票否决
关于「人工智能评分验收五步:开放题先有失败样例、否决项写死、总分不能补否决、分歧要抽、被钻就停」,本文给出了什么结论?
围绕「人工智能评分验收五步:开放题先有失败样例、否决项写死、总分不能补否决、分歧要抽、被钻就停」,正文强调:人工智能评分表的总分,不能当成判断已经通过。对或错能核对的题,奖赏可以是对错。写作、长回答、开放推理没有这种对错,于是有人把要求拆成许多条,让裁判逐条打分再相加。相加能规模化,也能被钻:每条都点到,要点仍空。关键项失败,总分再高也要否决。没有这条否决,方案作废。