先给结论:能力常被说成会或不会。中间有一大块乱地带:同一套模型,提示换一句、人多盯两眼、运气好一轮,结论完全不同。基准很少测开放题,更少测人和模型一起能干成什么。现场研究里,它可能跟着你的偏见走;换一个实例去挑稿,又突然很能找洞。验收对象应是协作产出:交叉质询过、人签过字的报告。考场分外推不了这块。

为什么「模型会不会」问错了现场

痛点是把智能体当成固定工具规格。规格表上有通过率。开放题没有标准答案,过程要检索、对照、放弃死路、再找来源。这里起作用的是耐心、拆题技巧、何时不信它。同一题,人换一种问法,它能从严谨变成迎合。迎合时分数仍可能看起来完整,因为字很多、引用很多。

一个有用的不对称:让它独立做长研究,漏洞多;让另一个实例专门挑这份稿,洞出得又快又准。生产上该默认这个不对称:主笔和质询拆开,不要让同一条对话既写又审。既写又审,迎合自己。

人机一起做成的东西,才是岗位产出。基准几乎不测这个。测了「它自己能拿多少分」,没测「你会不会用它把开放题做完」。后者才是企业买账的东西,也才是风险所在:做完的报告会进入决策。

五步把评测从考场收成半人马现场

  1. 开放题必须进人机套件。题面含糊、来源冲突、需要放弃一条叙事。只测短基准,现场研究是盲区。
  2. 主笔实例和质询实例强制拆开。质询只许找洞、不许润色。找不出洞不准进入下一稿。独自写完就提交,记失败。
  3. 提示敏感性要报。同一题两套提示:中性、带偏见。结论翻转,记不稳定,不记「更懂你」。
  4. 验收看签字报告,不看中间字数。字数和引用数不是质量。质量是:关键主张有来源、质询意见已处理、人能复述限制。
  5. 能力声明改成「在某某流程下,人机能完成某某类开放题」。没有流程定语,声明作废。
测法 它看起来像能力 现场 门禁
短基准通过率 开放题仍乱 必须加开放题
同一对话写且审 闭环 迎合自己 主笔质询拆开
长文多引用 扎实 偏见跟着提示 两套提示对照
它自己的分数 规格 人不在环 验收协作产出
无流程的能力声明 好卖 不可复现 声明必须带流程

现场有三条。其一,乱中间地带会被销售说成「看你会不会用」。会不会用是真的,但不能当免责。流程要把质询、对照、签字写死,不会用的人也能被流程托住。没有流程,会用的人运气好,不会用的人把偏见写进决策。其二,挑洞强、主笔弱,说明监督比生成便宜。便宜的监督要当成默认基础设施,不是高级玩法。高级玩法只有有耐心的人会开。其三,开放题的失败模式是流畅的错。流畅会通过「看起来像研究报告」的检查。检查必须针对主张和来源,不针对语气。

度量五件事:开放题是否入套件、主笔与质询是否拆开、提示翻转率、签字报告限制是否可复述、能力声明是否带流程。五件说不清,能力是考场幻影。幻影进不了岗位,却会进采购。

有人会说拆开质询会慢。慢是把错误挡在决策前。独自写完再信,快的是字,慢的是事后纠错。事后纠错在公开研究里丢脸,在内部决策里可能已经花钱。

建设者该把质询实例做成产品默认。部署研究助手的人该禁止单对话提交。单对话提交,当未验收。

若只能改一处:先加「另一实例只许找洞」的必经步骤。找不到三条实质洞,也要写「已找、未发现」并抽样人工复查。复查为零,流程作废。

半人马不是诗。它是把人的判断力和模型的检索、起草、挑洞拼成一条可验收的链。链上缺质询、缺签字、缺开放题,拼出来的只是更长的自动完成。

开放题要故意让来源打架。打架时看它会不会藏冲突、会不会只引用顺你的那一侧。藏冲突记失败。失败比流畅的单叙事更有信息量。

人的签字不能变成盖章。签字人必须能不看稿口头复述三条限制。复述不出,报告未验收。未验收的字数再多,也只是中间产物。

偏见提示不只是政治。指定结论、指定敌人、指定必须引用的来源,都是偏见。翻转率要按这类提示报,不要只报中性题。中性题稳、指定结论就倒,现场研究多半是指定结论。

质询实例禁止看见主笔的自我评价。看见了会跟着吹。只给主张列表和来源列表,让它打。打完再把主笔限制和质询并排给人看。人看并排,才叫签字,不叫盖章。

结论:测一起能干完什么,不要只测它自己会不会

开放现场靠耐心、技巧和拆开的质询。考场分不覆盖乱中间地带。协作产出才是验收对象。仍用会或不会去买助手,买到的是提示运气。

你下次收研究助手的成绩单,先问开放题人机流程在哪。没有流程,分数退回。

效率龙虾 会带着下面这段开聊

按文章《能力不是会或不会是你会不会用:必须测人机一起干完开放题》把卡点收成可执行步骤:先做什么、别踩哪条、怎么验证。

用效率龙虾试这篇

本文侧重全链路风控方法论。落地时请用自身业务单据做回放验证,不要把示例阈值直接当生产策略。 相关:风控体检 · 方案资源

常见问题 FAQ

什么是AI评测中的「半人马现场」?

「半人马现场」指人机协作完成开放题的评测场景,强调主笔和质询拆开。主笔负责起草,质询专门找洞,最后验收签字报告。这样避免了单对话闭环迎合自己,更贴近实际生产中的协作产出,而不是模型单独得分。

为什么问「模型会不会」是错误的评测方式?

因为能力不是简单的会或不会。开放题没有标准答案,需要人机协作,包括检索、对照、放弃死路。同一模型在不同提示或人干预下结论可能翻转,所以评测应关注人机一起能干完什么,而非模型单独能力,否则买到的只是提示运气。

如何把AI评测从考场转成半人马现场?

文章提出五步法:首先,开放题必须进入评测套件;其次,主笔和质询实例强制拆开,质询只找洞不许润色;第三,测试提示敏感性,中性与偏见提示对照;第四,验收看签字报告,关键主张有来源;第五,能力声明必须带流程定语,否则作废。

评测AI开放题时常见的陷阱有哪些?

陷阱包括:单对话闭环导致迎合自己;流畅的错,即输出看起来完整但实际有漏洞;无流程的能力声明,声称好但不可复现;偏见提示未测试,如指定结论时模型可能隐藏冲突;验收只看字数,忽视主张和来源的质询。

模型单独评测和人机协作评测有什么区别?

模型单独评测只测独立能力,但在开放题中漏洞多,易受提示影响;人机协作评测验收签字报告,主笔和质询拆开,质询找洞更准,聚焦于人机一起能完成的成果。前者像考场分数,后者像岗位产出,更贴近企业实际决策需求。

读完这篇文章后,企业应该采取什么行动?

企业应将质询实例做成产品默认,例如在研究助手中禁止单对话提交;在评测中加入开放题,测试人机协作流程;能力声明必须带流程定语,确保可复现;并重视质询步骤,找不到三条实质洞也要人工复查,以挡住决策前的错误。