先给结论:长文问答评测不能只看像不像标准答案。短段落还好办,文档一长,无关细节会把证据埋住,证据会落在开头、中间或文末,多跳还要把分散的事实拼起来。字面重合会惩罚换了词的正确回答,也会奖励又长又空的段落。要把忠实和有用分开测,还要测它会不会说「文里没有」。
为什么「对上了几个词」不是问答质量
痛点是把翻译任务的尺子拿来量问答。问答的正确说法很多,参考答案只是其中一种。词重叠低,不代表错;词重叠高,也可能在抄一段不相干的原文。长文档把这件坏事放大:窗口里噪音更多,胡编的空间更大,开放题更没有唯一写法。
忠实是答案是否只靠给定文本。法律、合同、病历、保单尤其要钉这一点。忠实不等于正确:常识上对、但和这份文件相反,仍算不忠实。用户要的是「按我这份文件答」,不是「按世界上通常怎么规定答」。忠实还包括会说没有。文里没有还编,是假阳性;文里有却说没有,是假阴性,常常来自检索失败或长窗口注意力不够。有引用时,还要测引用的那段是否真的支撑这句话。
有用是相关、够细、但够短。一句忠实的「见条款四十二条」对用户没用。整段粘贴也不算有用。领域专家更看重又忠实又完整,众包更看表面的短和细。做给专家用的系统,要偏完整和忠实,不要只优化读起来舒服。
五步把长文问答评测从词重叠收成门禁
- 先分两维。忠实一列,有用一列。禁止合成一个「质量分」。两维正交:可以忠实但没用,也可以听着有用但在胡编。
- 问题要多样。事实抽取、定义、概括、推理、以及文中没有的题,都要有。只用「谁是主角」测不到合成,只用主题题测不到拒答。
- 证据位置是因子。开头、中间、文末、跨节、跨文档,都要覆盖。有的模型中间丢失,有的在十万字之后才掉。不扫位置,分数是在测运气。
- 人标用来校准生成判官,不拿来每次都标。忠实按原子断言拆开核对;有用用对决:哪一条更贴、更全、更短。细则要短,要有资格任务,要看人与人是否一致。专业域用专家,不要只用众包。
- 按自己的文档建套件。公开基准会进训练,只能当方法参考。叙事、论文、多文档财务法律,题型不同,不要拿小说题当合同题的发布条件。
| 观察 | 误读 | 工程含义 | 门禁 |
|---|---|---|---|
| 词重叠很高 | 答得好 | 可能又长又空 | 看忠实断言和有用对决 |
| 常识正确 | 可以过 | 可能和文件相反 | 忠实优先 |
| 加了检索分数掉 | 检索没调好 | 证据散在多份里会被剪断 | 按题型决定是否检索 |
| 中间答错 | 模型笨 | 位置偏差 | 位置分列 |
| 开放题对不上参考 | 生成失败 | 参考不是唯一写法 | 对决而不是重合 |
现场有三条。其一,造题不要让模型对着全文随便出题。那样容易出能从一句里抠出来的浅题。更好的办法是先让人只看摘要或简介出题,再让系统对着全文答。这样题会逼整篇理解,而不是局部抽取。模板题和自由题都要,接受率要人工过,不要全收。
其二,生成判官要校准后再用。把答案拆成断言,逐条对原文,能给出部分分,也能分开「胡编」和「没找到」。有用用细则或对决,并对准人的选择。字面重合和人判断经常对不上,尤其答案长短差得远的时候。对决比绝对打分稳,人也更好标。
其三,多文档题上,先检索再读,可能把需要一起看的证据剪断。单点查找也许还能涨,比较、聚类、多步推理常常会掉。检索是实验因子,不是默认加速器。题型要分列报,禁止用单点查找的涨幅给合成题背书。
度量七件事:忠实和有用是否分列、会不会说没有、问题类型是否多样、证据位置是否扫过、人标是否用来校准、公开基准是否只当参考、检索是否按题型开关。七件说不清,长文评测是在测谁更会叠词。叠词不能当上线条件。
有人会说窗口已经足够长,位置不必测。足够长的是标称窗口,不是有效注意。标称窗口能塞进去,不代表中间和文末还在被读。位置分列是在测有效注意,不是在刁难。
拒答也要分错。不该答却答了,是胡编;该答却拒了,是漏检。两档混成「安全」,会把漏检写成谨慎。漏检在长文档里很常见,因为检索没拿到段,或注意力没落到段。分档才能决定是补检索还是补阅读。
引用准确是更细的忠实。答对了但引用指错段,说明它不会指路。答错了但引用对,说明阅读坏了、检索也许还在。两档修复路径不同,禁止合成。
造自己的套件时,问题要像用户会问的,不要像考试会出的。用户问的是「逾期会怎样」,不是「第四条的编号是什么」。评测题不像用户题,优化就会朝着考试走,产品仍答不像人话。
结论:长文问答要两把尺子,还要会说没有
忠实和有用分列,位置当因子,字面重合退场,检索按题型开关。还把词重叠写成质量,是把参考答案的用词当成唯一真理。
你下次看长文问答分数,先问会不会说没有、中间和文末掉了多少。两问答不清,分数只证明开头好答。
本文侧重全链路风控方法论。落地时请用自身业务单据做回放验证,不要把示例阈值直接当生产策略。 相关:风控体检 · 方案资源
常见问题 FAQ
长文问答评测中的‘忠实’具体指什么?
忠实是指答案是否完全基于给定的文本内容。比如在法律文件、合同或病历中,用户要求的是‘按我这份文件答’,而不是按常识答。如果文里没有信息却编造,就是假阳性;文里有却说没有,就是假阴性,常来自检索失败或注意力不足。忠实还包括会正确引用支撑段落,确保引用能真正支撑答案。
为什么词重叠高不能直接代表问答质量好?
因为词重叠可能奖励又长又空的段落,而正确答案可能换了词但意思对。长文档里,无关细节多,胡编空间大,词重叠低不一定错,高也可能抄了不相干的原文。字面重叠会惩罚灵活表达,同时放大长窗口里的噪音问题,所以需要分开测忠实和有用。
如何将长文问答评测从依赖词重叠优化为可靠门禁?
文章建议五步:先分忠实和有用两维,不合成质量分;问题要多样,覆盖事实、定义、推理等;扫证据位置,如开头、中间、文末;用人标校准生成判官,用对决法评测有用;按自己的文档建评测套件,不依赖公开基准。这样能更准评估,避免字面重合误导。
长文问答评测主要适合哪些用户或场景?
适用于法律、合同、病历、保单等需要高忠实度的文档。领域专家更看重忠实和完整,众包用户可能偏表面短细。做给专家用的系统要偏完整和忠实,不要只优化读起来舒服;普通用户场景则需平衡相关性和简洁性。
评测长文问答时,有哪些常见陷阱需要避免?
陷阱包括:只关注开头答案,忽略中间和文末位置;检索可能剪断多证据文档;用合成质量分混淆忠实和有用;参考答案不是唯一写法,不能只靠字面重合;人标不校准导致误判。需分列评测位置和题型,避免把漏检误判为谨慎。
在长文问答评测中,‘忠实’和‘有用’有什么区别?
忠实关注答案是否只基于给定文本,确保不编造;有用关注答案是否相关、够细且简洁。可以忠实但没用(如只引用条款),也可以有用但不忠实(如胡编)。评测时要分开两维,用对决法比较哪个更贴、更全、更短,确保两者都达标。