产业现在几乎只报一个数:任务平均成功率。这个数两年里涨得很快,所以部署热情很高。航空和核电几十年前就分开了:平均表现不是可靠性。可靠性至少四块——同一条件下反复做对、条件变差时不散架、没把握时说出来、失败时伤害有界。把它们拆成十二项指标,用通用助手和客服模拟两套任务,十四个模型、十八个月的版本,每题跑五次并改写指令,再给工具注入故障、问它有多确信。能力涨得明显,可靠性只缓缓挪了一点,三家主流提供方挤在一起,像是行业共同短板。

一致性最难看:能做对的任务,原样再跑一遍也常翻车,结果稳定大约三成到七成五。真正的宕机和超时多数还能撑住,但把指令换成同义说法,成绩会掉一大截。校准几乎全军覆没:报出的把握经常没有信号,有的任务上区分对错不比瞎猜强。安全这边,新模型更少硬闯约束,但算错钱、收错费仍常见。更大的模型并不处处更稳:校准和鲁棒性可能更好,一致性反而更差,行为空间一宽,两次运行更容易分叉。

有人说准确率到百分之九十九,剩下百分之一不可预测也能忍。高风险无人值守做不到。那种场景要的是三个到五个九,现在的语言模型智能体看不出在往那个门槛走。不可靠每降一个数量级,难度大致相当:从九成到九成九,不会比从九成九到九成九九轻松。辅助工具可以打折——有人审输出;无人值守的流程不能打折。发布前要有可靠性门槛,失败要有事故记录文化,内部评测必须贴自己的数据和场景。

落地清单

  • 评测至少多跑几次、换说法、注入故障,同时交可靠性和准确率,不要只交一次满分。
  • 优先补一致性和校准:失败时能认、能停、能恢复,比再刷平均分更值钱。
  • 辅助和自动化分开设门槛。创意助手可以不稳定;管钱、管工单的流程不行。
  • 别假设「模型变大自然更稳」。有的维度会随规模变差,要分开盯。

能力榜解释不了为什么经济影响来得慢。可靠性是另一根轴,不单独做,部署会一直停在演示。

效率龙虾 会带着下面这段开聊

按文章《准确率涨得快、可靠性几乎没动:智能体不能只报一次平均成功率》把卡点收成可执行步骤:先做什么、别踩哪条、怎么验证。

用效率龙虾试这篇

本文侧重智能体生命周期与技能边界。若你要动手验证,优先用 Playground 做小任务压测;权限与托管再单独规划,避免「先装一堆再治理」。 相关:Playground · 创建智能体 · 学习中心

常见问题 FAQ

什么是智能体不能只报一?

「智能体不能只报一」可概括为:同事可靠,不只是多数时候做对。还要同一题反复稳定、条件变了不垮、知道自己没把握、错了也不把局面搞砸。十八个月里能力榜涨得猛,这四项只缓缓挪了一点。 本文从定义、方法与实践要点展开说明。

为什么要关注智能体不能只报一?

关注智能体不能只报一,是因为它直接影响效率、风险与可复制性。文中指出:一致性最难看:能做对的任务,原样再跑一遍也常翻车,结果稳定大约三成到七成五。真正的宕机和超时多数还能撑住,但把指令换成同义说法,成绩会掉一大截。校准几乎全军覆没:报出的把握经常没有信号,有的任务上区分对错不比瞎猜强。安全这边,新模型更少硬闯约束,但算错钱、收错费仍常见。更大的模型并不处处更稳:校准和鲁棒性可能更好,一致性反而更差,行为空间一宽,两次运行更容易分叉。

如何落地智能体不能只报一?有哪些关键步骤?

建议按以下路径推进智能体不能只报一:1) 评测至少多跑几次、换说法、注入故障,同时交可靠性和准确率,不要只交一次满分。;2) 优先补一致性和校准:失败时能认、能停、能恢复,比再刷平均分更值钱。;3) 辅助和自动化分开设门槛。创意助手可以不稳定;管钱、管工单的流程不行。;4) 别假设「模型变大自然更稳」。有的维度会随规模变差,要分开盯。。细节见正文对应章节。

智能体不能只报一适合哪些人或团队?

智能体不能只报一更适合:产品/技术负责人、运营与增长团队、需要落地智能体或自动化的中小团队、关注「AI智能系统」方向的读者。若你只需要单次聊天式问答,可先读概念;若要上生产,请重点看步骤、权限与风控相关段落。

关于「落地清单」,本文给出了什么结论?

「落地清单」是理解全文的关键切片:建议先读该节的结论句与列表项,再对照前后章节形成闭环。

实践智能体不能只报一时常见误区有哪些?

常见误区包括:① 只追工具不建流程;② 没有权限/审计边界就上生产;③ 缺少指标与回滚方案;④ 把演示效果当成稳定 SLA。针对智能体不能只报一,请以正文中的检查清单与约束条件为准,小范围验证后再扩面。