目标系统没有稳定接口时,智能体只能看截图、点鼠标、敲键盘。这不是更先进的工具调用,是覆盖另一类问题的能力。有接口时,结构化调用更快更准更便宜;没接口、跨多个只有界面的老系统、低频但手工很痛时,才值得看屏幕。单次填表提交可能要十几轮截图推理,费用经常是同等接口调用的一百到一千倍,耗时按分钟计。

循环是截图、理解、行动、再截图。分辨率要归一化,否则同一按钮坐标全变。操作后要等界面稳定,再对照「预期看到什么」做自检。点错能返回、弹窗能关掉,才谈得上接近生产。坐标预测对小图标容易偏,把可点区域标号让模型选编号,小元素更稳,但多一次分割。浏览器场景用文档对象加截图,往往比纯像素准得多。公开桌面评测大约两年从一成五升到七成二,看起来越过人类基线,可评测任务对错清晰,真实任务常常含糊。若高风险场景要把失败压到百分之一甚至千分之一,当前大约三成失败还差一到两个数量级。验证码、通知、多窗口切换,很多不是把视觉模型做大就能消失的。

图形操作默认几乎什么都能点,权限是黑名单;工具调用默认什么都不能做,权限是白名单。白名单更安全。必须放进独立环境,网络只放行业务域,每步留下截图审计。特有风险是视觉注入:白底白字、屏幕外定位、极小字号,人看不见,多模态模型读得见。指令只认系统提示和用户输入,屏幕上的祈使句当不可信文本。高风险动作仍然要人点头。同一段界面操作跑稳之后,应沉淀成带参数的复合工具,从看屏幕退回调接口。

组织里同时跑几十上百个角色时,缺的不是更多业务代码,是平台。和微服务表面像,约束不同:成本按词计,一次会话是几分钟的循环,同一输入路径和消耗都不确定。接入层不能只限每秒请求数,而要按每分钟词数预估预扣、事后按实际结算。网关做统一调用、按复杂度选模型、主路径失败再降级。语义缓存对事实问答是金矿,对「我的订单」和实时余额是地雷,命中错缓存就是串数据。别在第一个演示阶段就按终局平台来建。先有一个能上线的角色、一套网关和日志,再抽注册中心和租户配额,让痛点推动分层。

落地清单

  • 子任务先查有没有结构化工具,没有再降级看屏幕,高风险看屏幕必须进人审。
  • 网关超时按分钟、按轮设置,短请求默认值会把长会话掐死。
  • 扩容看活跃会话和排队,不要看处理器占用——大量时间花在等外部返回。
  • 租户配额要原子预扣,重请求和轻请求的消耗可以差两个数量级。

有接口就走接口。看屏幕是兜底,不是默认。平台按词和会话来设计,才能在不确定的路径上把预算和故障隔离住。

效率龙虾 会带着下面这段开聊

按文章《没接口再看屏幕:图形智能体失败率还差一两个数量级》把卡点收成可执行步骤:先做什么、别踩哪条、怎么验证。

用效率龙虾试这篇

本文侧重智能体生命周期与技能边界。若你要动手验证,优先用 Playground 做小任务压测;权限与托管再单独规划,避免「先装一堆再治理」。 相关:Playground · 创建智能体 · 学习中心

常见问题 FAQ

什么是图形智能体失败率?

「图形智能体失败率」可概括为:公开桌面评测从一成五涨到七成二,高风险任务若要把失败压到百分之一,还差数量级。看屏幕比调接口贵一百到一千倍。平台要按词预扣,不能只按请求数限流。 本文从定义、方法与实践要点展开说明。

为什么要关注图形智能体失败率?

关注图形智能体失败率,是因为它直接影响效率、风险与可复制性。文中指出:循环是截图、理解、行动、再截图。分辨率要归一化,否则同一按钮坐标全变。操作后要等界面稳定,再对照「预期看到什么」做自检。点错能返回、弹窗能关掉,才谈得上接近生产。坐标预测对小图标容易偏,把可点区域标号让模型选编号,小元素更稳,但多一次分割。浏览器场景用文档对象加截图,往往比纯像素准得多。公开桌面评测大约两年从一成五升到七成二,看起来越过人类基线,可评测任务对错清晰,真实任务常常含糊。若高风险场景要把失败压到百分之一甚至千分之一,当前大约三成失败还差一到两个数量级。验证码、通知、多窗口…

如何落地图形智能体失败率?有哪些关键步骤?

建议按以下路径推进图形智能体失败率:1) 子任务先查有没有结构化工具,没有再降级看屏幕,高风险看屏幕必须进人审。;2) 网关超时按分钟、按轮设置,短请求默认值会把长会话掐死。;3) 扩容看活跃会话和排队,不要看处理器占用——大量时间花在等外部返回。;4) 租户配额要原子预扣,重请求和轻请求的消耗可以差两个数量级。。细节见正文对应章节。

图形智能体失败率适合哪些人或团队?

图形智能体失败率更适合:产品/技术负责人、运营与增长团队、需要落地智能体或自动化的中小团队、关注「AI智能系统」方向的读者。若你只需要单次聊天式问答,可先读概念;若要上生产,请重点看步骤、权限与风控相关段落。

关于「落地清单」,本文给出了什么结论?

「落地清单」是理解全文的关键切片:建议先读该节的结论句与列表项,再对照前后章节形成闭环。

实践图形智能体失败率时常见误区有哪些?

常见误区包括:① 只追工具不建流程;② 没有权限/审计边界就上生产;③ 缺少指标与回滚方案;④ 把演示效果当成稳定 SLA。针对图形智能体失败率,请以正文中的检查清单与约束条件为准,小范围验证后再扩面。