先给结论:自动化进度不该只报题库准确率。把软件任务标成专家做完要多久,再找模型一半能完成的那个时长,这才是时间视野。大约每七个月翻一倍;时长每翻一倍,过关率大致掉一截。最新一档大约五十分钟量级一半成功。有清晰反馈的任务涨得快,脏现场会在一小时附近掉下去。趋势若还在,月级软件工程自动化会在几年内进入窗口,但趋势可能断。

为什么题库准确率会把「能替人盯多久」问错

痛点是量纲。准确率把十分钟的函数题和三天的重构焊成一个百分比。业务要的是:这个系统能不能不间断地做完一件专家要做一小时、一天、一周的事。时间视野把能力换成工时。百分之五十视野是中位线,不是「已经能稳定交付」。过关率随时长加倍而下降,说明拉长任务不是多几道同类题,而是失败在累积:工具用错、中间步走偏、没有人在环里把它扳回来。

2019 到 2025 一串前沿模型画在工时轴上,视野大约每七个月翻倍。推理、工具、出错后还能改,是上涨的主要来源。但真实软件很少像基准那样步骤清楚、测试齐全。脏现场缺反馈环,成功曲线会在大约一小时处一起掉。用题库准确率外推「已经能替工程师上班」,会把还过不了脏一小时的系统写成已经能做月级项目。

五步用时间视野做能力门禁,而不是做营销曲线

  1. 任务先标专家工时。同一套任务,找熟悉代码库的人做,记下墙钟。标不出工时的任务不准进视野曲线。工时要含定位、改错、跑测试,不含开会。
  2. 主指标用百分之五十视野,辅指标用百分之八十视野。一半成功是「开始有用」;八成才接近可交接。只报五十,会把偶然做完的长任务写成能力。
  3. 按是否有清晰反馈拆开画。单元测试齐全的合成任务一条线,要读脏日志、要猜需求的现场任务另一条。两线差一个数量级,权限按短的那条给。
  4. 翻倍趋势当情景,不当承诺。每七个月翻倍若延续,月级软件任务大约在几年内进窗口。情景要写断点:数据墙、工具墙、脏现场墙。断了就停用外推,不准把旧斜率写进三年规划。
  5. 权限跟着视野走,不跟着准确率走。视野还在一小时内,禁止把跨天的生产改动交给它单独收尾。视野涨了,合成监控和关停演练要按新时长重做,因为长任务给了更多作弊步骤。
指标 在量什么 容易骗过的方式 怎么用
题库准确率 短题对错 刷同类短题 只作辅看
百分之五十视野 一半能完成的专家工时 只测有测试的干净任务 能力主指标
百分之八十视野 更接近可交接 人工收尾被算进成功 上线门禁更该看这条
脏现场视野 没有清晰反馈时还能走多远 用合成任务冒充 权限按这条的短板给
翻倍斜率 视野随日历变快 把断了的趋势接着画 情景规划,附断点

现场有三条。其一,成功定义要写死。测试绿了但需求理解错了,算失败。人在环里提示一次再做完,视野要打折,不能和全自动混报。其二,工时标尺会漂。专家变熟、仓库变乱,一小时不再是一小时。每季度用同一批人重标一小部分任务,曲线才能比。其三,视野翻倍时,控制协议的合成违规也要拉长:一小时的作弊和一分钟的作弊不是同一种。短任务里来不及谋划,长任务里来得及。

不要把「五十分钟一半成功」读成「可以交给它五十分钟的生产事故」。一半成功意味着另一半在中途烂掉,烂掉的那些往往更接近真实事故。交接标准至少用百分之八十视野,并且只在有反馈环的任务上。没有反馈环,先补测试和日志,再谈自动化。

若只能改能力看板一项:把准确率主图换成两条视野曲线,干净任务一条、脏现场一条。权限审批看短的那条。这一项能挡住用刷题进度去要生产权限。

视野曲线还要标注「人在环里的次数」。零次提示做成和三次提示做成,不是同一个点。把提示算进成功,视野会被人的工时偷偷垫高。日志里记下每一次人工介入,打折后再画,曲线才会和交接标准对得上。三次提示做成的「一小时任务」,在账上最多记成二十分钟视野,不能和全自动一小时混成一个点。

结论:自动化进度的单位是专家工时,不是题目百分比

时间视野把能力换成「能盯多久」。百分之五十是中位线,翻倍是情景,脏现场是短板。题库准确率把不同时长焊在一起,会把还过不了一小时脏任务的系统写成已经能做月级工程。权限跟短板走,趋势当情景,断了就停笔。

你下次报模型更强了,先报百分之五十和百分之八十视野,以及脏现场那条。只报准确率,就还没有自动化进度,只有刷题进度。

效率龙虾 会带着下面这段开聊

按文章《能力该用人类工时来量:一半能完成的任务时长才叫时间视野》把卡点收成可执行步骤:先做什么、别踩哪条、怎么验证。

用效率龙虾试这篇

本文侧重全链路风控方法论。落地时请用自身业务单据做回放验证,不要把示例阈值直接当生产策略。 相关:风控体检 · 方案资源

常见问题 FAQ

什么是时间视野?

时间视野是指在自动化任务中,模型能以50%成功率完成的专家工时长度。它衡量AI系统能持续处理多长时间的任务,而不是用题库准确率这种混合百分比。例如,专家需要1小时完成的任务,模型一半能完成,时间视野就是约50分钟,这更贴近业务中“能替人盯多久”的需求。

为什么题库准确率会误导AI能力评估?

题库准确率把不同时长的任务(如十分钟的短题和三天的长任务)焊成一个百分比,忽略了任务的实际工时。业务真正关心的是系统能否不间断完成专家级别的任务,而时间视野基于工时量化能力,避免了这种误导。用准确率外推,可能把过不了脏一小时的系统误写成能做月级项目。

如何用时间视野设置AI系统的权限门禁?

第一步,为任务标注专家工时(含定位、改错、跑测试,不含开会)。第二步,主指标用50%视野(一半成功表示“开始有用”),辅指标用80%视野(更接近可交接)。第三步,按任务是否有清晰反馈分开画曲线,权限审批时看短板,比如脏现场视野。这样能避免用刷题进度要生产权限。

使用时间视野时有哪些常见陷阱?

主要陷阱包括:只报50%视野而忽略80%视野,这会把偶然成功的长任务当成稳定能力;用合成任务冒充脏现场任务,导致权限过高;未记录人工提示次数,让视野被人的工时垫高;错误外推翻倍趋势,没考虑断点。例如,50%成功意味着另一半失败,生产环境至少要用80%视野。

时间视野和题库准确率在衡量AI能力上有什么区别?

题库准确率只统计短题的对错,适合刷题进度,但忽略任务时长和复杂度。时间视野基于专家工时,衡量系统能处理多长时的任务,考虑了真实环境如脏现场和反馈缺失。例如,准确率高但时间视野短,说明系统可能只能做简单短任务,无法完成跨天的工程。

如何改进AI自动化进度的报告方式?

下一步是将报告指标从题库准确率换成时间视野曲线,分别画干净任务(有测试)和脏现场任务(缺反馈)的两条线。权限审批基于短板曲线,并标注人工介入次数(如三次提示算20分钟视野)。翻倍趋势如每七个月翻倍应作为情景规划,附上数据墙、工具墙等断点,断了就停用外推。