-
推理训练正在按十倍跳,一旦追上预训练总量,增速会掉回每年大约四倍
第一代到下一代推理模型,训练量大约十倍、只隔四个月。这条斜率不可能一直快过总训练算力。碰上天花板之后,推理阶段会变成总账里的大头,而不再是小修补…
-
智能体榜单分差,往往出在脚手架和接口,不在模型本身
换一套命令行架子,同一模型在编程榜上能差十一个到十五个百分点。接口抖动则是评测事故的第一来源,新模型中招更重。
-
智能体把上下文拉长,全球推理吞吐会先被吃光,不是芯片还没造出来
八千进一千出还能撑;拉到十二万八,同样一批高端芯片的吞吐能掉一到两个数量级。编程智能体一旦全员按大厂强度用,长窗口会先撞墙。
-
写代码从来不是瓶颈:智能体压扁的是中间层,两端的决定和交付仍要人扛
十万开发者的数据显示,行数能涨八倍,发布只多三成。真正卡住的是定规格和为结果负责。随手生成和带监督的工程,不是同一件事。
-
准确率涨得快、可靠性几乎没动:智能体不能只报一次平均成功率
同事可靠,不只是多数时候做对。还要同一题反复稳定、条件变了不垮、知道自己没把握、错了也不把局面搞砸。十八个月里能力榜涨得猛,这四项只缓缓挪了一点…
-
榜单饱和测不出能不能上架:开放世界评测要记人工插手、日志和花费
能自动判分的任务也能被专门刷。把应用签上、填表、过审,才是脏活。一次上架大约一千美元,真正写应用只要二十多,其余多半在刷状态。
-
厂商演示不是评测:一千行提示词和没公开的日志,撑不起「一条指令做出系统」
声称单条提示、九百美元、几十个子智能体做出操作系统。提示词其实长达数千行,人工标准没定义,代码和日志也不公开。花费数字有用,故事不能当证据。
-
会刷可验证题,还不等于会做开放研究:智能体缺判断、不会回头、也花不完预算
把未发表论文的研究问题交给前沿智能体,给足接口费和六天墙钟时间。原作者两篇都拒了。方向起得漂亮,很快被劣质或合成数据劝退。
-
模型答非所问时错误率仍是零:智能体故障要记决策链,不能只记成不成功
幻觉、检索漏召回、上下文被截断,都不会变成异常码。智能体循环调工具、中途改计划,成功失败二元状态完全不够用。要把每次推理拆成可检索的环节。
-
评估分数要写回同一条链路:低分样本才能一跳看到检索和词用量
提供方、模型、输入输出词数应成为标准属性。编排、检索、推理、工具四段同树。评估结果挂在模型那段上,改进提示词才有可复现的输入。