人工智能预测准不等于能当政策。宣传爱从图像识别百分之九十几、语音错误率几个点,直接跳到自动外科和虚拟律师。中间缺一问:准确预测何时够用来指导行动。2026年病理切片分布稳、行动几乎不改未来样本,监督就够。放贷、雇佣、保释是在部署激励,对方会改鞋、改答法来迎合分数。
人工智能商业故事很顺,痛点在把「会预报」写成「会办事」
三类问题。监督:从带标签样本挖预报器,撑起当下几乎所有能赚钱的应用。无监督:不靠标注的一篮子任务。强化:在环境里靠可能稀疏的奖励学行动。只有强化真正关心模型去做什么,可它学得慢、不稳、环境稍变就脆,多数现场还用不上。于是人们把监督硬塞进需要行动的位子。
病理助手:附近区域血样进来,氧合会让颜色变,但分布在年月尺度上稳。结核长什么样不会明显漂移,病理医生的标签也不大会改未来图像的分布,反馈环弱。仪器稳定时,混淆矩阵和真实目标对齐,这是监督的理想题。若方法能显著超过人在关键显微诊断上的准确率,不部署反而可能不负责任。
放贷则另一套。用历史申请人及其结果训练,输入可以是能拿到的所有属性,标签是是否违约或收回比例。回测很好看,不等于能估「旧政策根本不会批」的人。消融还可能发现鞋款贡献了一大截:买牛津鞋的人更可能还。红旗。部署后人们会改买鞋来骗分。有人建议把模型藏起来防被玩。从安全角度看这几乎是最蠢的:不能靠图纸永不落地来防攻击。再挖下去,虚假相关还会撞上公平概念。文献里修补社会兼容的办法很多,常没打到点上:把预报器扔给复杂社会问题这件事本身才是问题。你部署的是政策,决策构成激励,会操纵周围人的行为。
保释、雇佣同理。对方按激励调整,不是在愚弄系统,是在对激励做自然反应。知道自己在干什么,就该只激励有益的调整。是不是该扔掉大数据预报、改用我们自以为懂机制的简单规则?有些题也许该。是不是该做能理解自己在跟什么机制互动的工具?听着好,还早。核心技术和哲学问题可推进,但误用会先变得更严重。冲得最快去扩大用途的人,往往最不考虑负责任。
人工智能预测转行动2026五步:先问反馈环,再问激励,再谈能不能上
- 行动会改未来样本分布,不准把监督预报直接当政策。
- 只在历史批准集上训练,不得估计从未被批准的人。回测省钱数作废。
- 消融出现鞋款、字体、答题套路一类可被改的特征,模型不得驱动决策。
- 靠保密防被玩,方案作废。激励必须假设对方看得见规则。
- 强化未稳之前,高风险行动位不准用「我们有预报器」代替。
| 场景 | 分布 | 行动是否改样本 | 2026门禁 |
|---|---|---|---|
| 显微病理 | 年月尺度稳 | 几乎不改 | 监督可用 |
| 放贷 | 政策一变就漂 | 申请人会改行为 | 预报器不当政策 |
| 雇佣筛选 | 简历会被优化 | 会改写法 | 按激励设计 |
| 保释评估 | 历史逮捕有偏 | 决策改变未来标签 | 禁止天真回测 |
| 强化控制 | 环境稍变就脆 | 本就是行动 | 多数现场还不可用 |
上表对应「预测何时够资格指导行动」。病理那一列是监督的舒适区。放贷那一列是政策。把舒适区的准确率抄到政策列,就是宣传里的手法。
两处只有对着真实名单才清楚。其一,回测省下的钱来自「假如过去用这套也会批同样的人」,可新模型会批另一群人。其二,鞋款这种特征在实验室里是增益,在街上是攻略指南。
建设者该把反馈环写成上线第一问。管风控的人,该拒收只有历史准确率和省钱回测、没有激励分析的放贷方案。没有激励分析,分数是在训练对手。
结论:人工智能能预报,不等于已经有了一套只激励有益行为的政策
分布稳才能监督。行动改样本就不是预报题。可被改的特征不能驱动决策。保密防不了被玩。强化未稳别硬上。仍用识别率跳到自动律师,中间那一问会被现场用鞋款回答。
你下次听「准确率已经超过旧政策」,先问部署后对方会改什么、未批准人群怎么估;两问答不上,回测金额先不要进材料。
现场还要防口号替换验收。把「已经可解释、已经公平、已经能当政策」写成周报,不等于消融对上了增益来源、预测没有改对方行为、代理目标没有跑偏。周报可以写,门禁必须绑在对照表和分列指标上。
若只能改一处:先把「分数好看」从唯一成功标准里拿掉。演示可以记,消融、激励、数据缺口、策展责任四件跟不上就算事故。
现场还要防口号替换验收。把「已经可解释、已经公平、已经能当政策」写成周报,不等于消融对上了增益来源、预测没有改对方行为、代理目标没有跑偏。周报可以写,门禁必须绑在对照表和分列指标上。
若只能改一处:先把「分数好看」从唯一成功标准里拿掉。演示可以记,消融、激励、数据缺口、策展责任四件跟不上就算事故。
本文侧重全链路风控方法论。落地时请用自身业务单据做回放验证,不要把示例阈值直接当生产策略。 相关:风控体检 · 方案资源
常见问题 FAQ
为什么人工智能预测准确度高,却不能直接用于政策制定?
因为预测只描述历史规律,而政策会改变人的行为,从而改变未来数据。比如放贷模型用历史数据训练,一旦部署,申请人会为了获批而调整行为(如买‘好’的鞋),导致预测失效。文章强调,只有像病理诊断这类‘反馈环弱’(行为不改未来样本)的领域,监督学习的预测才相对可靠。
文章为什么说病理诊断是监督学习的理想场景,而放贷审批却不是?
关键在于‘反馈环’强弱。病理切片的分布(如结核特征)在年月尺度上稳定,医生的诊断标签也不会改变未来图像的分布,所以模型预测准确。而放贷是政策,决策直接激励申请人改变行为(如优化简历、更换特征),导致用于训练的历史数据与未来数据分布不同,预测模型会失效。
为什么仅凭历史数据回测来评估放贷模型是危险的?
因为历史回测只能验证‘如果过去用新模型,对已批准的人效果如何’,但无法评估新模型会批准哪些‘旧政策下从未批准的人’。更危险的是,模型可能学到‘鞋款’这类可操纵的特征,部署后会激励全社会去‘骗分’,把预报器变成了一个容易被攻击的政策漏洞。
在评估一个AI放贷模型时,应该优先分析哪些关键问题?
遵循文章的五步法:第一步,问决策是否构成‘反馈环’,即申请人行为是否会改变未来数据分布。第二步,分析模型依赖的特征是否是‘可被改的’(如答题套路),如果是,则绝不能用于驱动决策。第三步,评估模型是否会对历史未通过人群做出有效且公平的估计。
文章认为2026年人工智能在哪些高风险领域还不能直接替代人类决策?
在保释评估、雇佣筛选等高风险领域。因为这些场景的决策会直接激励对方调整行为(如优化简历、改变供述),属于典型的‘政策’而非简单预测。文章表格指出,目前强化学习在这些‘本就是行动’的场景中仍不稳定、脆弱,不能用‘我们有预报器’来硬上。
根据文章,AI系统的建设者和风控管理者各自应该承担什么责任?
建设者应把‘反馈环’分析作为系统上线的第一问,不能只报告历史准确率。风控管理者应拒收缺乏激励分析的方案,因为没有分析就等于在训练对手。双方都应把‘分数好看’从唯一成功标准中移除,重点审视消融分析、激励影响、数据缺口和策展责任。