Dan Luu 写系统问题时,习惯先测量、再对照、最后才下结论。把「I could do that in a weekend!」放到智能体、评测和线上系统里,真正要问的是:默认做法会不会系统性失败。下面用中文整理成可执行的工程笔记,去掉原站导航和无关链接。
Correction
I can't think of a single large software company that doesn't regularly draw internet comments of the form “What do all the employees do? I could build their product myself.” Benjamin Pollack and Jeff Atwood called out people who do that with Stack Overflow. But Stack Overflow is relatively obviously lean , so the general response is something like “oh, sure maybe Stack Overflow is lean, but FooCorp must really be bloated”. And since most people have relat
A few years ago, in the wake of the rapgenius SEO controversy, a number of folks called for someone to write a better Google. Alex Clemmer responded that maybe building a better Google is a non-trivial problem . Considering how much of Google's $500B market cap comes from search, and how much money has been spent by tens (hundreds?) of competitors in an attempt to capture some of that value, it seems plausible to me that search isn't a trivial problem. But
落地时建议先做的 5 件事
- 用自己的真实负载测,而不是只用公开榜或厂商数字。
- 把评测设计成能抓到失败模式:平均分好看但尾部崩溃,仍然算失败。
- 智能体默认不会好好用测试;要写进流程,而不是写在口头规范里。
- 性能和正确性都要有基线,改模型或改语言前后必须能对比。
- 结论写成可回滚的决策:哪一版配置、哪一版评测集、谁签字。
和智能体产品怎么接
龙虾PRO做 OpenClaw 落地时,同样吃「先测量再扩面」这条纪律:技能、数字员工和网关都要有可复现评测,而不是只看一次演示通过。
本文侧重全链路风控方法论。落地时请用自身业务单据做回放验证,不要把示例阈值直接当生产策略。 相关:风控体检 · 方案资源
常见问题 FAQ
为什么'我周末就能做完'这种想法在软件工程中经常是错觉?
文章指出,像Dan Luu强调先测量再下结论。以Stack Overflow看似精简但Google搜索涉及复杂问题为例,低估系统复杂度会导致系统性失败。这类错觉忽略了工程中的大量细节和优化需求,容易高估自身能力。
落地AI智能系统时,应该先做哪5件事来避免错误?
文章建议:先用自己的真实负载测试,而非依赖公开数据;设计评测以捕捉失败模式,如尾部崩溃;将测试写入流程,而非口头规范;设置性能和正确性基线,方便对比;将结论写成可回滚的决策,包括配置和评测集版本。
文章中'和智能体产品怎么接'部分主要讲什么?
这部分以龙虾PRO/OpenClaw为例,强调在落地时必须遵循'先测量再扩面'原则。技能、数字员工和网关都需要可复现评测,而不仅仅是演示通过一次就认为成功,确保评测的持续性和可靠性。
在构建智能体系统时,常见的陷阱是什么?
陷阱包括只用公开榜单或厂商数字测试,而非真实负载;关注平均分但忽略尾部崩溃;测试只写在口头规范中,未融入流程;缺乏性能和正确性基线对比;决策不可回滚,导致难以修正错误。这些都会让系统看似成功实则失败。
为什么在开发AI系统时强调先测量再下结论?
因为系统可能表面简单实际复杂,如Google搜索背后有巨大工程投入。测量能提前发现失败模式,确保正确性和性能,避免基于错觉的决策。Dan Luu的习惯就是先测量、再对照,这在智能体评测中同样关键。
与传统方法相比,文章推荐的AI系统开发方法有什么不同?
传统方法可能依赖口头规范或单次演示,而文章推荐将测试写入流程,用真实负载评测,并设置基线。例如,龙虾PRO/OpenClaw要求可复现评测,而非只看一次演示通过,强调持续测量和回滚机制,以提升系统可靠性。