前沿
大家大概有个共识:AI 时代,测试更重要了。写代码的智能体(能自己多步干活的写代码 AI)跑得飞快,如果没有一套说得过去的测试体系,去评价它的产出、把结果再喂回去,很快就会变成「写得快、错得也快」。
所以很多人会觉得:搭一套比较完备的测试体系,让 AI 自己用上,甚至把「会建测试」当成核心竞争力——这听起来很对。
问题是:你真让它自己加上那些「高大上」的测试名号(测试驱动、属性测试、形式化验证、热门 skill……),交付会更好吗?
Dan Luu 跑了一场挺硬的实验。答案很扫兴:大多时候,喊名字没用;有的还不如什么都不加。
链接
原文:https://danluu.com/agentic-testing/
他是谁
Dan Luu(@danluu)是工程圈里偏「用数据打脸常识」的老牌博主,站上自称长期有百万级月访问,不少课和 Stack Overflow 会引用他的文。
履历上常被提到的是:待过 Google、Microsoft、Twitter 一类大厂;在微软参与过 Bing 的 BitFunnel(用签名/布隆过滤器做检索,SIGIR 最佳论文相关工作)。平时爱写性能、工程文化、事故复盘,以及各种可复现的小实验。
X 上大约四万七粉丝。这类人发实验文,读者通常不是来吃瓜,是来当证据用的。
这篇火了吗
不算病毒帖,但已经进了正经程序员讨论场。
• Hacker News:当天上首页,大约一百一十分、四十多条评论。
• 作者本人发帖:大约两万四千展示、一百七十多赞、一百六十多收藏——技术长文里这已经能打。
• 实质反馈:Hypothesis / Hegel 相关的 David MacIver 公开说「Dan 说得对,Hegel skill 现在确实不行」。作者自己也写过:很多文只要把缺口测出来,就能逼人去改。
一句话:流量中等偏上,但「会被认真工程师当证据」的那种影响更实在。
HN 讨论:https://news.ycombinator.com/item?id=49605246
作者发帖:https://x.com/danluu/status/2096985911036932327

原文标题与开篇
他测了啥
不是发产品,是做实验:在 Codex + GPT-5.6 Sol(medium / xhigh)上,让智能体用 Rust 实现 Zstd,再往提示词里加各种「测试加成」。
加成一长串:测试驱动(TDD)、QuickCheck、属性测试、模糊测试、Lean、TLA+、Verus,还有各种 skill、Default(不加额外测试指令)、「make no mistakes」之类。评测用的是隐藏测试集;每种条件跑了很多轮。
结果一句话
没什么方法能大幅甩开别人;反倒是 Default——什么测试口号都不喊——成绩在平均线之上。

原文总结果图:横轴大致是成本,纵轴是全过隐藏测试的比例(作者自己也说这图很乱)

原文对结果的说明
几个现象
• 智能体默认不太会测:自己写的弱测试容易过,真 bug 照样漏。高努力档上,自家测试往往能绿,但测得浅。
• 点名 fancy 技术,经常只用到皮毛:形式化验证去证无关性质;属性测试 / 模糊测试爱砸随机无效输入,或只查很 trivial 的性质。
• TDD 如作者事前预感,表现偏弱——测试变多了,但不一定更贴硬 case。
• 热门测试 skill(含星标极高的 ECC)并不神奇,有的还拖后腿;作者随手写的短 skill 反而略好一点,因为它在 nudge 默认坏习惯,而不是塞教程。
• 「make no mistakes」基本像没说;作者认为它不会赢过 Default。
那平时怎么办
口号不如结构。作者自己的经验是:先帮智能体搭一套说得过去的测试 / 分流架子,再让它往里补,比只喊技术名靠谱。属性测试、模糊测试这类,给具体怎么生成「有意思」的输入,比只甩库名有效。
看完一圈,更像是:模型里大概有怎么测的知识,但默认不会拿出来;只报技术名推不动,轻轻把工作流掰正,反而更容易用上。
再贴链接
原文:https://danluu.com/agentic-testing/
HN 讨论:https://news.ycombinator.com/item?id=49605246
依据 Dan Luu 原文;影响力数字截至 2026-09-08;模型与 harness 按文中 Codex + GPT-5.6 Sol。未群发,仅草稿。