让 AI 自己加「高大上」的测试体系,交付效果还变差了?

机智流 2026-09-08 21:34

前沿

大家大概有个共识:AI 时代,测试更重要了。写代码的智能体(能自己多步干活的写代码 AI)跑得飞快,如果没有一套说得过去的测试体系,去评价它的产出、把结果再喂回去,很快就会变成「写得快、错得也快」。

所以很多人会觉得:搭一套比较完备的测试体系,让 AI 自己用上,甚至把「会建测试」当成核心竞争力——这听起来很对。

问题是:你真让它自己加上那些「高大上」的测试名号(测试驱动、属性测试、形式化验证、热门 skill……),交付会更好吗?

Dan Luu 跑了一场挺硬的实验。答案很扫兴:大多时候,喊名字没用;有的还不如什么都不加。

链接

原文:https://danluu.com/agentic-testing/

他是谁

Dan Luu(@danluu)是工程圈里偏「用数据打脸常识」的老牌博主,站上自称长期有百万级月访问,不少课和 Stack Overflow 会引用他的文。

履历上常被提到的是:待过 Google、Microsoft、Twitter 一类大厂;在微软参与过 Bing 的 BitFunnel(用签名/布隆过滤器做检索,SIGIR 最佳论文相关工作)。平时爱写性能、工程文化、事故复盘,以及各种可复现的小实验。

X 上大约四万七粉丝。这类人发实验文,读者通常不是来吃瓜,是来当证据用的。

这篇火了吗

不算病毒帖,但已经进了正经程序员讨论场。

• Hacker News:当天上首页,大约一百一十分、四十多条评论。

• 作者本人发帖:大约两万四千展示、一百七十多赞、一百六十多收藏——技术长文里这已经能打。

• 实质反馈:Hypothesis / Hegel 相关的 David MacIver 公开说「Dan 说得对,Hegel skill 现在确实不行」。作者自己也写过:很多文只要把缺口测出来,就能逼人去改。

一句话:流量中等偏上,但「会被认真工程师当证据」的那种影响更实在。

HN 讨论:https://news.ycombinator.com/item?id=49605246

作者发帖:https://x.com/danluu/status/2096985911036932327

让 AI 自己加「高大上」的测试体系,交付效果还变差了?图1

原文标题与开篇

他测了啥

不是发产品,是做实验:在 Codex + GPT-5.6 Sol(medium / xhigh)上,让智能体用 Rust 实现 Zstd,再往提示词里加各种「测试加成」。

加成一长串:测试驱动(TDD)、QuickCheck、属性测试、模糊测试、Lean、TLA+、Verus,还有各种 skill、Default(不加额外测试指令)、「make no mistakes」之类。评测用的是隐藏测试集;每种条件跑了很多轮。

结果一句话

没什么方法能大幅甩开别人;反倒是 Default——什么测试口号都不喊——成绩在平均线之上。

让 AI 自己加「高大上」的测试体系,交付效果还变差了?图2

原文总结果图:横轴大致是成本,纵轴是全过隐藏测试的比例(作者自己也说这图很乱)

让 AI 自己加「高大上」的测试体系,交付效果还变差了?图3

原文对结果的说明

几个现象

• 智能体默认不太会测:自己写的弱测试容易过,真 bug 照样漏。高努力档上,自家测试往往能绿,但测得浅。

• 点名 fancy 技术,经常只用到皮毛:形式化验证去证无关性质;属性测试 / 模糊测试爱砸随机无效输入,或只查很 trivial 的性质。

• TDD 如作者事前预感,表现偏弱——测试变多了,但不一定更贴硬 case。

• 热门测试 skill(含星标极高的 ECC)并不神奇,有的还拖后腿;作者随手写的短 skill 反而略好一点,因为它在 nudge 默认坏习惯,而不是塞教程。

• 「make no mistakes」基本像没说;作者认为它不会赢过 Default。

那平时怎么办

口号不如结构。作者自己的经验是:先帮智能体搭一套说得过去的测试 / 分流架子,再让它往里补,比只喊技术名靠谱。属性测试、模糊测试这类,给具体怎么生成「有意思」的输入,比只甩库名有效。

看完一圈,更像是:模型里大概有怎么测的知识,但默认不会拿出来;只报技术名推不动,轻轻把工作流掰正,反而更容易用上。

再贴链接

原文:https://danluu.com/agentic-testing/

HN 讨论:https://news.ycombinator.com/item?id=49605246

依据 Dan Luu 原文;影响力数字截至 2026-09-08;模型与 harness 按文中 Codex + GPT-5.6 Sol。未群发,仅草稿。

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI 测试
more
估值25亿美元的AI助手Instinct获“独立邮箱”,代理经济迈入自主交互新阶段
离开自动驾驶量产一线,张颖创业做AI for Physical AI
AI Agent重塑SaaS估值逻辑:从“卖席位”到“卖结果”的阵痛与重构
端侧AI撞上「内存墙」,瑞芯微提前做对了什么?
AI音频硬件引爆IFA!声音成AI硬件新入口,中国品牌成主力军
AI支出增速骤降:当“价格战”撞上暑期淡季,大模型厂商的焦虑时刻
外骨骼要普及了?航墨IRMO们IFA整大活:一遍轻便化一边AI化
小米投的AI芯片创企,融资10亿,知名大模型公司投了
别只盯着 EDA!AI 时代的半导体提效新思路
AI破解千禧年难题引发学术伦理风暴,OpenAI被指“抢跑”纽约大学教授成果
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号