微软两次自曝「AI 找 Bug 修不完」,资本却在为生成速度付天价:AI 编程的钱与坑
这一周热传的 AI 编程新闻里,最值得琢磨的不是哪家模型又拿第一,而是微软不到一个月的两次自曝家丑。
第一爆是 8 月 13 日:Exchange 团队出面解释累积更新 CU1 为什么迟迟不发,原因听起来有点反直觉——AI 工具找到了大量 Bug。问题出在找到之后:每个 Bug 都要工程师确认、复现、修复、回归测试、再打包发布,而每月的安全更新还在不断插队。第二爆紧随其后:Edge 团队承认,AI 生成的浏览器扩展多到审核不过来。再加上 9 月 Patch Tuesday 一口气修复 974 个漏洞创单月纪录(723 个 Windows + 222 个 Office)、用户侧却集体「不敢更新」——一个大厂用自己的发版纪律,把 AI 编程的真实瓶颈摆上了台面。

先看另一面:资本在为「生成速度」付天价
把镜头拉远,同一个赛道正在发生完全相反的事。SpaceX 以 600 亿美元收购 Cursor 母公司 Anysphere(8 月 14 日生效),支付方式是全部以 A 类普通股——「一分现金没花」,50 名早期员工就此财富自由;马斯克在全员会上罕见承认 Grok 落后、「不习惯失败」,收购就是追赶。9 月 9 日,Devin 母公司 Cognition 完成 20 亿美元 E 轮,投后估值 480 亿美元。使用侧:JetBrains 的开发者调查显示 Claude Code 的工作使用率超过了 GitHub Copilot;DeepSeek-V4-Flash 以单日 8 万亿 Token 的调用量登顶全球第一。
于是一张对撞图成形了:资本为「生成速度」付天价,工程为「验证速度」付代价。这两件事是同一枚硬币的两面——正因为生成便宜到不值钱,验证才贵到成了瓶颈。
修复债务:为什么 AI 找 Bug 反而让更新发不出来
微软的两次自曝值得逐帧看,因为它戳破了一个流行错觉:AI 找 Bug = 质量自动提升。真实链路是——找到只是开始:确认 Bug 真实存在(AI 会误报)、复现、修改、测试修复效果、回归测试(确保「修了一个 Bug,没有顺手制造三个新的」)、打包发布。这条链每一环都要人或人工带宽。
把它写成公式:修复债务 = Bug 数量爆炸 × 单个确认成本。生成的边际成本趋近于零,验证的边际成本几乎不降——于是债务只增不减。这也是约束理论(TOC)的 AI 版:瓶颈永远移到最慢的环节。以前瓶颈在「写得慢」,现在写在零成本生成,瓶颈移到了「消化」。
还有一个口径要点:974 是「修复」纪录,不是「找到」纪录——而它本身既是 AI 找 Bug 能力的勋章,也是验证带宽被拉爆的证据。用户「不敢更新」是第三个读数:当补丁洪流超过用户的信任带宽,修复本身也会变成风险。产出、验证、信任,三道闸口一道比一道窄。
三条对策:把「审」当产能管理
我 9 月 12 日写「AI 生成代码缺陷率高于人写、会审成硬技能」时还是推断,微软现在给了第一方证据——而且更进一步:连「找 Bug」自动化之后,瓶颈继续后移到了「修和审」。给团队的三条工程对策(教学版同步进实训课):
其一,分诊分级。 急诊室逻辑:不是所有发现都值得立即处理。按「价值 × AI 置信度」画矩阵,稀缺的人工带宽优先投给高价值 + 低置信度的交集,其余排期或自动化。
其二,AI 预审 AI,人做终审。 先让 AI 验证 AI——自动复现脚本、影响面分析、修复建议预生成,人只做终审。前提是上周说过的那句:终审的人要看得懂,否则就是英国 AISI 测试里那种被社工的橡皮图章。Edge 的插件审核同理:预审自动化 + 人工终审抽检。
其三,按验证吞吐排期。 接受「处理带宽」是真实约束:发版节奏按验证产能算,不按生成产能算——这其实就是 Agent 七条硬限制的工程排期版,速率限制思想从「防失控」扩展到「防积压」。
给学生的一句话版
就业课上我会把这组新闻讲成一个完整的案例:AI 编程的短板从来不在「写」——Cursor 卖了 600 亿美元,说明写的价值在向工具转移;微软修不完 Bug,说明「验证」的价值正在向人集中。质量工程、测试开发、代码审查这些岗位的技术含量和议价能力,接下来只涨不跌。实训课的新作业我已经想好了:发一个「AI 找出 20 个 Bug」的项目,让学生按验证吞吐排期修完——修不完的,正好体会什么叫修复债务。

一盆冷水
三句照例:其一,微软是极端样本——巨型存量代码库加月度更新纪律,放大了修复债务,中小团队的瓶颈形态未必相同;其二,974 个漏洞里有多少是历史积压、多少是当月新增,官方没有拆口径,别直接当「AI 单月找到 974 个」用;其三,Cursor 那 600 亿是全股票支付,锁定期和整合风险都在后头——纸面富贵和「OpenAI 已宣布 11 月 12 日终止与其合作」放在一起看,故事还有下半场。
写在最后
同周还有一条容易被这条大新闻淹没的注脚:DeepSeek-R1 的研究论文登上了《自然》封面,成为全球首个经过同行评审的主流大模型,并正面回应了年初的蒸馏质疑。学术的同行评审和工程的验证吞吐,其实是同一种稀缺资源的两副面孔——可信度基础设施。跑分会动、发布会有话术、招聘数据打架,最后能沉淀下来的信任,都要靠这套慢而贵的机制。这个话题值得单独写一篇,明天展开。
我们给政企校交付系统时,「验证吞吐」现在是正式的交付指标——验收用例跑多快、回归全绿要几天,写进合同比写进口号有用。想聊质量工程落地或 AI 代码审查流程的团队,欢迎交流。
参考来源
- 36 氪:被 AI 代码「淹没」,微软也扛不住了?不到一个月两度「自曝家丑」
- 网易:不到一个月两次自曝——AI 写代码快了,微软却卡在修 Bug 和审插件上(8.13 Exchange CU1 细节)
- 搜狐:被 AI 代码淹没(Edge 插件审核、回归测试细节)
- 搜狐(快科技):微软 9 月狂修 974 个漏洞创纪录,用户却集体「不敢更新」
- 证券时报:打工 3 年财富自由——SpaceX 600 亿美元收购 Anysphere,全部以 A 类普通股支付
- 知乎:马斯克坦承 Grok 落后,收购 Cursor 只为追赶 AI 对手
- 中国经济网(转彭博社):Cursor 被 SpaceX 收购后,OpenAI 宣布终止合作(11 月 12 日到期)
- 知乎:600 亿买 Cursor、480 亿投 Devin——AI 编程的牌桌彻底变了(Cognition E 轮 9.9)
- 知乎:Cursor 收购、DeepSeek 单日 8 万亿 Token——AI 编程 3.0 的真瓶颈(Claude Code 超 Copilot 引 JetBrains 调查)
- 新浪(中国公司全球化周报):DeepSeek-R1 登上《自然》封面,全球首个经同行评审的主流大模型