大叔自由人
GPT-6 的跑分变了三次,第三方指数只有 61 分:模型测评这堂课,我劝你别只看官宣
技术分享

GPT-6 的跑分变了三次,第三方指数只有 61 分:模型测评这堂课,我劝你别只看官宣

两天前我说「AGI 宣称一半是营销、一半是进步,而且没法证伪」。这话说过没 48 小时,事情起了变化——没法证伪的话术,被可以核查的数字动了手脚的嫌疑撞上了

先叠一句甲:以下变动爆料来自社区整理和媒体转述,OpenAI 截至发文没有公开回应,「数据变动」的确切原因也未经证实。所以这篇不是判词,是一堂读数课——正好是我这个系列(口径课、读数课)的第三讲。

跑分风波

风波里的事实清单

社区整理的「变动记录」有三条,每条都有时间戳可查:其一,官博上线前后,Astra 的幻觉率一度从 4.2% 改到 2.0%,随后又恢复;其二,ARC-AGI-3 的得分,媒体提前拿到的是 98.6%,官宣变成了 99.99%——而另一处转述的官方口径是 99.9%,连「官宣数字本身是多少」在不同转述里都不一致;其三,对比表里 Anthropic Claude 的一项数学成绩被调低了近 10 个百分点。OpenAI 对这三条都没有接茬。

比数据变动更有意思的是话术上的自相矛盾:社区讨论里反复被引用的一组对照是——OpenAI 的 CEO 在别的场合说过 「AGI 是营销术语」,而总裁 Greg Brockman 在发布会上说的是 「我认为现在认为我们已经进入 AGI 时代,并不是一种不合理的看法」。一家公司两只口径,哪个是真的?都对——对不同的人说不同的话,本来就是营销的标配。

第三方泼来的冷水,和浇不灭的火

把官宣跑分放一边,看两个独立读数:

冷水一:Artificial Analysis 综合指数,Astra 61 分——与上代 GPT-5.6 Sol 持平,低于 Anthropic Fable 5.1 的 66 分。注意这不是「黑」,AA 指数是同口径横评,它的价值恰恰在于稳定、可比、不由任何模型厂商出卷。

冷水二:开发者实测的普遍反馈是「很聪明,但工作直觉未必同步」——Astra 会做出非常聪明的决策,但在长流程、复杂指令遵循和持续理解项目上下文方面不够稳。Flask 和 Jinja2 的作者 Armin Ronacher 直接发了一篇《Astra for Coding: Why Are We Doing This Again?》上了 Hacker News 热榜——顶级工程作者的体感,比任何跑分都值得认真读。

但冷水之外,有三处跳变大概率是真的:Terminal-Bench 4.0 编程基准 57.7%(上代 Sol 只有 37.3%);OSWorld 2.0 计算机操作 72.6%、任务耗时缩短近一半;AI 制药公司 Insilico 的 DDD 基准抗体可开发性模块登顶,Brockman 亲自转发。所以这篇文章的结论不是「Astra 名不副实」,而是——同一颗模型,用不同尺子量出来的读数能差出十万八千里,跑分不能当唯一依据,尤其当出卷人和答卷人是同一家的时候

三把尺子

比「作弊」更深的一层:跑分本身测不出长尾

风波之外,普林斯顿大学人工智能创新中心主任王梦迪在外滩大会上给了一个更根本的提醒:大模型擅长找「最可能」的答案,而真正的科学突破藏在概率分布的长尾里。她的团队用 ChatGPT、Claude 做社会科学实验时发现,模型复现已知规律很稳,但一到开放性发现就明显局限。

这层提醒比「数据有没有被改」更冷:即使所有跑分都诚实,跑分测的也只是「最可能」的那部分能力。基准测试是往回看(考已知的题),创新是往前看(做没见过的题)。一个在 ARC-AGI-3 拿 99.9% 的模型离自主科学发现还有多远——这才是「AGI 时代」这个词欠我们的答案。

给学生的读数三守则

这周我的《AI 大模型技术》课正好讲到模型评测,直接把这次风波当案例了。给学生的版本是三条守则:

守则一:看谁在出卷。 自家官宣 ≠ 独立评测。厂商发布会上的对比图,基线怎么选、口径怎么定,都是可调节的旋钮。

守则二:看变动历史。 数字是会动的——所以独立评测的价值在于「存档」:AA 指数、社区复现、Hacker News 的体感帖,共同构成可追溯的记录。只截图一次官宣页面,等于没存档。

守则三:看任务分布。 Terminal-Bench 这类贴近真实工程的基准,比抽象推理分数对你找工作更有参考价值。而最可信的一把尺,是你自己的业务私测集——我让学生每人攒 20 个自己真实工作/项目里的问题,换模型时跑一遍,两小时就知道哪个适合自己。这招比任何榜单都诚实。

顺带说,这套守则不止读 AI 新闻用得上——软考《系统架构设计师》里讲数据质量、讲验收测试,逻辑一模一样:谁产生数据、谁核验数据、数据测的是什么。课是通的。

一盆冷水(对反转叙事本身)

最后给自己也泼一盆:「嫌疑」不等于「定罪」。数据变动的技术解释可能有很多种(口径更新、排版错误、缓存问题),OpenAI 未回应也不等于默认。如果后续有独立复核还它清白,今天的爆料帖就是又一次「反转新闻」。读数课最难的部分从来不是怀疑,是保持怀疑的同时不下结论——对官宣如此,对爆料也一样。

写在最后

我判断模型新闻含金量的土办法又进化了一版:一看它把「单位智能的价格」打下来了没有(前天那篇),二看出卷人是谁、数据动没动过(这篇)。两条都过筛的,才值得进我的课堂和采购清单。

老规矩:手里有模型选型、评测私测集搭建需求的团队或老师,欢迎来交流——帮学校和企业搭一套「自己的尺子」,这活儿我们最近干得越来越顺。


参考来源