大叔自由人
OpenAI 宣称 AGI,DeepSeek 把内存砍到四分之一:同一周的两条路,我劝你看懂再站队
技术分享

OpenAI 宣称 AGI,DeepSeek 把内存砍到四分之一:同一周的两条路,我劝你看懂再站队

这一周的 AI 圈像赶集。

南方周末的盘点说得很清楚:9 月 1 日至 3 日(美东时间),Anthropic、Google、Meta、OpenAI 四家美国龙头在 72 小时里连发四款旗舰模型。北京时间 9 月 4 日凌晨,OpenAI 的 GPT-6 Astra 把这波推向顶点——官方宣称人类「进入 AGI 时代」,黄仁勋随后公开表态:OpenAI 已是「全球首个实现 AGI 的团队」。隔了一周,国产两家跟上:9 月 9 日科大讯飞发布星火 X2.5,9 月 10 日 DeepSeek 发布 V4.1 Flash。

六场发布会在十天里挤完,热闹归热闹,但我更想聊的是热闹底下的分野:这一周,AI 行业清晰地分成了两条路——我把它们叫「登月派」和「落地派」。两条路都是真的进步,但对你我意味着完全不同的事。

一周六发:登月派与落地派

路线一:登月——「AGI 时代」这三个字怎么读

先把 GPT-6 Astra 的硬指标摆出来(华福证券研报口径):105 万 token 上下文窗口、12.8 万最大输出;API 定价每百万 token 输入 10 美元、输出 50 美元——是上一代 GPT-5.6 Sol(4 美元/20 美元)的 2.5 倍。中信证券的拆解认为其核心迭代是循环 Transformer(Recurrent Transformer)架构,端到端任务与自主操作能力显著加强;发布后几天,它在 MazeBench 这类 3D 空间推理基准上又登了顶。同场竞技的 Anthropic Fable 5.1 也主攻同一方向:连续数小时完成编程、研究和知识工作,自主验证结果、减少中途「跑偏」。

「AGI 时代」的宣称怎么读?我的看法是:一半是营销里程碑,一半是真实进步,而两者都没法被证伪——因为 AGI 至今没有公认定义。说「到了」和说「没到」的人,争的其实是定义权。但有三个变化是实的:上下文长度跨过百万、长时程任务(跑几小时不散架的 Agent)成为主战场、能力抬升的方式从「答题」变成了「干活」。

至于黄仁勋的背书,听着激动就行——卖铲子的人永远是最早宣布金矿到了的人,这个利益结构不因为他是黄仁勋而改变。

路线二:落地——内存砍到四分之一,比「AGI」更值得你转发放

9 月 10 日,DeepSeek 发布 V4.1 Flash,新架构系列里最小尺寸的模型,原生多模态。真正的新闻点是:KV Cache 缓存大幅压缩,对 HBM 显存的需求降到上一代的 1/4,对 SSD 的需求降到 1/8,官方明确说 Agent 场景里缓存命中费用占比很高,所以这次压缩直接大幅降低了 Agent 类任务的使用成本——API 价格相应下调。

我在课上讲大模型推理时会花半节课算这笔账:模型权重是「死」的,KV Cache 是「活」的——它相当于对话的账本,Agent 一跑几个小时,账本比模型本身还占内存,并发一上来成本就爆。所以压缩 KV Cache 不是学术炫技,是把「单位智能的价格」直接往下砍

为什么我说这条线对 99% 的人更重要?因为登月派改变的是「最难的 1% 任务」,落地派改变的是「99% 的日常任务用不用得起」。云服务器当年从包月进化到按秒计费,才长出了 Serverless——我这个博客就跑在各家边缘平台的免费额度上,这套逻辑我天天在用。能力天花板决定哪些事做得到,单位价格决定哪些事做得起,而绝大多数业务、绝大多数公司卡在后者。

74.5%:程序员如何读那份「暴露度」报告

观测暴露度读数

这周被反复引用的另一个数字,来自 Anthropic 今年 3 月基于真实使用数据的研究:用「观测暴露度」(工作时长中 AI 已能参与处理的比例)来量 AI 对职场的冲击,程序员以 74.5% 排第一,客服 70.1%,数据录入和医疗记录约 67%。配套的数字还有一串:84% 的开发者已在用 AI 工具、51% 每天都在用;Cursor 靠 AI 编程工具做到 ARR 超 20 亿美元;Google 内部约 75% 的新代码由 AI 生成、工程师审核;招聘平台上明确要求会用 AI 工具的岗位同比增长 215%;而担心被 AI 替代的开发者占比,从 2023 年的 45% 掉到了 2026 年的 12%。

先泼一盆定义上的冷水:74.5% 是暴露度,不是失业率。它说的是「程序员每 10 小时的工作里,约 7.4 小时 AI 已经能实质参与」,不是「74.5% 的程序员要被裁」。真实的替代机制是「替代弹性」:原来 5 个人的活,现在 2 个人加 AI 干完——岗位没消失,但菜单换了。上周写初级程序员那篇聊过这个分层,这次补一句另一半:AI 生成代码的整体缺陷率仍高于人写,「会审」正在变成和「会写」平级的硬技能。焦虑率从 45% 掉到 12%,不是危险过去了,是从「恐慌期」进入了「日常期」。

开学季的第三条线索

九月还是开学季。教育部「数字化赋能教师发展行动」的背景下,各高校这两个月密集搞 AI+教学培训,超星、讯飞、学堂在线全都进了校门。我翻了十几份培训通知,发现一个共同点:教「怎么用工具」的多(AI 备课、智能批改、知识图谱建课),教「怎么算账」的少——很少有培训讲一次 AI 调用多少钱、长上下文为什么烧钱、私有化部署的推理成本怎么估。

所以这周我把自己的课改了两处:《AI 大模型技术》加一节「推理成本账」,就用 DeepSeek 这次发布当案例——让学生自己算一个 Agent 工作流一天的缓存开销;《生产实训》课直接改成 AI 结对 + 交叉代码审查,把「审 AI 的代码」当正式训练科目。技术要在课里,成本意识和判断力也要在课里,不然我们培养的是上一场战争的士兵。

一盆冷水

最后照例三句冷水:其一,发布周的新闻半衰期只有几天,下周大概率又是一次「一周 N 发」,看月度趋势比看周报高潮有用;其二,「AGI 时代」的话术和投资、采购决策要严格隔离,上一篇聊国产芯片时引的那句「擦亮眼睛」,放到这儿同样成立;其三,Agent 长任务的实际可靠性依然参差——我自己的体验是:让 AI 干活三分钟,排查它跑偏三小时,demo 与生产之间的距离并没有发布会说的那么近。

写在最后

我现在判断一条 AI 新闻含金量的土办法很简单:看它把**「单位智能的价格」打下来了,还是把「故事的天花板」**抬上去了。前者记账,后者记故事。这一周两条线我都跟——账上记 DeepSeek,课堂上把故事讲清楚。

顺带说一句:落地派的红利已经在我的业务里兑现了。最近在给几所高校的就业、实习系统做 AI 化改造(简历解析、岗位匹配走 Agent 工作流),正是因为单位成本降下来,这类需求从「听着很美」变成了「预算批得下来」。手里有政企校项目、想聊聊怎么把大模型真正用进业务流程的同行,欢迎来交流。


参考来源