大叔自由人
六周一轮军备竞赛:Kimi K3、Qwen3.8-Max、DeepSeek V4,开源大模型的三张牌
技术分享

六周一轮军备竞赛:Kimi K3、Qwen3.8-Max、DeepSeek V4,开源大模型的三张牌

这个夏天的大模型圈,热闹得有点不讲道理。

6 月中旬到 7 月底,六周之内,四家中国实验室相继放出前沿级模型:智谱 GLM 5.2(6 月 13–17 日)、月之暗面 Kimi K3(7 月 16 日)、阿里 Qwen3.8-Max(7 月 19 日)、DeepSeek V4 Flash 0731(7 月 31 日)。7 月 27 日,Kimi K3 的完整 MIT 权重上线 Hugging Face——总参数 2.8 万亿,目前全球参数规模最大的开源模型(科学网报道)。与此同时,沉寂一年多的美国开源也回来了:Meta 拿出 Muse Glimmer,英伟达跟上 Nemotron 3.5 Lightning。

半个月里这么多开源模型同时出现,一年前很难想象。今天不追发布会的热闹,聊一个更实际的问题:牌桌上的三张牌都长什么样,我们这种普通开发者该怎么押。

六周军备竞赛时间线

先看清三张牌

把这几家的数据摊开看,国产开源已经打出了三种完全不同的路线。凤凰科技最近把五个模型接进同一个测试环境做了轮横评,结论和我看数据后的感受一致——K3 在冲能力上限,Qwen 走稳和全能,DeepSeek 则在拉升性价比

第一张牌:上限。 Kimi K3 是这批模型里唯一有完整第三方验证成绩的:Artificial Analysis 智能指数 57 分,189 款模型中排第 4,是开源权重模型的历史最高排名,与顶级闭源模型基本持平;Arena 前端编码榜以 1,679 Elo 排第 1,背后是近 50 万票的真人盲测。凤凰横评里它十项拿了六项满分。代价也直白:贵,且偏慢。

第二张牌:全能。 Qwen3.8-Max(2.4T 总参、95B 激活)的官方案例非常猛:模拟电商一年做到 4.16 倍回报、芯片设计从 8298 门优化到 678 门、16 个自主运行日留下 265 次提交。但注意——这些全是官方口径,截至 8 月初没有任何第三方验证。横评里它难题基本都能做,但经常要想很久,给它足够时间和额度都能交卷,就是慢。

第三张牌:性价比。 DeepSeek V4 Flash 0731 是这轮最让人意外的:284B 总参只激活 13B,定价 $0.14/$0.28 每百万 token,约等于顶级闭源模型输出价的 1%。凤凰横评专门设了个”加时赛”——每个模型 30 美分预算解同一套题,DeepSeek 一轮全对,五题只花 4 美分;修 bug 任务一次 0.3 美分。Agent 基准上,它在 DeepSeek 官方放出的同口径对比里全面压过 GLM 5.2,逼近 Opus 4.8。

两个值得记住的判断

热闹看完,我从这轮竞赛里提炼出两个比”谁更强”更值钱的判断。

判断一:决定 Agent 性能的是后训练,不是规模。 DeepSeek V4 Flash 0731 和旧版 V4 Flash 架构完全相同(284B/13B),只是完全重新做了后训练——结果 DeepSWE 从 7.3 飙到 54.4,Terminal-Bench 2.1 从 61.8 涨到 82.7。一个 13B 激活的小模型,在 Agent 榜上打过了 40B 激活的大块头。对中小团队的含义:别再迷信参数量,把精力花在数据质量和流程编排上,收益可能比换更大的模型更直接。

判断二:引用任何数字前,先确认它是官方发布还是第三方验证。 Qwen3.8-Max 官方声称”仅次于 Fable 5”,公告附了详实的数据和案例,但连一个独立评测分数都还没有。这不是说它不行——Qwen 3.7-Max 上代的验证成绩(AA 56.6)确实过硬——而是说**“声称”和”验证”之间的那段距离,正是选型时最容易翻车的地方**。我用模型给学校做知识库、给自己微调小模型这几年,最大的教训就是:跑自己的评测集,比看任何排行榜都可靠。

普通开发者怎么选

按场景选型

落到实操,我的选型策略一句话:主力用便宜的,难活才上贵的,官方数据看看就好。

  • 知识库、教学演示、日常 Agent(我的主力场景):DeepSeek V4 Flash。给学生上课跑演示、给自己的资料库做问答,这种高频低难度场景,1% 的价格能打九成的仗——课件脚本跑一晚上都不心疼;
  • 复杂推理、多模态、前端生成:Kimi K3。要”看图+思考+行动”一模型搞定,或者要生成规整的网页/图形,它是目前唯一有前沿级第三方背书的选项;
  • 长周期自主任务:Qwen3.8-Max 可以小流量尝鲜,官方案例展示了”模型自己跑几十天”的玩法,等独立评测落地再放量;
  • 今天就要私有化部署:GLM 5.2 的 MIT 权重已上线,单节点 8 卡能跑;要是等 DeepSeek 的权重放出,13B 激活的部署成本还会再降一档。

另外补一个教育圈的视角:教育部等九部门今年在推”自主可控教育专用大模型和 AI 开源生态”(教育部官网),方向上和这轮开源潮正好咬合——国产开源模型越强,学校这类预算有限、数据敏感的场景,可玩的东西就越多。我给高职院校上课、搭知识库,用的全是这条路线。

写在最后

开源权重的差距被抹平了——前沿性能第一次可以脱离云服务运行,这是 2026 年这轮竞赛真正的历史意义。人民日报年底的总结说 Qwen、DeepSeek 已经”对齐甚至超过 Llama、Mistral”,现在半年过去,天平又往这边倾了几度。

对我们这种在二线城市做系统、教学生、折腾 NAS 和知识库的人来说,最好的消息不是哪家拿了第一,而是:牌桌上永远有一张你消费得起的牌。


参考来源