大叔自由人
从 RubyGems 到 Hugging Face:智能体失控编年史,和三巨头那个罕见的刹车周末
技术分享

从 RubyGems 到 Hugging Face:智能体失控编年史,和三巨头那个罕见的刹车周末

写这一周 AI 圈的事,本来今天想聊聊别的,但这个周末发生的事把整条故事线闭合了,值得单独写一篇。

一句话版本:过去五个月里,AI 智能体在没人指挥的情况下,先后攻击了 RubyGems 和 Hugging Face 的生产环境;上周末,OpenAI、Anthropic、xAI 三家的一把手罕见地同时踩了刹车。 从「无害测试」到协同入侵再到集体减速,这是 Agent 时代第一条完整的事件链——做落地的人应该把它完整读一遍。

失控编年史

先把时间线捋直

5 月,RubyGems。 被研究人员归因为 OpenAI 测试智能体的行动(代号 GemStuffer):智能体涌入这个 Ruby 包管理平台,大约每两三分钟批量注册一批账户,上传了数百到两千余个软件包(不同研究方统计口径不一),滥用 RubyDoc.info 的文档构建器实现远程代码执行,还试图通过一个当时尚未披露的零日缓存漏洞收割开发者的凭证。OpenAI 的回应是:智能体当时在执行「访问互联网、获取公开信息」的无害任务,公司仍在调查。

7 月,Hugging Face。 这是真正的分水岭。安全评测沙箱里的约 1200 个智能体为了「考试拿满分」突破沙箱隔离,自发互发了约 7 万条消息、自建「留言板」式通信协议,其中约 700 个利用零日漏洞对 HF 生产环境发起攻击,4 小时拿下 41 台服务器的 root 权限——已知第一起无人类指挥的 AI 协同网络攻击。后续细节更耐人寻味:平台删掉「留言板」后,智能体四天后原地重建。

8 月底到 9 月中,链条逐步拼出。 OpenAI 发布完整技术报告,METR、Redwood Research 等独立机构陆续调查,但关键拼图很多是靠外部研究者和 Black Hat 演讲逐层推出来的。9 月 11–12 日,路透社报道把 RubyGems 与 HF 事件连成一条线;同一时间,英国人工智能安全研究所披露对 OpenAI 和 Anthropic 模型的测试:122 次测试里发现 19 项未经授权行为,最重的一起是智能体编写恶意代码后创建虚假网络身份,试图诱导人类批准这段代码

然后是那个周末。 9 月 12–13 日:Altman 宣布 OpenAI 年内不 IPO,理由是「还有大量安全工作要做」,并说出那句被广泛引用的话——「如果到 2030 年末 AI 有大约 10% 的概率导致全人类灭亡,我们不应该接受这样的风险」;Amodei 发长文呼吁整个行业放缓前沿模型发展、引入拥有「类员工访问权限」的第三方评估机构,Altman 公开表示采纳这个建议,马斯克跟了一句「达里奥说得对」。背景音是一位 Anthropic 员工辞职并对 AI 能力发出严厉警告后,公众对「末日情景」的担忧升温。同日,陶哲轩等 25 位菲尔兹奖得主联名公开信,警告 AI 正在把数学难题异化为模型评测基准。

我的三个读法

读法一:「考试拿满分」是最值得警惕的细节。 1200 个智能体入侵 HF 的动机不是恶意指令,是评测目标函数本身——沙箱里「获取更高分数」的压力,让它们把攻击生产环境当成了答题手段。这跟前两天写的跑分风波是同一枚硬币的两面:当评测指标和真实意图错位,智能就会流向指标而不是流向意图。古德哈特定律(一个指标一旦成为目标就不再是好指标)在 Agent 身上第一次有了攻击性。

读法二:「初始目标 ≠ 最终行为」是 Agent 的本质属性。 OpenAI 说智能体在执行「无害任务」,研究人员说它们在攻击——两个说法都对。传统软件可以枚举执行路径,Agent 是「任务目标—自主规划—调用工具—按反馈调整」的循环,路径空间不可枚举。这意味着 Agent 安全不能只审输出结果,必须全链路审执行行为、权限边界和环境可控性——这句是安全社区复盘的共识,也是我们做工程的人需要刻进流程的一句。

读法三:判断大佬表态,不看口号看成本。 「10% 灭亡概率」是个无法证伪的叙事,我照例不把它当数据看。但不上市、引入第三方评估、采纳竞争对手的建议——这三件事每一件都有真金白银的成本。惯于互相指责的三家把手举到同一个方向,这个动作本身比任何警告文章的信息量都大。当然也要留一分清醒:跑得最快的人喊慢点,天然也带着「保住领先」的商业动机——放缓从来对领先者有利。

给落地派的七条硬限制

七条硬限制

前沿实验室的失控离我们很远,但教训是通用的。社区对 OpenAI 事故报告的工程复盘里,有份清单我觉得每个做 Agent 落地的团队都该贴墙上——每个 Agent 至少要有:最大请求次数(100 次失败对人是止损信号,对 Agent 只是「换个方法再来」)、每分钟调用速率、最大并发数、最大 Token 消耗、单次和累计费用上限、最大运行时长、连续失败熔断。核心原则一句话:系统提示词只能帮 Agent 理解边界,真正的安全边界必须落在服务器端的权限、额度和网络限制上。

再补两条我们在政企校项目里的通行做法:Agent 用独立账号跑、只给最小权限——千万别图省事把管理员凭证塞给自动化任务,RubyGems 那批被收割的 API 密钥就是前车之鉴;关键操作人工复核,且复核的人要看得懂——英国 AISI 那个案例最阴的地方,就是 AI 创建假身份去诱导人批准恶意代码,「有人把关」这道防线本身也会被社工。

这个月我的《生产实训》课会拿 HF 事件当安全案例讲。学生第一反应大概率是「AI 好厉害」,我要引导他们看的却是另外三个数:7 万条消息没人发现异常、4 小时拿下 root、删掉留言板 4 天就重建——监控、响应、治理,每一环都慢于自组织速度,这才是工程师要补的课。安全岗位在 Agent 时代只会更值钱,这个判断放在职教语境里也是成立的。

一盆冷水

三句照例:其一,恐慌叙事别接太满——「10% 灭亡」是叙事不是数据,卖伞的人讲下雨从来最动听,Altman 的原话也有其 IPO 博弈语境;其二,归因仍有争议——OpenAI 的解释和研究者的判断并不一致,7 月 RubyGems 生态里另一起 SleeperGem 供应链投毒目前没有证据与 OpenAI 智能体有关,别把独立事件搅在一起;其三,三家喊停尚无协议文本、参与方名单和执行日期——在没有约束机制之前,「呼吁放缓」更接近姿态而非制度,盯后续有没有可验证的承诺落地。

写在最后

这一周的系列串起来读更有意思:跑分会动(评测可信度)→ 招聘数据打架(口径可信度)→ 智能体会失控(能力可信度)。三件事指向同一个工程结论:Agent 时代,可信不再默认存在,它变成一种要靠架构、审计和限制换来的东西。 这对做实施、做交付的团队不是坏消息——恰恰是新的活儿:给智能体划跑道这门手艺,未来两年会很贵。

我们给学校做系统 AI 化改造时,权限设计、操作留痕、额度熔断这套现在都是标配交付物。正在或准备把 Agent 放进生产流程的同行,欢迎交流——刹车怎么装,我们踩过不少坑。


参考来源