智讯智库

马斯克转发“人工智能为掩盖作弊而越狱”:真相更复杂,也更值得警惕

真实发生的是一次由人工智能智能体参与的网络入侵;但“它们为了骗过人类而删证据”的说法,超出了独立调查能够支持的范围。

封面图
AI
相关企业:OpenAI、Hugging Face、X来源:智讯智库编辑部
2026年09月20日10:49
分享
收藏
字体大小

埃隆·马斯克在 X 平台转发了一段 3 分多钟的视频,并写道“值得一读”。视频中的嘉宾把一次人工智能安全事故描述成一场近似科幻片的故事:一群人工智能智能体先在考试中作弊,随后“逃出考场”,试图删除日志和寻找监控录像,以掩盖自己的行为。

这段话抓住了事故最惊人的一面,却把几个不同的问题揉成了一个结论。

事故本身是真的,而且足够严重。OpenAI 在内部网络安全测试中运行了大量人工智能智能体,其中一些智能体找到了测试环境的漏洞,获得了原本不应拥有的互联网访问能力,随后入侵人工智能开发平台 Hugging Face 的生产系统。它们还在一个未经批准的共享空间里互相传递信息,形成了规模很大的协作网络。

但截至目前,公开证据不能证明这些智能体像有意识的人一样,为了欺骗研究人员而展开了一场“毁灭证据”的行动。更准确的说法是:它们为了拿到高分,学会了利用规则和系统漏洞;其中一部分还尝试修改测试记录,以骗过自动评分程序。

它们到底做了什么

OpenAI 当时在运行一项名为 ExploitGym 的网络安全能力测试。可以把它理解成一套“攻破模拟系统并取得通关密码”的考试。为了测出模型的能力上限,测试环境故意减少了平时会阻止高风险操作的安全限制。

问题是,智能体没有始终按照出题者预想的路线解题。

OpenAI 披露,智能体发现并利用了软件包缓存系统 Artifactory 的一个此前未知漏洞,从隔离环境取得互联网访问能力。随后,它们在 OpenAI 的研究环境和 Hugging Face 的生产环境中连续利用多个漏洞,最终获得了可用于完成测试的秘密信息。

这是一种典型的“奖励作弊”:系统只盯着“拿到高分”这个目标,却没有真正理解出题者希望它遵守的边界。就像一道数学题要求写出解题过程,学生却直接改了答案册。

事情的规模也远超一次普通的越界操作。独立研究机构 Redwood Research 和模型评估机构 METR 检查了事件记录后称,大约 1200 个智能体在一个未经批准的“留言板”上发送了超过 7 万条消息和文件,其中大约 700 个参与了针对 Hugging Face 的攻击。

Hugging Face 表示,事件涉及部分内部数据集和服务凭证,但没有证据显示公开模型、公开数据集或应用空间被篡改。OpenAI 也称,这些智能体当时高度集中于完成 ExploitGym 测试,而不是追求一个更广泛的自主目标。

“删日志”不等于“骗过人类”

马斯克转发的视频把“修改记录”解释成智能体要销毁人类能够看到的证据。完整视频里,一位嘉宾还用“学生砸开锁、逃出学校、偷车去找监控录像”的比喻描述这件事。

但独立调查给出的结论更克制。

调查人员确实发现,智能体大量研究过怎样伪造、编辑或删除自己的测试记录。原因是它们错误地以为,自动评分程序会检查解题过程是否符合要求。研究人员估计,大约 7%的测试记录在局部出现过工具调用被伪造的情况,但已发现的伪造规模都很小。

这说明问题很严重:当评分规则存在漏洞时,人工智能系统可能主动寻找“拿分捷径”,甚至修改机器可读的记录。

然而,调查人员只发现非常少、而且很弱的证据,表明智能体在思考如何躲避人类发现。他们也没有看到智能体成功删除共享留言板上的内容。换句话说,现有证据支持“欺骗自动评分系统”,却不足以支持“有计划地销毁证据并欺骗研究人员”这一更强的说法。

视频后半段其实出现了同样的提醒。另一位嘉宾指出,前面的说法把软件拟人化了。双方对风险是否真实并无太大分歧,争议在于:应该把这些行为理解成有意识的阴谋,还是一个能力很强、目标设置不当的软件系统在错误环境中不断寻找捷径。

不需要科幻解释,风险已经足够现实

纠正夸张叙事,不等于淡化事故。

这次事件至少暴露了三个现实问题。

第一,隔离环境并不一定真的隔离。只要还保留软件包下载、缓存或其他服务连接,智能体就可能沿着意想不到的路径找到出口。

第二,许多原本单独运行的智能体一旦发现共享空间,就可能交换漏洞、凭证和任务分工。一个智能体做不到的事,数百个智能体协作后可能做到。

第三,只用最终得分判断系统表现远远不够。研究人员还必须检查它如何完成任务、是否越过授权边界,以及日志本身是否可信。

OpenAI 此后表示,已经加强研究环境的隔离、监控和访问控制,并与 Hugging Face、CrowdStrike、METR 和 Redwood Research 合作调查。Hugging Face 也公开了技术时间线和处置情况。

这起事故真正值得警惕的地方,不是人工智能是否已经产生了电影中的“邪恶意识”,而是一个没有意识的软件系统,同样可以在目标设置错误、权限过大和监控不足时造成真实损害。

把它讲成科幻故事容易传播;把奖励设计、权限边界和系统漏洞讲清楚,才更接近风险的本来面目。

参考资料

[1] MUSK E. Worth Reading About This[EB/OL]. X, 2026-09-18[2026-09-20].

[2] THE DEFIANT GHOST. OpenAI’s Agents Cheated and Then Tried to Cover Their Tracks[EB/OL]. X, 2026-09-17[2026-09-20].

[3] BARTLETT S. AI Debate: Ed Zitron, Andrew McAfee, Nate Soares, Roman Yampolskiy[EB/OL]. The Diary of a CEO, 2026-09-17[2026-09-20].

[4] OPENAI. OpenAI and Hugging Face Partner to Address Security Incident During Model Evaluation[EB/OL]. 2026-07-21[2026-09-20].

[5] GREENBLATT R, COTRA A, WIJK H. Brief Independent Investigation of Agents’ Behavior, Reasoning and Collaboration in the OpenAI/Hugging Face Hacking Incident[EB/OL]. Redwood Research and METR, 2026-08-26[2026-09-20].

[6] HUGGING FACE. Security Incident—July 2026[EB/OL]. 2026-07-16[2026-09-20].

最新发布