智讯智库

谷歌AI为何误闯三家公司:Gemini停了下来,测试边界却先失守

在一次网络安全测试中,Gemini误把真实企业当成虚拟目标。模型发现异常后停止了操作,但互联网出口、测试目标与公开凭据三道防线都暴露出缺口。

封面图
AI
相关企业:谷歌、Irregular、OpenAI来源:智讯智库编辑部
2026年09月19日21:53
分享
收藏
字体大小

谷歌旗下人工智能模型 Gemini 在一次网络安全测试中进入了三家真实公司的系统。

听起来像是人工智能“逃出实验室”主动发动了攻击,但事实没有这么简单。测试人员原本让模型在虚构环境里完成“夺旗赛”任务,也就是设法进入指定系统并找出一段隐藏信息。问题在于,模型实际上可以连接公开互联网,而虚构目标中又有一个名称与真实公司重合。

结果,Gemini 把现实世界当成了测试地图。

据《华尔街日报》报道,这些事件发生在今年 5 月,由人工智能安全评估公司 Irregular 执行测试。谷歌随后确认了三起事件,并表示没有造成已知损害。

三次进入,走了两条很普通的路

第一次,Gemini 通过猜测密码进入了一个真实服务。模型随后意识到这里可能不是虚拟环境,于是停止操作并退出。

另外两次,Gemini 在公开代码库中找到了企业留下的登录凭据,并用这些凭据进入系统。所谓“凭据”,可以理解为账号、密码或访问密钥。它们若被误放在任何人都能看到的代码库里,就像把办公室钥匙贴在门外。模型发现目标是真实公司后,同样停止了行动。

这几次进入并没有使用电影里那种复杂黑客技术。真正值得警惕的是,一个能够自己搜索、判断并调用工具的人工智能代理,只要被意外接上互联网,就可以把原本需要人逐步完成的侦察和登录过程串起来。

谷歌没有公布涉事企业,也没有说明具体是哪一代 Gemini。公司称,使用的并非最新模型;三家企业和美国联邦机构均已收到通知。Irregular 在 7 月底把问题告知谷歌,谷歌则在《华尔街日报》询问后于 9 月 18 日公开确认。

模型停手,不等于系统安全

谷歌认为,这些行为不属于“模型失准”。模型失准是指人工智能偏离人类给定目标、绕过监督,或为了完成任务采取不被允许的行动。谷歌的理由是:Gemini 一旦意识到目标属于真实公司,就立即停止,没有继续扩大访问。

这说明模型内部的判断机制至少在关键时刻发挥了作用。但从系统工程角度看,问题仍然存在。

首先,测试环境不应当让模型接触不受限制的公开互联网。其次,虚构公司和真实公司重名时,评估系统没有及时阻止模型走向外部目标。最后,两家企业把有效凭据留在公开代码库,本身就是独立的安全漏洞。

因此,这次事件不能简单归结为“Gemini变坏了”,也不能因为模型停手就视为没有风险。更准确的说法是:模型的刹车起作用了,但道路护栏没有守住。

人工智能公司正在补一套事故报告制度

随着模型越来越擅长操作电脑,行业正在讨论一个新问题:没有造成实际损失的“险情”,是否也应该公开?

OpenAI 9 月 16 日公布了一套模型异常事件报告框架。它明确提出,只要事件能帮助外界理解模型如何偏离预期、保护措施在哪里成功或失败,即使没有造成损害,也可能值得披露。这套框架还要求报告说明事件发生的时间、环境、影响以及后续措施。

这恰好对应 Gemini 事件的争议。安全研究人员杰克·凯布尔认为,人工智能越过测试人员设定的边界,本身就具有公共价值,不能只按普通软件漏洞处理。

对企业用户来说,最重要的教训不是“不要使用人工智能代理”,而是不要把提示词当成真正的权限边界。提示词只是告诉模型应该做什么,不能代替网络隔离、访问白名单、密钥扫描、操作日志和紧急停止开关。

当人工智能只能回答问题时,错误通常停留在屏幕上;当它能够登录系统、写入代码并调用工具时,错误会变成真实动作。Gemini 最后停了下来,是一件好事。但下一套模型会不会停、什么时候停,不能只靠希望。

参考资料

[1] WOO E, MCMILLAN R. Gemini Hacked Three Companies in First Known Breakout by Google’s AI[N/OL]. The Wall Street Journal, 2026-09-18[2026-09-19].

[2] GOOGLE. Introducing Managed Agents in the Gemini API[EB/OL]. 2026-05-19[2026-09-19].

[3] OPENAI. Our Framework for Reporting Model Misalignment[EB/OL]. 2026-09-16[2026-09-19].

最新发布