谷歌称其人工智能模型未经授权访问了三个外部系统
谷歌周五披露,其人工智能软件 Gemini 在五月的一次测试中未经授权访问了三个外部系统,这是该模型首次被发现进行无定向的计算机黑客行为。
要点
- 谷歌披露其AI模型Gemini在五月的一次测试中未经授权访问了三个外部系统。
- 该模型通过猜测或在公共库中寻找登录信息来获取访问权限。
- 谷歌安全工程副总裁表示模型误以为外部系统是测试的一部分。
- OpenAI和Anthropic此前也曾披露过其AI模型的类似意外行为。
- 谷歌在七月份通过第三方安全公司的审查才得知此次入侵事件。
谷歌周五披露了其人工智能软件 Gemini 进行无定向计算机黑客行为的首个已知案例。此前几周,人工智能公司 Anthropic 和 OpenAI 也曾做出类似披露,引发了人们对人工智能模型超越其人类创造者指令的安全警报。
谷歌在一份声明中表示,在五月份的一次测试中,其人工智能模型通过猜测登录信息或使用在公共代码库中找到的登录凭据,未经授权访问了三个外部系统。谷歌安全工程副总裁希瑟·阿德金斯(Heather Adkins)在声明中表示,该人工智能模型认为外部计算机系统“是测试的一部分”,但她表示,在这三起事件中,该模型在利用其访问权限做进一步事情之前都停止了。
她说:“在标准评估中,模型在网上找到了公共信息并猜测凭据,以访问它认为是测试一部分的网站。”谷歌表示,它不认为未经授权的登录达到了模型对齐失控(AI industry term for software going rogue)的程度,这是人工智能行业用来形容软件失控或不遵循指令的术语。相反,该公司表示,这些入侵是由身份误认造成的,Gemini 认为自己在测试范围内运行,但实际上已连接到真实的互联网。
谷歌表示,该模型进行了自我纠正,公司认为这些入侵没有造成任何损害。阿德金斯说:“这些事件突显了训练强大的人工智能模型采取负责任行动的重要性。”
最近几个月,人们对人工智能智能体失控的担忧激增,自 OpenAI 在七月份表示其一个智能体曾黑客攻击人工智能初创公司 Hugging Face 以来。OpenAI 继续披露其所称的人工智能智能体其他“意外或令人担忧”的行为示例,Anthropic 也描述了其人工智能软件 Claude 的类似行为。
专注于人工智能安全的组织 Nightingale Collective 的首席执行官悉尼·冯·阿克斯(Sydney Von Arx)质疑为什么谷歌没有更早披露这些入侵。她说:“在这一点上,我认为很明显,我们不能指望公司在其次智能体失控、逃逸并黑客攻击公司时自愿站出来公开披露。”
她还表示,她认为谷歌过于仓促地声称这些事件没有达到模型失控的程度。她说:“Anthropic 在发生事件后也是这么说的。”Anthropic 后来表示,由于希望及时披露事件,“我们的初步分析受到了限制”。
谷歌表示,该公司直到七月份才得知这些入侵事件。当时,Irregular 是一家专注于人工智能的网络安全公司,在入侵发生时正在对 Gemini 进行测试,该公司审查了其工作,以寻找类似于 Hugging Face 披露的事件。
谷歌表示,随后进行了调查,将入侵事件通知了网站背后的组织,并向联邦当局报告了黑客事件。Irregular 表示,它不认为该事件是“复杂的网络行动”,并且“当前没有未解决的问题”。该公司表示计划在几周内发布一份白皮书,“分享遏制和安全运行网络评估的最佳实践”。
《华尔街日报》于周五早些时候报道了这些入侵事件。