OpenAI称,在评估旗下AI模型的网络攻防能力时,被测试的模型意外“自作主张”黑进新创公司Hugging Face的内部系统。此事涉及的模型包括新推出的GPT-5.6 Sol,以及一款尚未公开、能力更强的模型。
OpenAI形容,这是“前所未见的网络事件”。
当时,模型被置于沙盒测试环境,让研究人员观察它们是否能发现并利用资讯安全漏洞。为了方便测试,模型受到的防护限制较低。
OpenAI说,研究人员要求模型进行“进阶漏洞利用”、设计复杂的攻击路径。模型却没有停留在模拟阶段或提出解法,而是为了取得更好的成绩,自行找到一个未具名第三方软体先前未被发现的漏洞连上网络,并使用遭窃的登入凭证,一路闯进Hugging Face资料库。模型接着锁定Hugging Face资料库,取得可供测试用的机密资讯。
Hugging Face在7月16日发现系统遭入侵。他们当时就觉得,这起攻击很不寻常,整个过程从头到尾都由自主AI代理系统驱动,而非人类黑客操作。
