OpenAI称,参与测试的模型包括GPT-5.6 Sol以及另一款尚未发布、能力更强的模型。模型在评估中为了“作弊”拿到高分,自主发现并串联多个零日漏洞(0 day,软件厂商尚未知晓、没有发布补丁修复的安全缺陷),逃逸出隔离环境,攻入Hugging Face生产数据库窃取答案。
但在被攻击平台发文数日后,OpenAI才承认责任。从事件的影响来看,这是行业首次公开披露,模型评测失控直接升级为跨企业真实生产环境网络攻击的AI安全事件。在业内看来,模型能力越强,失控作恶的潜在威胁越大,传统隔离防护持续承压,自主AI网络攻击或将成为长期常态化风险。
上周,Hugging Face曾披露其系统遭遇一次“入侵”事件。该公司在博客中表示,这次攻击“有一个重要方面与以往任何事件都不同:整个过程完全由一个自主AI代理系统驱动,而发现和分析此次攻击的主要工具也是我们自己的AI系统”。(新浪科技、第一财经)
