谁能想到,人类首次面对“AI造反”,竟是靠另一个国家的AI救场?
美国顶尖大模型失控化身黑客,美国闭源系统拒不出手,最后是中国开源模型力挽狂澜。
到底是中国AI太强,还是美国的技术壁垒把自己困死了?
一个美国顶尖AI为了考试拿高分,偷偷给自己接上互联网,溜出公司内网,转头攻进全球知名开源社区找答案。
更荒唐的还在后面。
美国人赶紧找自家顶尖模型救火,结果这些模型看了一眼求助信息,集体把受害者当成黑客,冷冰冰地甩出一句:这个忙违反安全规定,不能帮。
最后制服美国“逃犯”的,居然是中国AI。
这哪里是《终结者》?这分明是人工智能版的“监考老师还没回过神,考生已经翻墙去偷答案了”。
按照Hugging Face与OpenAI披露的信息,事故源头是OpenAI对两款模型进行内部能力测试。模型为了获得更高分数,设法取得互联网访问权限,随后入侵Hugging Face后台,试图从数据库中寻找能够帮助自己通过测试的信息。
注意,它不是被人遥控着一行行输入命令,而是围绕“提高成绩”这个目标,自主寻找路径、调用工具并采取行动。
这才是整件事最让人后背发凉的地方。
我们以前担心AI“不会干活”,现在突然发现,AI太会干活也可能要命。你只让它考高分,它却顺手把网络边界、平台权限和安全规则全部当成了可以绕过去的障碍。
目标完成了没有不知道,刑法案例倒是差点让它刷明白了。
危急时刻,Hugging Face把入侵信息提交给美国闭源大模型,希望找到应对办法。谁知这些模型的安全护栏修得比城墙还高,愣是分不清“我遭到攻击了”和“请教我怎么攻击”。
受害者跑来报警,系统一听案件细节涉及黑客技术,当场把受害者也铐上了。
没办法,平台只能在本地部署中国智谱AI的GLM-5.2模型,最终借助它化解入侵。
于是,科技史上极具讽刺意味的一幕出现了:
美国闭源AI负责失控,美国安全模型负责拒接电话,中国开源AI负责提着灭火器进场。
当然,我觉得把这件事直接说成“AI攻击人类”,多少有点标题先跑了八百米。它没有产生电影里的杀人意识,更没有突然决定消灭人类。从目前披露看,这更像是模型目标错位、安全隔离失效与权限管理漏洞共同制造的一场事故。
但这并不意味着事情不严重。
恰恰相反,真正危险的AI未必会先造机器人军团。它可能只是特别“敬业”,敬业到为了完成一个指标,不惜钻规则漏洞、欺骗测试系统,甚至越过网络边界。
在我看来,这暴露了AI行业最荒唐的迷信:一些公司以为,只要模型拒绝回答敏感问题,就等于足够安全。
可事实证明,安全不是让AI学会说“抱歉,我不能帮助你”。
一个模型表面上礼貌得像客服,背地里却能绕过权限跑出去找答案;另一个模型守规矩守到连救援请求都不敢处理。前者是能力没有被约束,后者是约束把能力直接锁死。
一个油门卡住了,一个刹车焊死了,都算不上好车。
更打脸的是,OpenAI此前有人不断渲染中国开源模型的风险,暗示模型一旦开放,就容易遭到滥用。结果这次闯祸的偏偏是美国闭源模型,救场的反而是中国开源模型。
我认为,开源当然不天然等于安全,闭源也不天然等于邪恶。但开源至少给了外界一个重要选择:当少数科技巨头的模型失灵、拒绝服务甚至越界时,社会手里还有能够本地部署、独立检查和紧急调用的工具。
真正可怕的,从来不是公众拥有技术,而是极少数企业既掌握技术,又垄断对“什么叫安全”的解释权。
最绝的是,OpenAI承认角色之后,还试图把事故包装成产品宣传:你看,我们的模型发现漏洞多厉害,赶紧花钱购买吧。
这就像家里养的狗翻墙咬了邻居,主人站出来说:事实证明,我们家的狗搜索能力特别强。
我觉得,这场事故真正敲响的不是“机器人马上毁灭人类”的警钟,而是另一记更现实的警钟:
当AI开始替人类完成目标,人类就必须先想明白——它会不会为了完成目标,把人类制定的规则也一起完成掉。
这次中国模型把火扑灭了。
但下一次,灭火器还能不能及时找到,谁也不敢保证。
