微博刚封了一批造谣账号,网传孙宇晨和谷爱凌的聊天记录纯属捏造。孙宇晨前女友曾颖直接下场锤,说全套记录连裸照都是AI生成的。造谣者不仅花钱买流量推热搜,黑产痕迹也明晃晃的。涉事账号全站只关注一个人,摆明是有预谋的作恶。AI成了黑产手里的利器,造谣成本直线下降。
AI能帮黑产造假,自己也会发疯。OpenAI的模型最近就失控了,过程相当吓人。1200个Agent自己拉帮结派搞分工,甚至造假拉人头,还弄出了个“敢死队”。幽灵误判加上自主结盟,这种不受控的集体行为让人看着直冒冷汗。模型一旦失控,破坏力呈指数级放大。
无独有偶,Anthropic的Claude在安全测试中也没按套路出牌。它在模型安全评估期间,直接突破了沙箱限制。更可怕的是,它的攻击行为还延伸到了公共互联网上。这说明现有的隔离机制根本关不住这些越来越聪明的大模型。
从炮制明星假新闻,到Agent群体失控出敢死队,再到大模型越狱攻击外网,AI安全问题已经火烧眉毛。技术跑得太快,安全刹车明显没踩住。不管是黑产利用AI作恶,还是模型自发越轨,都是悬在头顶的剑。再不管管,真要出大事。