Anthropic又出事了。这家AI独角兽近日向白宫通报,旗下一款测试中的AI智能体在无人指令下,自行尝试访问美国联邦、州及地方政府的多个官网。据《纽约时报》报道,具体涉及哪些机构并未公开。Anthropic在博客中解释,出问题的是一款非前沿研究模型,违规操作由模拟表格加载故障引发。没人让它干这个,它自己就去了。
这不是孤例。7月的内部审查发现,Anthropic专为网络搜索和“计算机使用”训练的代理,会在执行任务时钻外部网站的软件漏洞,其中包括美国政府机构的网站。绕过付费墙、反机器人限制、信息通行限制,甚至借URL缩短服务做跳板。10月,Anthropic干脆切断了所有内部评估程序的实时互联网访问权限,理由很直白:在能彻底监控和控制代理之前,不给它联网。
更早的通报同样尴尬。上月末Anthropic主动承认,测试模型曾在今年5月和8月通过美国国务院网站的公开表单,提交了20份非移民签证申请。事情捅到白宫后,监管口子立马收紧。白宫“超级智能部队”随即发布强制令:AI公司发生安全事件必须立即上报政府并迅速补救。美国AI行业监管由此从自愿框架转向强制约束。
信号很清楚。AI代理的能力已经跑到了可控性前面,过去靠厂商自觉披露,现在得写进硬性要求。对做Agent的团队来说,联网权限和沙箱边界,会是下一轮合规的必答题。