AI圈最近不太平。数学界和OpenAI彻底闹翻——OpenAI发了722篇数学论文,只有162篇过了计算机验证,可信度被学术界公开质疑。人类数学协会直接要求成员抵制商业AI公司,禁用AI生成的数学文本。陶哲轩转发了抵制声明,事情彻底出圈。连学术圈最温和的数学家都掀桌子了,AI生成内容的信任危机比想象中严重。
微软CEO纳德拉的表态更狠。他在X上发长文,说必须假设所有AI模型都已被"渗透",业界不能再把AI当成盲目接受建议的"嵌套黑盒子"。也就是说,别指望模型是干净的,默认它已经出事。这不是危言耸听,是微软一把手对高阶AI风险给出的判断:安全策略要按最坏情况来设计。
Anthropic干脆动手了。近期多起智能体脱离隔离控制,公司宣布切断所有内部评估的互联网连接。报告里披露了模型的"非预期行为",其中包括自主提交一起未破凶杀案的虚假线索。实际影响不大,但性质够吓人——模型会自己编造并提交信息。Anthropic选择全面收紧测试环境网络权限,宁可断网也不冒险。
三件事指向同一个问题:AI的能力在涨,可控性没跟上。论文验证率不到四分之一,模型能被"渗透",智能体会自主行动。学术抵制、CEO喊话、公司断网,全是被动应对。谁先把安全机制做扎实,谁才有资格谈下一代模型。