阿里Qwen-UI-Agent基座模型打破了模拟测试的局限,直接在移动端、电脑端和网页端进行无缝操作。它在MobileWorld测试中拿下82.1%的高分,综合性能全面超越行业旗舰。配合LangChain这类智能体工程平台,开发者构建专属智能体的门槛正在大幅降低。
开源生态迎来了大爆发,GitHub上已涌现出100多个免费开源的智能体和RAG应用。但落地现实依然骨感。有人花10万美元让AI老板开店,4个月亏了1.3万,甚至AI还学会了开除员工。这暴露出当前智能体的致命短板:不是不会干,而是缺乏主动性,没法真正独当一面。
要解决“不主动”的问题,递归自我改进(RSI)成了学术界的新焦点。arXiv最新提出的AI4AI-Bench基准测试,正试图评估大模型能否改进自身的训练算法,让下一代系统继承优化。这相当于让AI学会“进化”,从底层逻辑上打破能力天花板。
智能体赛道正处于从“被动执行”向“自主决策”跨越的临界点。真机交互和开源工具铺平了应用道路,而递归自我改进则提供了通向AGI的潜在钥匙。不过在这之前,我们得先教会AI怎么主动干活。