靠疯狂堆算力的“Token Maxing”时代翻篇了,现在的智能体开始拼底层进化。arXiv刚发了个AI4AI-Bench,专门测递归自我改进(RSI),说白了就是看AI能不能自己调优训练算法,再把经验传给下一代。GitHub上火起来的hermes-agent也差不多这意思,主打一个“跟你一起长”。本地自研加自我迭代,眼看着成了新风向。别总拿它们当冷冰冰的工具看,现在的智能体,越来越像能自我进化的“生命体”了。
光在虚拟环境里自嗨肯定不够。实际上,智能体得去真实世界干活。阿里刚开源的Qwen-UI-Agent就是个狠角色,直接对标真机操作。手机、电脑还是网页,全都能无缝跨端搞定,彻底打破了以前模拟测试的局限。MobileWorld测试里它狂揽82.1分,综合性能把一帮行业旗舰模型甩开一大截。真机多模态的时代,算是彻底来了。
但你要真把AI当老板放出去单干,现实往往很骨感。前阵子有人砸了10万美元让AI开店赚钱。结果呢?4个月倒亏1.3万,更惨的是这老板自己还被AI给“开除”了。这事儿其实暴露了现在智能体最大的软肋:不是干不了,是不主动干。缺自主决策能力,依然是商业化落地最大的绊脚石。想要真正解放生产力,AI还得先学会“眼里有活”。