说白了,AI智能体正从实验室往真实世界冲。阿里开源的Qwen-UI-Agent不玩虚的,直接对标真实设备操作,移动端、电脑端、网页端甚至深度搜索全覆盖,在MobileWorld测试里砍下82.1%高分,综合性能把一堆旗舰模型甩在身后。browser-use呢?也在捣鼓类似的事——让AI智能体直接操控网页,把线上任务自动化。方向已经很明白了:别模拟了,直接上真机。
要让智能体真正上手干活,第一步是教会它怎么操作。arXiv上有个新研究,直接提出从电脑使用痕迹里提取任务模型——那些被动记录下来的截图、鼠标键盘动作,全都能转化成可审计、可复用的一套工作流程。说白了,这就是给智能体一本"操作说明书",让它照着人类的行为模式学习。阿里那个Qwen-UI-Agent走的也是同一条路,以真实世界为中心搭能力基座。
实际上,智能体干的事早就超出点一点、按一按了。有研究团队搞出一套三智能体工作流,把数据采集、出行行为建模、天气敏感需求预测全串在一起,打破了以往各环节割裂研究的局面。这种多智能体协作模式证明,AI智能体在复杂科研领域同样能打出漂亮的组合拳。
更狠的是,有人想让智能体自己改进自己。AI4AI-Bench就是干这个的——专门评测LLM智能体在算法设计里的递归自我改进能力:系统能不能优化自己的训练算法,让下一代接着往上走?这问题直接戳到AI安全和进化的核心。智能体不再是被动干活的工具,它完全有可能变成推动AI向前跑的引擎。