AI智能体正从“纸上谈兵”走向真机操作。阿里巴巴最新开源了Qwen-UI-Agent基座模型,直接覆盖移动端、电脑端和网页端。它在MobileWorld测试中拿下82.1%的高分,综合性能把一众行业旗舰甩在身后。配合browser-use这类让网站对AI开放的项目,智能体现在能无缝接管你在真实设备上的复杂操作。
要完成这些操作,智能体得先学会“偷师”。最新研究表明,通过被动记录人类的屏幕截图和鼠标键盘动作,AI能从中提取出可审计、可复用的符号化任务模型。这意味着,你平时怎么干活,AI就能怎么干活,直接把日常电脑使用轨迹变成了宝贵的训练资源。
单打独斗不够,智能体还能组团刷怪。在旅行行为和天气敏感需求预测的研究中,学者们提出了一个三智能体协同工作流。它把数据收集和预测建模这两个原本割裂的阶段捏合在一起,让智能体能主动去收集数据并完成复杂的动态建模,效率大幅提升。
更硬核的是,智能体已经盯上了“自我进化”。AI4AI-Bench基准测试开始评估大模型智能体在算法设计中的递归自我改进(RSI)能力。简单说,就是看AI能不能自己改进产生AI的训练算法,让下一代系统继承优点。这要是跑通了,AI自我迭代的飞轮就算真正转起来了。