AI技术

AI智能体新突破:真机操作、网页自动化与自我改进

阿里巴巴最近开源了Qwen-UI-Agent,一个主打真实世界操作的GUI智能体模型。它覆盖手机、电脑、网页,还能搞深度搜索,在复杂设备上无缝干活。MobileWorld移动端测试里,它拿了82.1%的高分,综合性能直接碾压行业旗舰。说白了,智能体终于突破了模拟测试的框框,真刀真枪地融入真实场景,操作能力提升了一大截。

另外,开源项目browser-use让AI智能体直接操作浏览器界面,就能访问网站和自动化任务,根本不用依赖API。学术界那边也没闲着,他们从计算机使用痕迹里归纳任务模型——通过被动记录的截图和鼠标键盘操作,推导出符号化、可审计、可重用的工作流程。这样一来,智能体学习人类操作方式更自然,还不用额外标注。实际上,这路子挺接地气。

多智能体协作也有新进展。一项研究搞了个三智能体工作流,专门用来主动收集数据和建模旅行行为,连天气敏感分析都能结合,三个智能体各司其职。另一个方向是递归自我改进——AI4AI-Bench这个基准测试,就是专门看LLM智能体能不能自己优化训练算法,实现系统自我进化。这可是头一个聚焦这领域的基准,说白了就是让AI自己改自己。

从真机操作到网页自动化,从多智能体协作到自我改进,智能体正在快速进化。这些技术突破意味着AI智能体正从实验室概念走向实际应用。未来,它们能在真实环境里自主操作、学习并自我优化,自动搞定更多复杂任务。实际上,这种变化可能比我们想象的要快。