智能体赛道最近炸了。GitHub上的browser-use项目直接让网站对AI智能体开放,在线任务自动化变得轻而易举。整个行业都在拼了命地让AI真正干活,而不只是聊天。
阿里刚开源的Qwen-UI-Agent更猛,直接上真机多模态基座模型。覆盖移动端、电脑端、网页端和深度搜索,MobileWorld测试拿下82.1%高分,把一众旗舰模型甩在身后。模拟测试的局限被打破,复杂真实设备操作不再是梦。
有意思的是,研究者发现被动记录的截图和鼠标键盘动作是个宝。arXiv新论文提出从计算机使用轨迹中归纳任务模型,把日常操作转化为可审计、可复用的符号化模型。这等于让AI通过"偷看"人类操作来学习怎么干活。
智能体协作也在升级。有研究提出三智能体工作流,把数据收集、旅行行为建模和天气敏感需求预测串在一起。以前这些环节各干各的,现在一条龙搞定,效率直接拉满。
最科幻的是递归自我改进。AI4AI-Bench专门给LLM智能体在算法设计中的自我改进能力做基准测试,让AI改进生产AI的过程,下一代继承上一代的优化。这套路子走下去,AI自己迭代自己只是时间问题。