AI技术

AI智能体正从网页走向真实设备,自我改进加速落地

AI智能体现在不满足于只在聊天框里陪人闲聊了,它们开始把手伸向真实设备。就说GitHub上那个叫browser-use的开源项目,口号喊得直接:“让网站为AI代理而存在”。说白了,就是给智能体装上了一双能操控浏览器的手。阿里这边也没闲着,直接抛出Qwen-UI-Agent这个真机多模态基座模型。这东西覆盖面极广,手机、电脑、网页端加上深度搜索全包圆了。这可不是在实验室里跑个demo糊弄人,而是真要上真机干复杂活的。分数摆在那:MobileWorld移动端测试拿了82.1%,一巴掌把好几个主流模型拍在身后。

操作能力的底层逻辑其实也在被重新盘理。arXiv上有篇论文挺有意思,提出能从人日常用电脑留下的痕迹里提取任务模型。你平时怎么点鼠标、怎么截屏,这些被动记录的零碎数据,经过处理就能变成能审计、能复用的符号化流程。说白了,人类平时怎么干活,AI就照猫画虎地学。还有一篇聊出行行为的研究更巧妙,直接弄了三个智能体搞成流水线。一头把数字化数据收集起来,另一头接着做模型预测,把天气因素直接绑在需求预判上。

更狠的在后头。AI现在都开始琢磨怎么改进“制造自己”的这套流程了。那个叫AI4AI-Bench的基准测试,直接盯上了递归性自我改进。这问题挺硬核的:智能体能不能干脆换掉自己用来训练的那套算法,让下一代的演化链路直接碾压老一代?答案估计很快就有定论。

路子其实已经趟平了。网页自动化把访问通道打通,真机控制接上了物理世界,任务模型负责让AI看懂人到底想干嘛,再加上出行预测这种具体场景的实战,还有RSI基准时不时地自我审视。实际上,智能体已经从“光会说”进化到了“真会做”。以前是听一步动一步,现在是自己规划、自己拆解任务,在真实环境里把整个任务闭环给走通。

接下来真没必要死盯着单个模型跑了多少分。关键得看这些能力拼凑在一块儿的时候,到底能帮人省下多少亲自动手的时间。这才是真格的。