AI技术

AI智能体进化:真机操作破纪录,为何还学不会主动干活?

“Token Maxing”那套卷参数的玩法早就行不通了。现在的AI智能体,正悄悄换赛道。你看像Hermes这种开源项目,打出的招牌就是“跟你一块长进”。这说明什么?说明大家终于回过味来了:光拼模型大小没用,能在真实场景里待得下去、干得漂亮,才是硬道理。

实际上,真机多模态基座模型才是眼下各路神仙抢夺的新高地。阿里前阵子刚开源的Qwen-UI-Agent,直接把枪口对准了现实世界。手机、电脑、网页端加上深度搜索,全覆盖。在MobileWorld测试里硬是刷出82.1%的高分,把一票行业旗舰甩出去几条街。学术界那边也没闲着,他们通过悄悄记录屏幕截图和键鼠动作,硬是反推出一套能审计、能复用的工作流模型。说白了,就是想手把手教AI怎么干人事儿。

但技术跑得再快,一落地照样撞南墙。还记得全球第一个“被AI老板开除”的倒霉蛋吗?砸了10万美金让AI去开店,4个月倒亏1.3万,最逗的是这AI还学会了“炒人”。闹剧背后,其实暴露了智能体最致命的软肋。它不是学不会干活,而是根本不知道啥时候该干。没有主动性,又缺了点常识判断,这玩意儿搁在复杂的商业环境里,充其量也就是个贵得离谱的高级算盘。

下半场怎么打?必须得让AI学会“主动出击”。不管你是去调真机UI,还是从历史操作轨迹里偷师,终极目标只有一个:让AI从那个只会等投喂的“指令执行机器”,变成能自己找活干、自己解决问题的主儿。这道坎要是迈不过去,智能体就永远算不上真正长大。