AI技术

AI智能体进化论:从网页自动化到全能科学家

现在的AI智能体确实越来越能干了。拿browser-use这类开源项目来说,它干脆把网页对AI敞开了大门,把在线任务自动化做到极简,你鼠标点几下就能把流程跑通。还有个叫hermes-agent的项目主打陪伴成长,你跟它交互得越多,它学得越快。说白了,底层的工具链一旦成熟,智能体就不是玩具了,而是真刀真枪地开始干活。

智能体能管的事儿正变得越来越宽。你看OmniScientist直接摇身一变,成了横跨全模态、全学科的AI科学家,从提出假设、跑代码到最后写论文,整个科研闭环它全包了。至于AutoDesign,实际上它在死磕长周期的任务优化,靠一套元测试框架,把乱七八糟的多模态信息变成规规矩矩的结构化数据。连这种极其烧脑的脑力活儿,AI现在都能轻松拿下。

活干得究竟咋样,总得有把尺子量一量。美团技术团队给出了挺硬核的解法:智能体评测必须死磕结果、过程、效率、风险这四个维度,缺一不可。靠着一套二元化的Rubric打分机制,他们硬生生把人机一致率从62%干到了92%。实际上,如果没有靠谱的衡量标准,再怎么吹上天的智能体,说白了也就是个让人心里没底的盲盒。

从干点网页操作的杂活,到挑起科研探索的大梁,再到弄出严谨的评测体系,智能体这套生态算是越跑越通了。但技术要落地,光看人家演示的Demo跑分没用,能稳定解决实际业务痛点那才算真本事。接下来大家就盯着看吧,到底谁家的智能体能真正在产业里扎下根来,谁才算赢。