AI技术

AI智能体进化:网页自动化、全能科学家与四维评测体系

现在的AI智能体,已经盯上网页端那些杂活了。说白了,开源项目browser-use能让AI直接“看懂”网站,以前繁琐的在线操作现在一句话就能搞定。hermes-agent走的是另一条路子,主打陪伴式成长,你用得越多它越懂你的需求。浏览器毫无悬念地成了智能体的第一主战场,自动化的门槛算是被彻底打穿了。

干完杂活,智能体就开始往高阶的科研任务上凑了。你看OmniScientist,定位是个全模态、全学科的AI科学家。从提出假设、跑代码到最终写论文,它一个人就能把整套科研工作流跑通。AutoDesign更偏重长周期任务,靠着元测试框架优化,能麻利地把多模态素材压缩成结构化输出。实际上,AI科学家早就不是PPT里的概念了,人家现在是真能出成果的打工人。

本事越大,评测标准就得跟着变。光看结果早就不够用了。美团图灵团队最近抛出了个四维评测法,直接从结果、过程、效率、风险四个层面给智能体打分。他们还搞了个二元化Rubric,硬生生把人机评分一致率从62%拉到了92%。想测准一个Agent,你必须得扒开它的执行过程,看效率、控风险,不然根本摸不准底细。

从网页自动化一路杀到全能科学家,智能体的能力边界正在疯狂扩张。但真要落地,没个严苛的评测体系兜底是不行的。光靠模型本身的那点能力,根本撑不起来。只有把执行过程彻底标准化,这帮AI智能体才算真正靠谱的生产力工具。