AI智能体这回是真的落地了,不再是停留在概念里的PPT。拿browser-use来说,它直接让网站向AI敞开大门,填表、搜索甚至下单这种繁琐操作,全甩给智能体搞定。另一边,hermes-agent走的是陪伴路线,主打"跟你一起长本事",说白了就是个性化加持续学习。这帮家伙终于不用再吹牛,而是实打实能上手干活的工具了。
到了科研和设计这块,玩得更野。AutoDesign把多模态源转结构化输出的过程,直接搞成了长周期智能体任务,硬是用元框架啃下了复杂编排这块硬骨头。OmniScientist则更夸张,全模态全学科通吃,提出假设、跑代码、写论文一条龙服务。实际上,基础模型已经能撑起一套完整的科研工作流了。现在的AI科学家能独立跑通整个研究闭环,早就超越了单纯敲敲代码的阶段。
能干活是一码事,评得准是另一码事。美团图灵团队最近拉了个四维评测框架,结果、过程、效率、风险四个维度全包圆。这招够狠,靠二元化Rubric,硬把人机一致率从62%干到了92%。评测跟不上,模型肯定调不明白。实际上,方法论的进化跟智能体本身一样要命。
网页自动化、科研闭环、评测体系,这三条线现在是并排狂飙。底层能力、应用场景、评估标准全都在大步往前走。2025年智能体想全面爆发,压根不需要再做什么铺垫。就差扔进真实场景里好好练练了。