AI智能体这波真不是停留在PPT上了。前阵子GitHub上爆火的browser-use,直接让AI去操作网页。说白了,就是把咱们平时"上网办事"这套流程给彻底包揽了。另一边hermes-agent也挺有意思,主打一个"陪你共同成长",这信号很明确:智能体早就不是那种死板的工具了,它开始变成能持续进化的数字搭档。
能力边界拓得更宽了。AutoDesign搞了套元框架优化方案,硬是把多模态信息变成结构化输出的过程,拆解成了长周期的智能体任务。以前那些没法落地的复杂设计流程,现在真能跑通了。更狠的是OmniScientist这位"全栈AI科学家",管你什么学科什么模态,人家从抛出假设、跑代码一路干到写论文,科研工作流基本被它包圆了。
本事大了,怎么考评又成了头疼的事。美团技术团队掏出了个解法:想评测一个Agent,结果、过程、效率、风险这四个维度一个都不能少。实际上,他们靠着一套二元化Rubric,硬生生把人机一致率从62%拔高到了92%。这套路子,圈里人确实可以直接抄作业。
从帮你点网页,到包揽科研全流程,再到底层评测体系的立起来,智能体的基建已经搭得差不多了。现在再看这些AI智能体,它早就不是什么花架子Demo。它就是个能干硬活的数字员工。