AI智能体三连发:自适应框架、自动证明与3D审计
AI技术

AI智能体三连发:自适应框架、自动证明与3D审计

三篇新论文凑到一起,说的是同一件事——决定智能体上限的,往往是外面那层"套壳"。arXiv 上的 Turbo Harness 指出,现有 harness 优化基本只产出一个全局版本,换个场景就掉链子。它的做法是按实例动态适配,给不同场景配各自最合适的套壳。作者把这看作智能体递归自我改进的关键一步——能改自己的工具,才谈得上改自己。

Cogentic 走多智能体编排路线,目标很硬:自动证明开放数学问题。前沿模型单次提问能给出不错的想法,但单发模式没法自我校验,错了也不知道。Cogentic 把猜想、验证、修补拆给不同智能体,串成一条可循环的证明流水线。那些没人做完的题,开始出现机器参与的解法。

WorldAuditBench 盯的是 3D 世界。研究行为时,交互式三维环境用得越来越多,可里面的穿模、悬浮物体之类,靠人工挑太慢。这套基准让多模态智能体自己进场景里逛,主动发现问题,产出审计报告。它把"世界模型好不好"变成了能打分的测试题。

三个工作放一起看,路线很清晰:给智能体配更贴合任务的脚手架,再让它们组队干复杂活。数学证明、3D 场景审计、优化自己的 harness,都是同一套逻辑的延伸。短板也像——评测仍依赖人工设计的环境和题目,放到真实开放场景能跑多远,还得再看。