智能体三连击:记忆复用、推理评测与乐高搭建
AI技术

智能体三连击:记忆复用、推理评测与乐高搭建

手机GUI智能体有个毛病,记忆太死板。它们把成功的操作轨迹存下来,下次碰到类似任务就翻出来复用。可新任务几乎不会和旧任务一模一样——参数变了,界面改了,按钮挪了位。arXiv上的DeltaReplay提出"任务相对"的记忆复用,不照搬整条轨迹,按新任务的需要裁剪、对齐旧经验。别背答案,学会抄思路。

智能体会做决策,可怎么衡量它的决策能力,一直是笔糊涂账。拼图、推箱子这类题目,常被拿来测顺序决策能力,但不同研究范式各测各的,结果没法横向比较。有篇论文提出一套三维刻画框架,把任务难度、推理深度、环境反馈这些维度拆开,让不同方法的评测结果能放进同一张表。评测标准不统一,排行榜再热闹也只是自嗨。

另一篇BrickBench盯上了乐高。给一句文字提示,智能体得自己设计并拼出一套结构,既要符合语义要求,又要满足设计标准。这活儿比答题难:从文字到三维实体,中间要过空间推理、部件规划、稳定性判断几道关。有了这个基准,"能不能动手做出来"就成了可量化的分数。

三篇论文指向同一个尴尬:智能体的能力在涨,记忆机制和评测方法没跟上。记不住、比不了、造不出,是大模型下场当"手脚"时要过的三道坎。DeltaReplay管复用,三维框架管比较,BrickBench管动手,能不能串成一条线,还得看后续。