大模型智能体能干的事变多了。光靠模型自身的参数知识早就不够用,挂载外部技能成了标配,但怎么选对技能是个大麻烦。以前大家喜欢把所有技能的元数据全塞进上下文里,不仅费token还容易让模型犯晕。有新研究直接从冻结的LLM内部唤醒原生技能路由,让大模型遇到任务时自己挑合适的工具,不再死记硬背。
选对技能只是第一步,解决复杂的长程任务才是真考验。语言模型写个简短的数学证明还能凑合,一旦遇到需要连续做出不确定决策的长期科研问题,立马就不靠谱了。针对这个短板,Stellar Colosseum框架引入了多智能体博弈场。它靠多个智能体协作,攻克数学和理论计算机领域的长程研究难题,把单打独斗变成接力赛,解决长线推理不可靠的问题。
除了推理能力,智能体的记忆力也是个坎。强化学习里最头疼的就是“学新忘旧”,模型学了新技能转头就忘了旧知识。阿尔伯塔大学团队搞出FAME框架,给了一个能求解的公式,专门对付持续强化学习里的灾难性遗忘。这套方法让智能体持续学习时稳住底盘,学新东西不用从头再来。
内部技能路由、多智能体长程协作加上持续学习的记忆固化,这套组合拳打下来,智能体摆脱了“一锤子买卖”。底层架构升级让AI能干实事,大模型开始做记忆、规划、协作这些活儿,成了数字劳动力。