智能体三线突围:零样本协作、法律推理与降本
AI技术

智能体三线突围:零样本协作、法律推理与降本

三篇arXiv新论文凑到一起,说的都是同一件事:智能体不只要能干活,还得会配合、能扛长流程、算得过来账。具身协作、法律推理、成本控制,三个方向看着不搭界,卡点却是同一类——信息不全、状态一直在变、预算有限。

第一篇《Partially Observable Zero-shot coordination by Predicting Intention of Partner》盯的是“队友看不见”的场景。具身任务里搭档常常一会儿在视野内、一会儿消失,现有方法只能拿到模棱两可的搭档表征,还要硬扛隐藏状态带来的不确定性。研究者的解法是让智能体预测搭档意图,不再死盯动作轨迹。看不见人也能猜出他要干嘛,零样本协作才有戏。

第二篇《Test-Time Agent Evolution for Long-Horizon Legal Reasoning》把战场搬到法律。法律流程动辄跨数月,案件状态持续变化,还牵扯原告、被告、律师、法官多个角色,真实部署中性能明显衰减。论文提出在测试阶段让智能体持续演化,边办案边更新策略,训练完不定型。长程任务最怕“开局聪明、后面掉线”,这刀补得正好。

第三篇《Agent in a Bottle》问得更直白:LLM能解决很多窄任务,但要处理几百万条相关实例,一条条查下去成本高得离谱。那智能体能不能自己动手,把能力变成更便宜、能规模化的东西,比如写段脚本、建个规则库,替掉反复调用大模型?能自己造工具省钱,才谈得上落地。

三条线合起来看,智能体拼的是“更扛造”。部分可观测下会猜意图,长流程里能自我演化,成本压力下会自己造轮子。谁先把这三件事同时做扎实,谁才有资格谈通用。