纳德拉在 Sources 播客里给 Agent 定了调:这是比云计算大几个数量级的机会。微软的棋路不只是当 OpenAI 大股东、靠 Azure 卖算力赚差价,而是想把智能体嵌进整个软件栈。话喊得响,底下得有人把活儿干了。
arXiv 新论文 JOVE 就在解决"怎么干"。它把复杂推理拆成有向无环任务图,分发给不同规模的模型并行执行,延迟降下来,小模型也能啃硬骨头。更关键的是它把执行校验和资源感知一起做了——拆任务最怕中间一步跑偏,没人验证就是全盘皆输。
另一篇 4DCodeBench 换了考法:让智能体看视频,把动态场景反向重建成可执行的图形程序。这可不是生成一张图,而是把时间加三维空间写成代码。机器人、自动驾驶、内容生成都得靠这种本事,难度比聊天高一个档。
三个信号拼起来意思挺明确:模型侧拼任务调度与结果验证,评测侧拼对物理世界的理解,商业侧拼谁先把智能体做成基础设施。哪一环缺了,Agent 就还停在演示阶段。
接下来一年真正拉开差距的,大概率不是参数量,而是"拆得动、验得准、看得懂世界"这三件事。