DeepSeek上新了一篇论文,首次把Agent训练的"大本营"摆到台面上——DSec沙箱系统。论文由梁文锋署名,覆盖从V3.2到V4.1所有Agent的训练流程。最扎眼的数字是:单日跑出300万沙箱实例。这不是模型参数,是水下基建的产能。
沙箱就是给Agent一块隔离的"操场":跑代码、调工具、试错、被打分,全在可控环境里完成。Agent能力能不能稳定长出来,很大程度取决于这套环境够不够快、够不够真、够不够扛造。一天300万实例意味着并行调度、资源回收、结果回传全都跑顺了。以前大家拼模型权重,现在开始拼训练场,沙箱本身也能变成护城河。
钱的事也在同步推进。DeepSeek在IPO前夕把年化营收翻番到10亿美元,资本化节奏明显提速,同时铺开全栈AI布局。一边是训练基建论文,一边是收入曲线,两条线撞在同一时间点不是巧合。有了现金流和投资人预期,长周期的基础设施投入才敢下重注。
把三件事串起来看:DSec负责造Agent,营收负责供弹药,IPO负责打开融资通道。DeepSeek想证明的不只是模型强,而是从训练环境到商业闭环都能自己跑通。接下来值得盯的是,对手愿不愿意也砸这么多工程资源去追这套沙箱体系。