9 月 24 日,一条来自每日经济新闻的硬核动态被不少工程师转发:DeepSeek 发布系统论文《DeepSeek Elastic Compute:大规模 Agent 训练的沙箱基础设施》,署名人里出现了梁文锋。论文介绍的 Dsec,是 DeepSeek 用于 Agent 强化学习训练与评测的生产级沙箱平台——从 DeepSeek V3.2 到 V4.1,其强化学习训练和评测的 Sandbox 负载全都跑在它上面。
对普通人来说,"沙箱"听起来像个技术边角料。但对今天的模型公司而言,它正在变成和模型权重一样核心的资产:当 Agent 从"生成一段文本"进化到"调用工具、运行代码、执行多轮任务",训练时就不再是喂数据那么简单,而是要给模型造出成千上万个能跑代码、能出错、能重来的"安全练习场"。Dsec 就是 DeepSeek 的答案。
一组数字看 Dsec 的体量
论文披露的生产单元规格相当扎实:一个 Dsec 生产单元约由 160 台 CPU 节点、3 万颗 CPU Core 和 250TB DRAM 组成。在这个底座上,单日能服务约 300 万个 Sandbox,峰值同时在线超过 38 万个,创建速度超过 5000 个/秒。
什么概念?强化学习训练 Agent,本质是让模型在海量"练习局"里试错——每一步动作都要在一个隔离环境里真正执行,成功了给奖励、失败了重来。300 万个 Sandbox/日、峰值 38 万同时在线,意味着 DeepSeek 每天要让几十万"虚拟练习生"并行刷题,且能在一秒内拉起五千多个新环境。这种吞吐,不是几台服务器能扛的,而是把"训练基础设施"本身当成了工程产品来打磨。
真正的技术亮点:把启动成本打下来
更值得拆解的是论文里提到的按需加载优化。Dsec 的按需加载镜像方案,将 8192 个 Container 的启动时间控制在约 35 分钟,相比完整远程拉取方案缩短了约 42%,磁盘写入量下降约 57%。
为什么这关键?Agent 训练里,环境启动往往是最容易被忽视的"隐性成本":如果每个练习局都要把整个镜像从远端拉一遍,网络 I/O 和磁盘写放大就会成为瓶颈,训练效率直接被拖垮。Dsec 的做法是"用到哪层加载哪层",既缩短了冷启动,又把存储压力砍掉一半多。在 5000 个/秒的创建速率下,这 42% 和 57% 的优化,换算成的是实打实的算力账单和迭代速度。
为什么这件事值得单独写
过去我们聊国产大模型,焦点大多在"参数多大、跑分多高、开源没开源"。Dsec 论文把视线拉到了更底层——当模型能力逼近临界,决定迭代速度的往往是训练基础设施的工程质量。Agent 时代的训练,既要算得快,也要"环境造得快、隔离得稳、出错容得下",这三者合起来才是闭环。
梁文锋署名也释放了一个信号:头部公司越来越愿意把"怎么把训练跑起来"的方法论公开。对社区而言,这类系统论文的价值不亚于一个开源权重——它告诉后来者,大规模 Agent RL 的沙箱该长什么样、坑在哪。对行业而言,它侧面印证了一件事:国产模型的迭代速度,背后是一整套被认真工程化的基础设施在撑。
冷静判断:这是基础设施论文,不是新模型
需要划清边界:Dsec 是一篇系统/基础设施论文,不是某个新模型发布,也不直接带来"效果更好"的体感。160 台 CPU 节点是"一个生产单元"的规模,真实部署很可能是多单元叠加;而如此体量的沙箱平台,本身也意味着只有具备相应资源的团队才玩得转。普通开发者拿到的是思路与方法,真正复现这套吞吐,依然需要相当的算力与工程积累。
但方向很明确:当 Agent 成为模型能力落地的主战场,谁能把"训练—评测—执行"的闭环基础设施做得又稳又便宜,谁就握住了下一阶段迭代的加速器。DeepSeek 把这件事摊开讲,本身就是一种底气。