训练一个能自己改代码、装依赖、跑测试的 Agent,难的不只是模型,而是让它在真实环境里反复试错却不把集群拖垮。DeepSeek 把这套「大本营」写成了公开技术报告。
据 DeepSeek 在知乎发布的技术长文与同步公开的 arXiv 报告《DeepSeek Elastic Compute (DSec): A Sandbox Infrastructure for Effective Agentic Training at Scale》,DSec(DeepSeek Elastic Compute)是支撑 DeepSeek-V4 全部训练、评测与数据预处理的沙盒基础设施,由 DeepSeek 联合清华大学撰写,作者团队逾 130 人,梁文锋亦在列。
统一接入与分层环境: Agent 任务对隔离强度与开销要求差异很大。DSec 提供 FnCall、Container、MicroVM、Full VM 四种执行后端,经统一 Python SDK(libdsec)按任务选型:短任务复用预创建容器,通用软件工程走 Container,安全类任务抬升到 MicroVM,需要图形界面或 Android 时用 Full VM。环境被拆成基础镜像、工作区、工具包三层,以 EROFS 存储并经 OverlayFS 组合;某一层更新不必整镜像重建。生产侧一周数据曾出现逾万基础镜像与逾十万工作区规模,分层组合是为压住重建成本。
按需加载与超卖: 实测显示沙盒运行时真正访问的数据往往只占镜像的约 4%–13%。镜像数据放在 3FS,本地只拉元数据、数据按需读。集中创建约 8192 个容器的实验里,相对完整拉取,任务完成时间约从 60 多分钟降到约 35 分钟,磁盘写入约减 57%。Agent 训练中沙盒多数时间在等模型下一步,约九成沙盒平均 CPU 用量不超过申请量的 5%,但内存需持续驻留以保留进程与文件状态,生产超卖率可超 50 倍;virtio-pmem/DAX 共享页缓存等机制用于压峰值内存。
与 GPU 训练解耦: 自 DeepSeek-V4.1 起,轨迹执行(rollout)迁到 DSec:Agent 沙盒与工作容器部署在可抢占 GPU 池之外,训练任务被抢占后执行状态仍可保留,恢复后从中断处继续。环境构建本身也由跑在 DSec 上的 Agent 完成,并用 pack_diff 做增量快照与轨迹分叉。安全侧则以 AppArmor、eBPF 网络白名单等约束越权读写与外联。
生产规模: 单个扩展分片约 160 台服务器、约 3 万 CPU 核与 250 TB 内存,日均约服务 300 万沙盒,峰值并发逾 38 万,每秒可创建逾 5000 个;多片部署可支撑数百万沙盒并行。从 V3.2 到 V4.1,DSec 承载了相关 Agent 沙盒全量负载。对产业,这是把「Agent RL 能不能规模化」从口号落到可复用的基础设施白皮书;复现与商用边界仍以 arXiv 报告与团队后续开源计划为准。