AI+ 2026-09-19
DeepSeek 首次拆开自家「引擎盖」:DSec 论文披露 agent 训练基础设施
DeepSeek 在 arXiv 发布论文《DeepSeek Elastic Compute(DSec)》(提交于 2026 年 9 月 19 日,130 余位作者,提交人正是创始人梁文锋)。这篇 31 页的论文首次系统性披露了支撑其大规模智能体(agentic)训练与评估的生产级沙箱平台——今日在 Hacker News 引发热议,被视为「DeepSeek 成本神话」的底层答案首次公开。
解决什么问题
Agent 模型的强化学习训练需要海量「可执行环境」:模型要在隔离沙箱里查代码库、调工具、跑命令,交互动辄成百上千步。这类负载与传统 GPU 训练完全不同——沙箱短时间海量突发创建、隔离要求异构、会话状态要跨长交互保持、镜像体积庞大而复用率低。瓶颈不在算力芯片,而在环境执行的吞吐。
DSec 的答案:把沙箱做成弹性云
- 统一 SDK 下四种沙箱后端:FnCall(函数调用级)、容器、microVM、完整虚拟机,按隔离强度与开销按需选用;
- 惊人的生产数字:单个生产单元约 160 个节点,每天服务约 300 万个沙箱、支持超 38 万并发、每秒可持续创建 5000+ 个;
- 镜像按需加载:依托自研分布式文件系统 3FS,环境镜像分层版本化、按需拉取,避免海量镜像复制;
- 与 RL 框架协同设计:把有状态的 rollout 执行与可抢占的 GPU 训练解耦——训练资源紧张时协调沙箱生命周期、保留 rollout 状态并回收空闲资源,同时缓解 reward hacking 等 agent 投机行为。
为什么这篇论文重要
DeepSeek 的低成本训练一直被外界归因于「工程效率」,但细节从不外传。DSec 把agent 训练中最容易被忽视的基础设施层(环境执行的调度、隔离、存储)完整拆给全行业看,等于承认:agentic RL 军备竞赛的下一站不是买更多 GPU,而是把「环境吞吐」做成基础设施。这为国内 AI 基础设施自主化提供了一个完整的技术样板——从沙箱运行时、调度器到分布式文件系统全部自研。
对企业的启示
- 1评测即基础设施:任何认真做 AI Agent 的团队,迟早需要自己的「沙箱农场」来跑回归评测——DSec 的分层镜像 + 弹性调度思路,即使缩小一千倍也适用;
- 2成本结构在转移:选型 AI 平台时,除了 token 单价,「环境执行/工具调用的吞吐成本」正在成为 Agent 应用的隐形大头;
- 3ProMen 在为企业搭建 AI+ 自动化时,评测环境与执行边界(沙箱隔离、出口审计)是标准交付项。如果您正在规划 Agent 类应用的评测体系,欢迎与我们交流。