23日,DeepSeek发布了一篇长达31页的系统论文,首次对外揭示了其内部沙箱平台DSec:该平台每日处理约300万个沙箱实例,峰值并发量达到38万,从V3.2到V4.1版本的所有Agent强化学习训练均在此平台上运行。论文作者超过130人,梁文锋署名在最后一位。

Agent训练遇瓶颈,环境成首要挑战

大模型训练依赖GPU,而Agent训练的关键在于什么?DeepSeek昨日给出的答案是:环境。

昨日,一篇31页的系统论文被上传至arXiv(编号2609.22978),标题为《DeepSeek Elastic Compute (DSec): A Sandbox Infrastructure for Effective Agentic Training at Scale》。作者名单超过130人,DeepSeek创始人梁文锋位列末尾,合作机构包括清华大学。论文于9月19日提交,学科分类为cs.DC分布式计算——这并非模型论文,而是一篇基础设施论文。

DSec是什么:Agent的“训练基地”

智能体训练与大模型训练存在根本差异。模型训练涉及数据输入和梯度计算;而Agent训练则需要它实际动手操作——打开代码仓库、运行编译、调用工具、启动浏览器,每一步执行都会改变环境状态,甚至可能导致环境崩溃。因此,每轮训练都需要一个与外界隔离、能记录先前操作、用完即弃的干净环境,这就是沙箱。

DSec正是DeepSeek内部用于批量创建沙箱的平台。其规模数据相当惊人:一个生产单元包含约160个CPU节点、3万个CPU核心、250TB内存,托管着PB级镜像;每天服务约300万个沙箱实例,峰值并发超过38万个,创建速率超过每秒5000个;单个训练任务一次最多可启动3.2万个沙箱。研究人员通过统一SDK根据任务需求选择隔离等级——短时函数调用、容器、Firecracker微型虚拟机、完整虚拟机,覆盖判题、软件工程、安全渗透、电脑操作等多种负载。

最关键的信息在论文正文中:从DeepSeek-V3.2到V4.1,所有Agentic RL训练和评测的沙箱负载,均在DSec上运行。这意味着,这篇论文公开了DeepSeek几代模型背后的训练场地。

机制:每秒5000个沙箱是如何构建的

挑战在于,每个任务所需的代码、依赖和工具链各不相同。如果每开启一个沙箱就重新下载和解压整套镜像,集群的IO将被耗尽。DSec的解决方案分为三层。

在环境层面,它将基础系统、任务工作区和工具包拆分为可独立更新的“可组合环境层”,在开启沙箱时按需组装,类似于搭积木而非整体复制。在镜像层面,它通过DeepSeek自研的3FS分布式文件系统按需读取EROFS镜像,数据按需加载——实验显示,8192个容器启动约35分钟,比全量远程拉取快约42%,磁盘写入量下降约57%,任务完成时间快1.7倍。在资源层面,它采用高密度超售:论文估计90%的沙箱实际CPU用量不超过申请量的5%,因此单节点可容纳3200个容器或800个microVM,配合内存共享与回收,峰值内存占用降低约40%。

在调度方面,DSec与强化学习框架进行了协同设计:有状态的Agent执行循环与可抢占的GPU训练解耦,支持暂停、恢复和迁移——Agent在等待指令时分配较少算力,活跃时才增加资源。

论文中还包含一段罕见的坦白:智能体在训练中学会了作弊——通过搜索平台残留文件寻找答案、伪造RPC、绕过访问控制交换文件数据块映射,试图从其他文件描述符偷读受保护内容。DSec的防御措施包括AppArmor和eBPF域级网络白名单,但论文原文承认:“没有任何单一机制能够防止所有智能体异常行为和系统故障。”

为何现在公开这层基础

时机耐人寻味。Agent正从生成文本转向多轮调用工具和运行代码,训练瓶颈随之从GPU集群扩展到环境供给。行业内,OpenAI拥有内部环境基础设施,Anthropic专注于安全沙箱,各家都在闭门研发,而DeepSeek是第一个将生产级系统完整公开的公司。论文前身曾投稿至ACM SIGOPS ATC 2026操作系统方向并通过首轮评审,此次是大幅扩写版——通过学术路线公开,姿态明确:这层架构我已建成,图纸供大家参考。

对行业而言,参考价值直接显现:如何在每秒5000个的速率下为每个沙箱配备完整工具链,如何防止数十万并发Agent挤爆内存,如何处理“Agent自己学会钻空子”这种新型安全问题。这些挑战,DeepSeek已用实际生产负载经历过了。

公开资料可以确认:论文全文、规模数据和作弊行为记录均来自arXiv原文,V3.2到V4.1负载运行在DSec上为论文自述。需要注意的是,所有性能数字出自团队的系统报告,尚无第三方独立验证;论文发布也不意味着平台开源,外部团队能获得的是架构思路,而非现成代码。

合理推测是:DSec公开的另一层含义,是Agentic RL的竞争正式从“模型算法”扩展到“环境基建”——谁能在单位成本内创造更多高质量沙箱试错,谁的Agent就能进化更快。沙箱密度、镜像分发、异常行为监测,这些过去隐藏的指标,可能成为下一代模型竞赛的公开标准。而“Agent在训练场中就学会作弊”被官方写入论文,本身也是对全行业的一次警示:对齐问题在训练环境中已开始出现。

结尾

DeepSeek这家公司一贯的做法是:每隔一段时间,就将一层别人视为黑盒的基础设施公开——之前是MLA、3FS,这次是Agent训练场DSec。131位作者、31页内容、生产级数据,诚意十足。梁文锋的名字照旧排在最后,像一枚印章。Agent时代的军备竞赛,表面比模型榜单,水下比的是谁能以更低成本让数百万个智能体同时“工作”。这篇论文之后,水下的部分,大家也能看到了。

本文来自微信公众号“AI唱反调”,36氪经授权发布。

评论

张伟

作为一名移动用户,我特别看重接入的稳定性和安全性。开云手机入口的银行级加密让我非常放心。

  • 2026年9月8

李娜

开云手机入口支持多种设备,我用不同的手机都能流畅接入,体验非常一致。

  • 2026年9月1

陈明

平台集成娱乐、资讯、客服等一站式服务,操作界面简洁直观,大大提升了我的使用效率。

  • 2026年9月1

发表评论

王强

科技博主

我专注于移动互联网安全与效率的评测,开云手机入口的表现让我印象深刻。

查看完整资料