新闻

梁文锋署名!DeepSeek最新论文公开,交出Agent训练“焚决”

1 分钟阅读
来源:zhidx.com
智东西 作者 | 毕伟豪 编辑|李水青 智东西9月23日报道,刚刚,DeepSeek创始人 梁文锋 署名的最新论文公开,首次系统发布了 DeepSeek的Agent训练沙盒平台DSec(DeepSeek Elastic Compute)的技术细节 ,论文提交日期是9月19日,作者名单超过130人,梁文锋在列。 论文地址: https://arxiv.org/pdf/2609.22978 DSec平台首次出现是在DeepSeek V4技术报告中,其主要作用,就是为Agent训练提供沙盒,以实现大规模Agent训练的稳定运行。论文明确写道, 从DeepSeek V3.2到V4.1的RL训练与评测,所有沙盒负载都运行在DSec上,如今公开技术细节,也算是把“焚决”交出来了。 论文显示,DSec平台的规模非常庞大,其中一个生产单元由 约160个CPU节点、3万核、250TB内存构成 ,托管PB级镜像。 能力方面,DSec平台单日服务约 300万个沙盒 ,峰值并发 超过38万个 ,创建速度 超过每秒5000个 ,单个训练任务最多可以 一次性拉起3.2万个沙盒 。 ▲每个任务创建的沙盒数量分布情况 那么问题来了,为什么在Agent训练中需要数量如此庞大的沙盒?而面对复杂的执行环境,DSec又是如何解决规模、调度和资源管理问题的? 一、Agent RL天然需要巨量沙盒,训练环境成为发展瓶颈 传统LLM训练的强化学习,很多时候可以围绕静态的输入、输出和奖励信号展开,但Agent训练和LLM完全不同,需要真正进入真实环境,实际执行检查代码、调用工具、执行命令、修改文件等任务。模型每执行一步,都可