简介
DeepSpeed 是由微软开发的开源深度学习优化库,旨在为大规模深度学习训练提供极致的速度与扩展能力。作为微软 AI at Scale 计划的核心组成部分,DeepSpeed 通过一系列系统级创新,显著提升了大规模模型训练的效率和易用性,重新定义了深度学习训练的可扩展边界。
主要功能
极致的训练速度与规模
DeepSpeed 曾助力训练出当时世界上最强大的语言模型,包括 MT-530B 和 BLOOM 等。其核心创新包括:
- ZeRO(Zero Redundancy Optimizer):内存优化技术,支持万亿参数模型的训练
- 3D-Parallelism:三维并行策略,实现更高效的分布式训练
- DeepSpeed-MoE:专家混合模型优化,提升大规模模型训练效率
- ZeRO-Infinity:突破 GPU 内存限制,支持极端规模的深度学习
- ZeRO-Offload:将优化器状态卸载到 CPU/NVMe,降低 GPU 内存需求
推理优化
- 自动张量并行(Automatic Tensor Parallelism):支持训练和推理阶段的自动张量并行
- DeepNVMe:高效的 NVMe 存储访问优化
模型压缩与效率
- 模型压缩(Model Compression):减少模型大小和计算量
- 数据效率(Data Efficiency):提升数据利用效率
- 课程学习(Curriculum Learning):渐进式学习策略
监控与分析工具
- Flops Profiler:浮点运算性能分析
- PyTorch Profiler:PyTorch 性能分析集成
- 通信日志(Communication Logging):分布式训练通信监控
- 监控(Monitoring):训练过程实时监控
适用场景
大规模语言模型训练
DeepSpeed 已被广泛用于训练多种大规模模型,包括:
| 模型 |
参数量 |
| Megatron-Turing NLG |
530B |
| Jurassic-1 |
178B |
| BLOOM |
176B |
| GLM |
130B |
| YaLM |
100B |
| GPT-NeoX |
20B |
| AlexaTM |
20B |
框架集成
DeepSpeed 已与多个主流开源深度学习框架深度集成:
- Hugging Face Transformers:通过
Transformers with DeepSpeed 实现无缝集成
- Hugging Face Accelerate:
Accelerate with DeepSpeed 加速方案
- PyTorch Lightning:
Lightning with DeepSpeed 支持
- MosaicML:
MosaicML with DeepSpeed 集成
最新动态
DeepSpeed 持续保持活跃更新,近期重要进展包括:
- [2026/05] 支持 Muon 优化器;为 ZeRO-3 引入 SDMA(System DMA)技术,在 AMD GPU 上将集合通信从计算单元卸载,实现更好的计算与通信重叠
- [2025/12] DeepSpeed Core API 更新:支持类 PyTorch 风格的 backward 接口和低精度主状态
- [2025/10] SuperOffload:释放 Superchip 上的大规模 LLM 训练能力;ZenFlow 与 ZeRO offload 性能研究及 CPU 核心绑定优化
参与贡献
DeepSpeed 欢迎社区贡献。开发者可通过以下方式参与:
- 查阅贡献指南了解格式化、测试等规范
- 签署开发者证书协议(DCO),确保每次提交都通过
-s 标志签名
- 遵守微软开源行为准则
学术资源
DeepSpeed 团队在顶级会议和期刊上发表了大量研究成果,涵盖 ZeRO 系列优化、通信高效训练、模型稳定性等多个方向,相关论文可在 arXiv 及 SC、NeurIPS、ICML、USENIX ATC 等会议获取。