| 文件 | 最后提交记录 | 最后更新时间 |
|---|---|---|
| 1 个月前 | ||
| 1 个月前 | ||
| 8 天前 |
Torch-NPU Distributed SIG
简介
欢迎来到 Torch-NPU Distributed SIG!我们是聚焦于 Torch-NPU 分布式并行技术适配与优化的技术团队,致力于在昇腾 NPU 硬件底座上,围绕 PyTorch 分布式训练框架(torch.distributed)构建高效、易用、可扩展的并行训练能力,为大语言模型、多模态模型和强化学习等场景提供极致性能体验。
仓库列表
| 名称 | 领域 | 介绍 |
|---|---|---|
| torch_npu | 分布式 | distributed |
| TorchTitan-Turbo | 分布式 | 规划中,待发布 |
工作目标
-
昇腾 NPU 集合通信底座与弹性训练:覆盖 HCCL 后端适配、P2P 通信优化、分布式进程启动(
torch_npu.distributed.run)、rendezvous 组网与 Elastic Training 弹性机制,为上层各类并行策略提供高效、稳定的通信与调度底座。 -
数据并行与显存优化:聚焦 DDP 适配与 FSDP 深度优化,通过内存缓存复用、non-blocking 拷贝、反向重计算通信消除等昇腾定制化增强,显著降低大模型训练显存占用并提升数据并行吞吐量。
-
张量并行与混合并行编排:基于 DTensor 与 DeviceMesh,为 Torch 原生和昇腾 NPU 自定义算子(融合注意力、MoE 等)注册分片策略,支撑张量并行(TP)、序列并行(SP)、流水线并行(PP)、上下文并行(CP)等混合并行策略在 NPU 集群上的自动切分与统一编排。
-
分布式状态管理与远程执行:覆盖 Distributed Checkpoint(DCP)分片保存/加载、断点续训,以及 RPC 框架 NPU 后端适配,服务大模型长周期训练的容错恢复与分布式异步通信需求。
SIG 为上述领域的专家、爱好者提供了一个交流、合作的平台。我们的愿景是打造昇腾 NPU 上世界领先的 PyTorch 分布式并行训练体验。torch_npu 分布式并行 SIG 的目标有两个:
-
持续提升 PyTorch 在昇腾 NPU 上的分布式训练性能与易用性,实现对主流大模型训练框架的无缝兼容。
-
结合昇腾硬件特性,孵化业界领先的并行优化技术,助力构建高效能大模型训练底座。
联系方式
1. 定期例会
-
每月最后一个周五举办线上 SIG 定期例会,汇报任务进展、讨论技术方案、共享最新动态。
-
SIG 组织管理(如运作规则讨论、Maintainers & Committers 担任人员及职责刷新)。
2. 技术研讨与设计评审
-
组织专题技术分享(如某个 PR 的设计细节、并行训练优化方案)。
-
开展 RFC(Request for Comments)讨论,对重大设计或功能进行社区评审。
3. Issue 跟进与 PR 评审
-
定期梳理 Issue / Pull Request。
-
组织 Maintainer 和 Committer 团队进行 PR Review。
-
对外公开 Review 记录和决议,保持透明。
4. 社区沟通与对外分享
-
维护讨论渠道(如 Gitee Issue、邮件列表、微信群、社区论坛等)。
-
不定期举办社区 Meetup、分享会,分享 SIG 进展与行业、科研成功经验。