文件最后提交记录最后更新时间
1 个月前
1 个月前
8 天前
README

Torch-NPU Distributed SIG

简介

欢迎来到 Torch-NPU Distributed SIG!我们是聚焦于 Torch-NPU 分布式并行技术适配与优化的技术团队,致力于在昇腾 NPU 硬件底座上,围绕 PyTorch 分布式训练框架(torch.distributed)构建高效、易用、可扩展的并行训练能力,为大语言模型、多模态模型和强化学习等场景提供极致性能体验。


仓库列表

名称 领域 介绍
torch_npu 分布式 distributed
TorchTitan-Turbo 分布式 规划中,待发布

工作目标

  1. 昇腾 NPU 集合通信底座与弹性训练:覆盖 HCCL 后端适配、P2P 通信优化、分布式进程启动(torch_npu.distributed.run)、rendezvous 组网与 Elastic Training 弹性机制,为上层各类并行策略提供高效、稳定的通信与调度底座。

  2. 数据并行与显存优化:聚焦 DDP 适配与 FSDP 深度优化,通过内存缓存复用、non-blocking 拷贝、反向重计算通信消除等昇腾定制化增强,显著降低大模型训练显存占用并提升数据并行吞吐量。

  3. 张量并行与混合并行编排:基于 DTensor 与 DeviceMesh,为 Torch 原生和昇腾 NPU 自定义算子(融合注意力、MoE 等)注册分片策略,支撑张量并行(TP)、序列并行(SP)、流水线并行(PP)、上下文并行(CP)等混合并行策略在 NPU 集群上的自动切分与统一编排。

  4. 分布式状态管理与远程执行:覆盖 Distributed Checkpoint(DCP)分片保存/加载、断点续训,以及 RPC 框架 NPU 后端适配,服务大模型长周期训练的容错恢复与分布式异步通信需求。

SIG 为上述领域的专家、爱好者提供了一个交流、合作的平台。我们的愿景是打造昇腾 NPU 上世界领先的 PyTorch 分布式并行训练体验。torch_npu 分布式并行 SIG 的目标有两个:

  1. 持续提升 PyTorch 在昇腾 NPU 上的分布式训练性能与易用性,实现对主流大模型训练框架的无缝兼容。

  2. 结合昇腾硬件特性,孵化业界领先的并行优化技术,助力构建高效能大模型训练底座。


联系方式

1. 定期例会

  • 每月最后一个周五举办线上 SIG 定期例会,汇报任务进展、讨论技术方案、共享最新动态。

  • SIG 组织管理(如运作规则讨论、Maintainers & Committers 担任人员及职责刷新)。

2. 技术研讨与设计评审

  • 组织专题技术分享(如某个 PR 的设计细节、并行训练优化方案)。

  • 开展 RFC(Request for Comments)讨论,对重大设计或功能进行社区评审。

3. Issue 跟进与 PR 评审

  • 定期梳理 Issue / Pull Request。

  • 组织 Maintainer 和 Committer 团队进行 PR Review。

  • 对外公开 Review 记录和决议,保持透明。

4. 社区沟通与对外分享

  • 维护讨论渠道(如 Gitee Issue、邮件列表、微信群、社区论坛等)。

  • 不定期举办社区 Meetup、分享会,分享 SIG 进展与行业、科研成功经验。


SIG成员

Maintainer

Committer