已开启
[feature] 分布式算子 ST 测试迁移至 Gloo CPU 后端(43 算子 206 用例) #122
sargerasking创建于 5月11日
5月11日 修改了issue 的描述
5月11日 修改了issue 的描述
5月11日 关联了pull request:test: migrate 43 distributed op ST tests to Gloo CPU backend (206 cases)
5月11日 关联了pull request:test: migrate 43 distributed op ST tests to Gloo CPU backend (206 cases)
分布式算子 ST 测试迁移至 Gloo CPU 后端
背景
当前 HyperParallel 的分布式算子 ST 测试(
tests/torch/shard/ops/)依赖 Ascend NPU + HCCL 后端执行,只能在 NPU 机器上运行。这导致:方案
将所有分布式算子 ST 测试用例迁移至 Gloo CPU 后端,使测试可在任意 x86 机器上通过
torchrun执行,无需 NPU 硬件。迁移范围
迁移方式
每个算子测试文件(
parallel_op_*.py)末尾追加test_gloo_*系列函数,使用:init_dist_gloo()替代init_dist()(Gloo CPU 后端初始化)device_type="cpu"替代device_type="npu".npu()设备转换init_device_mesh+distribute_tensor直接构造 DTensor对应的 shell 入口文件(
test_parallel_op_*.py)追加@arg_mark(plat_marks=["cpu_linux"])测试入口,通过torchrun_case启动。影响分析
init_dist_gloo()辅助函数(tests/torch/utils.py),扩展mark_utils.py支持列表参数