已开启
fix: 增大 STEP_SYNC_TIMEOUT 至 180000 #2768
cann_wangyq创建于 6 天前
fix: 增大 STEP_SYNC_TIMEOUT 至 180000 #2768
已开启
共 1 个文件变更+1-1
| @@ -18,7 +18,7 @@ namespace ops_hccl { | |||
| 18 | 18 | ||
| 19 | // 用于 step 同步的专用 notify 索引(不与 ACK(0)/DATA(1)/FIN_ACK(2) 冲突) | 19 | // 用于 step 同步的专用 notify 索引(不与 ACK(0)/DATA(1)/FIN_ACK(2) 冲突) |
| 20 | constexpr u32 NOTIFY_IDX_STEP_SYNC = 0; | 20 | constexpr u32 NOTIFY_IDX_STEP_SYNC = 0; |
| 21 | -constexpr u32 STEP_SYNC_TIMEOUT = 18000; | 21 | +constexpr u32 STEP_SYNC_TIMEOUT = 180000; |
| 22 | 22 | ||
| 23 | /** | 23 | /** |
| 24 | * @brief 统一的 NHR BatchTransfer 接口,覆盖所有收发场景: | 24 | * @brief 统一的 NHR BatchTransfer 接口,覆盖所有收发场景: |
[检视] 🟡 Medium — 资源管理
STEP_SYNC_TIMEOUT从 18000 增大到 180000(10 倍)。超时时间增大 10 倍意味着同步失败时等待时间从 18 秒延长到 180 秒(3 分钟)。这会显著影响故障检测的及时性——如果某个 rank 挂死,其他 rank 需要等 3 分钟才能超时返回。
反证:如果 DPU 侧 step 同步确实需要更长时间(如大规模集群或高延迟网络),增大超时是合理的。
建议:确认增大的原因。建议通过环境变量(如
HCCL_STEP_SYNC_TIMEOUT)配置,而非硬编码,让用户根据集群规模调整。