已关闭
[Question|问题咨询]: A5 单机 D2D 与 H2D 并发时总带宽是否增加 #598
moonseeker创建于  25 天前关闭于  23 天前
moonseeker
moonseeker
25 天前 创建

场景

A5 单机内同时向同一个 D 节点 NPU 写入 KV Cache:

  • D2D:P 节点 NPU HBM → D 节点 NPU HBM;
  • H2D(rH2D):Host DRAM 中的池化 KV → 同一个 D 节点 NPU HBM。

默认使用:

export ASCEND_GLOBAL_RESOURCE_CONFIG='{"comm_resource_config.protocol_desc":["ub_ctp:device"]}'

根据 #550,Host 内存会通过 UBMEM 映射为 Device VA,D2D、D2rH、rH2D、H2H 复用一条 Device→Device Channel。

想确认的问题

  1. D2D 与 rH2D 同时运行时,是否会争用同一条物理链路或带宽?聚合带宽会高于单独运行 D2D 吗?
  2. 如果配置 ub_ctp:deviceub_ctp:host,H2D 是否能走独立 Host 链路,从而提高聚合带宽?
  3. 是否有 A5 实测数据?希望对比:
    • D2D 单跑带宽;
    • rH2D 单跑带宽;
    • D2D + rH2D 并发时两路各自带宽及总带宽。

主要想确认:在该场景中引入 Host DRAM 池化,能否增加 P→D 与 Pool→D 的总传输带宽,还是两路最终仍受同一 D2D 链路带宽限制。

likedislike
Llining23666成员
24 天前 将 lining23666 设为负责人
lining23666成员
24 天前 评论:

这个应该要分场景看,请 @songmingyang 帮忙答复下吧

likedislike
Song Mingyang成员
24 天前 评论:

即便是D2rH,在物理通道上也需要过D2D传输这一段物理通道。
如果D2D带宽已经基本打满,那么叠加池化后,总带宽会受限制;如果D2D带宽并未打满,比如只用了一半,那么叠加池化后,总带宽可能会打上去

likedislike
Llining23666成员
24 天前 添加了label:wait-feedback
moonseeker
moonseeker
24 天前 评论:

好的,还有另一个问题是在同一个超节点内,一个刀片内的H2D和跨刀片之间的rH2D的传输效率是否有区别,因为本质上rH2D也是在物理上走H2D+D2D是否当传输流运转时,效率就差不多了

likedislike
CANN-robotCANN-robot成员
24 天前 删除了label:wait-feedback
Song Mingyang成员
24 天前 评论:

好的,还有另一个问题是在同一个超节点内,一个刀片内的H2D和跨刀片之间的rH2D的传输效率是否有区别,因为本质上rH2D也是在物理上走H2D+D2D是否当传输流运转时,效率就差不多了

@moonseeker

理论上性能差异不会太大

likedislike
moonseeker
moonseeker
23 天前 评论:

好的,谢谢

likedislike
moonseekermoonseeker
23 天前 issue状态由 进行中 改变为 已完成
moonseekermoonseeker
23 天前 关闭了 issue