已关闭
[Question|问题咨询]: A5 单机 D2D 与 H2D 并发时总带宽是否增加 #598
moonseeker创建于 25 天前关闭于 23 天前
24 天前 将 lining23666 设为负责人
lining23666
24 天前 评论:
24 天前 评论:
这个应该要分场景看,请 @songmingyang 帮忙答复下吧


Song Mingyang
24 天前 评论:
24 天前 评论:
即便是D2rH,在物理通道上也需要过D2D传输这一段物理通道。
如果D2D带宽已经基本打满,那么叠加池化后,总带宽会受限制;如果D2D带宽并未打满,比如只用了一半,那么叠加池化后,总带宽可能会打上去


24 天前 添加了label:wait-feedback
moonseeker
24 天前 评论:
24 天前 评论:
好的,还有另一个问题是在同一个超节点内,一个刀片内的H2D和跨刀片之间的rH2D的传输效率是否有区别,因为本质上rH2D也是在物理上走H2D+D2D是否当传输流运转时,效率就差不多了


24 天前 删除了label:wait-feedback
Song Mingyang
24 天前 评论:
24 天前 评论:
好的,还有另一个问题是在同一个超节点内,一个刀片内的H2D和跨刀片之间的rH2D的传输效率是否有区别,因为本质上rH2D也是在物理上走H2D+D2D是否当传输流运转时,效率就差不多了
理论上性能差异不会太大


moonseeker
23 天前 评论:
23 天前 评论:
好的,谢谢


23 天前 issue状态由 进行中 改变为 已完成
23 天前 关闭了 issue
场景
A5 单机内同时向同一个 D 节点 NPU 写入 KV Cache:
默认使用:
export ASCEND_GLOBAL_RESOURCE_CONFIG='{"comm_resource_config.protocol_desc":["ub_ctp:device"]}'根据 #550,Host 内存会通过 UBMEM 映射为 Device VA,D2D、D2rH、rH2D、H2H 复用一条 Device→Device Channel。
想确认的问题
ub_ctp:device和ub_ctp:host,H2D 是否能走独立 Host 链路,从而提高聚合带宽?主要想确认:在该场景中引入 Host DRAM 池化,能否增加 P→D 与 Pool→D 的总传输带宽,还是两路最终仍受同一 D2D 链路带宽限制。