本文档描述自动并行策略搜索中 Expert Parallelism,EP,估算能力的设计需求。不包含具体代码实现,侧重 MoE 场景下的专家显存、token dispatch/combine、专家计算、负载不均衡建模与验收标准。
在 MoE 模型中,模型参数量主要来自大量专家层。Expert Parallelism,EP,通过沿专家维切分专家参数,使不同设备持有不同专家,从而降低单卡专家参数和优化器状态显存。
但 EP 也引入了 MoE 特有的 token dispatch/combine 通信,并且实际性能会受到 tokens_per_expert 负载分布影响。对于大规模 MoE 模型,自动并行策略搜索需要估算不同 ep_degree、num_experts、top_k、capacity factor 和 token 分布下的显存与性能代价。
EP 显存估算应覆盖:
EP 性能估算应覆盖:
应检查:
dp × tp × pp × ep
自动并行策略搜索 Expert Parallelism 估算能力支持
本文档描述自动并行策略搜索中 Expert Parallelism,EP,估算能力的设计需求。不包含具体代码实现,侧重 MoE 场景下的专家显存、token dispatch/combine、专家计算、负载不均衡建模与验收标准。
1. 背景
在 MoE 模型中,模型参数量主要来自大量专家层。Expert Parallelism,EP,通过沿专家维切分专家参数,使不同设备持有不同专家,从而降低单卡专家参数和优化器状态显存。
但 EP 也引入了 MoE 特有的 token dispatch/combine 通信,并且实际性能会受到 tokens_per_expert 负载分布影响。对于大规模 MoE 模型,自动并行策略搜索需要估算不同 ep_degree、num_experts、top_k、capacity factor 和 token 分布下的显存与性能代价。
2. 目标与非目标
2.1 目标
2.2 非目标
3. 建模语义
3.1 显存估算
EP 显存估算应覆盖:
3.2 性能估算
EP 性能估算应覆盖:
3.3 约束
应检查:
dp × tp × pp × ep等组合不超过可用设备数;4. 实现要点
5. 测试设计
6. 验收标准
7. 参考