已合并
[docs]刷新D2D特性说明文档 #627
yilunh创建于 7月28日
[docs]刷新D2D特性说明文档 #627
已合并
共 2 个文件变更+13-8
Rexamples/features/startup_acceleration/README.md→docs/zh/user_guide/features/startup_acceleration.md+12-8
| @@ -36,15 +36,15 @@ Peer 发现与路由由 Controller / NodeManager 自动完成,**无需手动 | |||
| 36 | | 字段 | 必填 | 说明 | | 36 | | 字段 | 必填 | 说明 | |
| 37 | |------|------|------| | 37 | |------|------|------| |
| 38 | | `source` | 是 | 固定为 `"auto"`,表示 peer 地址由 Controller 自动填充 | | 38 | | `source` | 是 | 固定为 `"auto"`,表示 peer 地址由 Controller 自动填充 | |
| 39 | -| `listen_port` | 是 | 本实例对外提供权重服务的起始端口;各 device 实际端口为 `listen_port + device_offset` | | 39 | +| `listen_port` | 是 | 本实例对外提供权重服务的起始端口;各 device 实际端口为 `listen_port + device_rank(含dp偏移)` | |
| 40 | 40 | ||
| 41 | -若模型启用了投机推理(如 `speculative-config` / MTP),主模型与 draft 模型共用同一组 `source` 和 `listen_port`配置,无需额外配置。draft 权重服务端口会在 `listen_port` 基础上**自动偏移 10000**。 | 41 | +若模型启用了投机推理(如 `speculative-config` / MTP),主模型与 draft 模型共用同一组 `source` 和 `listen_port`配置,无需额外配置。draft 权重服务端口会在 `listen_port` 基础上**自动偏移 10000**,此时建议port配置 < 55535 - device_rank。 |
| 42 | 42 | ||
| 43 | ### 可选字段 | 43 | ### 可选字段 |
| 44 | 44 | ||
| 45 | | 字段 | 说明 | | 45 | | 字段 | 说明 | |
| 46 | |------|------| | 46 | |------|------| |
| 47 | -| `int8_cache` | 是否启用 INT8 缓存,由于当前把接收端反量化做在了接收权重之后,量化版权重建议配置"INT8_CACHE":"dram" | | 47 | +| `int8_cache` | 是否启用 INT8 缓存,默认不开启,全量参数直传 | |
| 48 | | `int8_cache_name` | INT8 缓存名称 | | 48 | | `int8_cache_name` | INT8 缓存名称 | |
| 49 | | `output_prefix` | 权重输出前缀 | | 49 | | `output_prefix` | 权重输出前缀 | |
| 50 | 50 | ||
| @@ -63,7 +63,7 @@ Controller 判定 D2D 开启需同时满足: | |||
| 63 | ## 部署步骤 | 63 | ## 部署步骤 |
| 64 | 64 | ||
| 65 | 1. 在模型对应的 `user_config.json` 中按上文添加 `model_loader_extra_config`(Prefill / Decode / Union 按实际角色分别配置)。 | 65 | 1. 在模型对应的 `user_config.json` 中按上文添加 `model_loader_extra_config`(Prefill / Decode / Union 按实际角色分别配置)。 |
| 66 | -2. 使用 [Deployer](../../deployer/README.md) 部署首个实例,等待实例进入 ACTIVE 状态。 | 66 | +2. 部署首个实例,等待实例进入 ACTIVE 状态。 |
| 67 | 3. 扩容或部署同角色新实例时,Controller 会自动向新实例下发 peer IP。 | 67 | 3. 扩容或部署同角色新实例时,Controller 会自动向新实例下发 peer IP。 |
| 68 | 68 | ||
| 69 | ## 使用约束 | 69 | ## 使用约束 |
| @@ -77,9 +77,13 @@ Controller 判定 D2D 开启需同时满足: | |||
| 77 | 77 | ||
| 78 | 以下模型已在 PyMotor 示例配置中验证 D2D 启动加速: | 78 | 以下模型已在 PyMotor 示例配置中验证 D2D 启动加速: |
| 79 | 79 | ||
| 80 | -| 模型 | 配置目录 | | 80 | +| 模型 | 配置目录(参考) | |
| 81 | |------|----------| | 81 | |------|----------| |
| 82 | -| Qwen3-30B | `examples/infer_engines/vllm/models/qwen/3/30b/` | | 82 | +| Qwen3-30B | `examples/infer_engines/vllm/models/qwen_235b/` | |
| 83 | -| DeepSeek-V3.1 | `examples/infer_engines/vllm/models/deepseek/v3_1/` | | 83 | +| DeepSeek-V3.1-w8a8-mtp | `examples/infer_engines/vllm/models/deepseek_v3.1/` | |
| 84 | +| Deepseekv4-flash-w8a8-mtp | `examples/infer_engines/vllm/models/deepseek_v4_flash/` | | ||
| 85 | +| DeepSeek-V4-Pro-w4a8 | `examples/infer_engines/vllm/models/deepseek_v4_pro/` | | ||
| 86 | +| GLM-5.1-w4a8 | `examples/infer_engines/vllm/models/glm_5.1/` | | ||
| 87 | +| GLM-5.1-w8a8 | `examples/infer_engines/vllm/models/glm_5.1/` | | ||
| 84 | 88 | ||
| 85 | -其他未测试模型如有问题,欢迎至官方提 [ISSUE](https://gitcode.com/Ascend/MindIE-PyMotor/issues)。 | 89 | +非典配场景或其他未测试模型,如有问题,欢迎至官方提 [ISSUE](https://gitcode.com/Ascend/MindIE-Motor/issues)。 |
🟡 Medium Priority
文档「已测试模型」表格第 82 行标注模型名称为 "Qwen3-30B",但对应配置目录
examples/infer_engines/vllm/models/qwen_235b/中的served_model_name实际为"qwen3_235b"(见A2/user_config.json第 24 行)。目录名和 served_model_name 均表明这是 Qwen3-235B(2350 亿参数),而非 30B 模型。| Qwen3-30B | ...qwen_235b/ |建议:将模型名称从 "Qwen3-30B" 修正为 "Qwen3-235B",与目录名及 served_model_name 对齐。
0B | `examples/infer_engines/vllm/models/qwen_235b/` |