已合并
[docs]刷新D2D特性说明文档 #627
yilunh创建于 7月28日
[docs]刷新D2D特性说明文档 #627
已合并
yilunh创建于 7月28日
2 个文件变更+13-8
@@ -40,6 +40,7 @@ nav:
40 - 链路追踪: user_guide/features/tracing.md40 - 链路追踪: user_guide/features/tracing.md
41 - ScaleP2D 故障恢复: user_guide/features/fault_tolerance/scale_p2d.md41 - ScaleP2D 故障恢复: user_guide/features/fault_tolerance/scale_p2d.md
42 - 容器快照: user_guide/features/container_snapshot.md42 - 容器快照: user_guide/features/container_snapshot.md
43+ - D2D 权重加载加速: user_guide/features/startup_acceleration.md
43 - 虚推健康探测: user_guide/features/sim_inference.md44 - 虚推健康探测: user_guide/features/sim_inference.md
44 - 故障场景重调度: user_guide/features/fault_tolerance/rescheduler.md45 - 故障场景重调度: user_guide/features/fault_tolerance/rescheduler.md
45 - 精度检测: user_guide/features/precision_detection.md46 - 精度检测: user_guide/features/precision_detection.md
Rexamples/features/startup_acceleration/README.mddocs/zh/user_guide/features/startup_acceleration.md+12-8
@@ -36,15 +36,15 @@ Peer 发现与路由由 Controller / NodeManager 自动完成,**无需手动
36| 字段 | 必填 | 说明 |36| 字段 | 必填 | 说明 |
37|------|------|------|37|------|------|------|
38| `source` | 是 | 固定为 `"auto"`,表示 peer 地址由 Controller 自动填充 |38| `source` | 是 | 固定为 `"auto"`,表示 peer 地址由 Controller 自动填充 |
39-| `listen_port` | 是 | 本实例对外提供权重服务的起始端口;各 device 实际端口为 `listen_port + device_offset` |39+| `listen_port` | 是 | 本实例对外提供权重服务的起始端口;各 device 实际端口为 `listen_port + device_rank(含dp偏移)` |
40 40 
41-若模型启用了投机推理(如 `speculative-config` / MTP),主模型与 draft 模型共用同一组 `source` 和 `listen_port`配置,无需额外配置。draft 权重服务端口会在 `listen_port` 基础上**自动偏移 10000**。41+若模型启用了投机推理(如 `speculative-config` / MTP),主模型与 draft 模型共用同一组 `source` 和 `listen_port`配置,无需额外配置。draft 权重服务端口会在 `listen_port` 基础上**自动偏移 10000**,此时建议port配置 < 55535 - device_rank
42 42 
43### 可选字段43### 可选字段
44 44 
45| 字段 | 说明 |45| 字段 | 说明 |
46|------|------|46|------|------|
47-| `int8_cache` | 是否启用 INT8 缓存,由于当前把接收端反量化做在了接收权重之后,量化版权重建议配置"INT8_CACHE":"dram" |47+| `int8_cache` | 是否启用 INT8 缓存,默认不开启参数直传 |
48| `int8_cache_name` | INT8 缓存名称 |48| `int8_cache_name` | INT8 缓存名称 |
49| `output_prefix` | 权重输出前缀 |49| `output_prefix` | 权重输出前缀 |
50 50 
@@ -63,7 +63,7 @@ Controller 判定 D2D 开启需同时满足:
63## 部署步骤63## 部署步骤
64 64 
651. 在模型对应的 `user_config.json` 中按上文添加 `model_loader_extra_config`(Prefill / Decode / Union 按实际角色分别配置)。651. 在模型对应的 `user_config.json` 中按上文添加 `model_loader_extra_config`(Prefill / Decode / Union 按实际角色分别配置)。
66-2. 使用 [Deployer](../../deployer/README.md) 部署首个实例,等待实例进入 ACTIVE 状态。66+2. 部署首个实例,等待实例进入 ACTIVE 状态。
673. 扩容或部署同角色新实例时,Controller 会自动向新实例下发 peer IP。673. 扩容或部署同角色新实例时,Controller 会自动向新实例下发 peer IP。
68 68 
69## 使用约束69## 使用约束
@@ -77,9 +77,13 @@ Controller 判定 D2D 开启需同时满足:
77 77 
78以下模型已在 PyMotor 示例配置中验证 D2D 启动加速:78以下模型已在 PyMotor 示例配置中验证 D2D 启动加速:
79 79 
80-| 模型 | 配置目录 |80+| 模型 | 配置目录(参考) |
81|------|----------|81|------|----------|
82-| Qwen3-30B | `examples/infer_engines/vllm/models/qwen/3/30b/` |82+| Qwen3-30B | `examples/infer_engines/vllm/models/qwen_235b/` |
atomgit-bot
atomgit-botatomgit-bot7月28日

🟡 Medium Priority

文档「已测试模型」表格第 82 行标注模型名称为 "Qwen3-30B",但对应配置目录 examples/infer_engines/vllm/models/qwen_235b/ 中的 served_model_name 实际为 "qwen3_235b"(见 A2/user_config.json 第 24 行)。目录名和 served_model_name 均表明这是 Qwen3-235B(2350 亿参数),而非 30B 模型。

  • 变更行:第 82 行,表格 | Qwen3-30B | ...qwen_235b/ |
  • 受影响行为:用户将按表格中的 "Qwen3-30B" 来匹配自己的模型,300 亿参数模型用户可能错误使用该配置,而 2350 亿参数模型用户可能忽略该条目
  • 失效模式:配置与模型规格不匹配,可能导致 OOM、启动失败等运行时问题

建议:将模型名称从 "Qwen3-30B" 修正为 "Qwen3-235B",与目录名及 served_model_name 对齐。

改动建议
82
- | Qwen3-30B | `examples/infer_engines/vllm/models/qwen_235b/` |
82
+ | Qwen3-235B | `examples/infer_engines/vllm/models/qwen_235b/` |
应用建议
likedislike
83-| DeepSeek-V3.1 | `examples/infer_engines/vllm/models/deepseek/v3_1/` |83+| DeepSeek-V3.1-w8a8-mtp | `examples/infer_engines/vllm/models/deepseek_v3.1/` |
84+| Deepseekv4-flash-w8a8-mtp | `examples/infer_engines/vllm/models/deepseek_v4_flash/` |
85+| DeepSeek-V4-Pro-w4a8 | `examples/infer_engines/vllm/models/deepseek_v4_pro/` |
86+| GLM-5.1-w4a8 | `examples/infer_engines/vllm/models/glm_5.1/` |
87+| GLM-5.1-w8a8 | `examples/infer_engines/vllm/models/glm_5.1/` |
84 88 
85-其他未测试模型如有问题,欢迎至官方提 [ISSUE](https://gitcode.com/Ascend/MindIE-PyMotor/issues)。89+非典配场景或其他未测试模型如有问题,欢迎至官方提 [ISSUE](https://gitcode.com/Ascend/MindIE-Motor/issues)。