版本信息
更新时间:2026年3月4日 版本:0.1.0
1. 产品概述
1.1 sysHAX-adapter介绍
sysHAX-adapter是一款针对主流推理框架,诸如vLLM、SGLang等的插件系统。sysHAX-adapter 0.1.0版本主要提供的如下能力:
- 针对ARM架构的CPU推理性能加速能力
- 针对CPU + xPU的AF分离混合调度能力
Note
sysHAX-adapter 0.1.0版本目前仅针对vllm进行了适配,sysHAX-adapter 0.1.0版本目前支持的vllm版本为0.11.0。
sysHAX 0.1.0版本AF分离功能目前已经验证通过的xPU包括Ascend 910B和metax C500。本文档为针对Ascend 910B的部署指南。
1.2 AF分离
sysHAX-adapter将一部分FFN过程卸载到CPU上,以提升推理总吞吐量。在sysHAX-adapter 0.1.0版本中暂时只实现了将全部FFN卸载到CPU上。
1.3 CPU推理加速
sysHAX-adapter针对ARM架构提供了CPU推理加速算子库,通过NUMA亲和、矩阵分块、算子优化等方式进行优化。
2. 硬件环境
CPU:
| 类型 | 型号 | 说明 |
|---|---|---|
| CPU | Kunpeng 920 7280Z | 必须 |
xPU:
| 类型 | 型号 | 说明 |
|---|---|---|
| NPU | Ascend 910B | 必须 |
3. 快速开始
sysHAX-adapter-0.1.0目前仅支持 Qwen3-30B-A3B和 Qwen3-235B-A22B 模型,或者其GPTQ量化版本,下载链接:
https://huggingface.co/Qwen/Qwen3-30B-A3B
https://huggingface.co/Qwen/Qwen3-30B-A3B-GPTQ-Int4
https://huggingface.co/Qwen/Qwen3-235B-A22B
https://huggingface.co/Qwen/Qwen3-235B-A22B-GPTQ-Int4
- 拉取镜像:
docker pull hub.oepkgs.net/neocopilot/syshax/syshax-vllm-910b-af:0.1.0
- 拉起容器:
docker run --name syshax-adapter \
--privileged \
--shm-size=64g \
--device /dev/davinci0 \
--device /dev/davinci1 \
--device /dev/davinci2 \
--device /dev/davinci3 \
--device /dev/davinci_manager \
--device /dev/devmm_svm \
--device /dev/hisi_hdc \
-v /usr/local/dcmi:/usr/local/dcmi \
-v /usr/local/bin/npu-smi:/usr/local/bin/npu-smi \
-v /usr/local/Ascend/driver/lib64/:/usr/local/Ascend/driver/lib64/ \
-v /usr/local/Ascend/driver/version.info:/usr/local/Ascend/driver/version.info \
-v /etc/ascend_install.info:/etc/ascend_install.info \
--net=host \
-p 8001:8001 \
-it hub.oepkgs.net/neocopilot/syshax/syshax-vllm-910b-af:0.1.0 bash
上述脚本中,/dev/davinci0 ~ /dev/davinci3 需要根据硬件实际环境进行选择。
- 启动服务
OMP_WAIT_POLICY=active \
RUN_MODE=AF_SEPARATE \
VLLM_USE_V1=1 \
OMP_NUM_THREADS=128 \
CUSTOM_CPU_AFFINITY=0-63:2,80-143:2,160-223:2,240-303:2 \
SYSHAX_QUANTIZE=q4q8 \
NRC=4 \
sysHAX-adapter --backend vllm \
--model /home/models/Qwen3-30B-A3B \
--load-format syshaxloader \
--host 0.0.0.0 \
--port 8001 \
--dtype=half \
--block_size=16 \
--max_model_len=2048 \
--tensor-parallel-size 1 \
--gpu_memory_utilization=0.2 \
--enforce_eager
上述脚本中,--model 为模型路径,根据实际情况调整,其余可默认不变。
4. 测试
- 测试脚本:
curl http://0.0.0.0:8001/v1/chat/completions -H "Content-Type: application/json" -d '{
"messages": [
{
"role": "user",
"content": "介绍一下openEuler。"
}
],
"stream": true,
"max_tokens": 1024
}'
至此,部署sysHAX-adapter-0.1.0部署完成。