版本信息

更新时间:2026年3月4日 版本:0.1.0


1. 产品概述

1.1 sysHAX-adapter介绍

sysHAX-adapter是一款针对主流推理框架,诸如vLLM、SGLang等的插件系统。sysHAX-adapter 0.1.0版本主要提供的如下能力:

  • 针对ARM架构的CPU推理性能加速能力
  • 针对CPU + xPU的AF分离混合调度能力

Note
sysHAX-adapter 0.1.0版本目前仅针对vllm进行了适配,sysHAX-adapter 0.1.0版本目前支持的vllm版本为0.11.0。
sysHAX 0.1.0版本AF分离功能目前已经验证通过的xPU包括Ascend 910B和metax C500。本文档为针对Ascend 910B的部署指南。

1.2 AF分离

sysHAX-adapter将一部分FFN过程卸载到CPU上,以提升推理总吞吐量。在sysHAX-adapter 0.1.0版本中暂时只实现了将全部FFN卸载到CPU上。

1.3 CPU推理加速

sysHAX-adapter针对ARM架构提供了CPU推理加速算子库,通过NUMA亲和、矩阵分块、算子优化等方式进行优化。

2. 硬件环境

CPU:

类型 型号 说明
CPU Kunpeng 920 7280Z 必须

xPU:

类型 型号 说明
NPU Ascend 910B 必须

3. 快速开始

sysHAX-adapter-0.1.0目前仅支持 Qwen3-30B-A3BQwen3-235B-A22B 模型,或者其GPTQ量化版本,下载链接:

https://huggingface.co/Qwen/Qwen3-30B-A3B
https://huggingface.co/Qwen/Qwen3-30B-A3B-GPTQ-Int4
https://huggingface.co/Qwen/Qwen3-235B-A22B
https://huggingface.co/Qwen/Qwen3-235B-A22B-GPTQ-Int4
  • 拉取镜像:
docker pull hub.oepkgs.net/neocopilot/syshax/syshax-vllm-910b-af:0.1.0
  • 拉起容器:
docker run --name syshax-adapter \
    --privileged \
    --shm-size=64g \
    --device /dev/davinci0 \
    --device /dev/davinci1 \
    --device /dev/davinci2 \
    --device /dev/davinci3 \
    --device /dev/davinci_manager \
    --device /dev/devmm_svm \
    --device /dev/hisi_hdc \
    -v /usr/local/dcmi:/usr/local/dcmi \
    -v /usr/local/bin/npu-smi:/usr/local/bin/npu-smi \
    -v /usr/local/Ascend/driver/lib64/:/usr/local/Ascend/driver/lib64/ \
    -v /usr/local/Ascend/driver/version.info:/usr/local/Ascend/driver/version.info \
    -v /etc/ascend_install.info:/etc/ascend_install.info \
    --net=host \
    -p 8001:8001 \
    -it hub.oepkgs.net/neocopilot/syshax/syshax-vllm-910b-af:0.1.0 bash

上述脚本中,/dev/davinci0 ~ /dev/davinci3 需要根据硬件实际环境进行选择。

  • 启动服务
OMP_WAIT_POLICY=active \
RUN_MODE=AF_SEPARATE  \
VLLM_USE_V1=1 \
OMP_NUM_THREADS=128 \
CUSTOM_CPU_AFFINITY=0-63:2,80-143:2,160-223:2,240-303:2 \
SYSHAX_QUANTIZE=q4q8 \
NRC=4 \
sysHAX-adapter --backend vllm \
    --model /home/models/Qwen3-30B-A3B \
    --load-format syshaxloader \
    --host 0.0.0.0 \
    --port 8001 \
    --dtype=half \
    --block_size=16 \
    --max_model_len=2048 \
    --tensor-parallel-size 1 \
    --gpu_memory_utilization=0.2 \
    --enforce_eager

上述脚本中,--model 为模型路径,根据实际情况调整,其余可默认不变。

4. 测试

  • 测试脚本:
curl http://0.0.0.0:8001/v1/chat/completions -H "Content-Type: application/json" -d '{
    "messages": [
        {
            "role": "user",
            "content": "介绍一下openEuler。"
        }
    ],
    "stream": true,
    "max_tokens": 1024
}'

至此,部署sysHAX-adapter-0.1.0部署完成。