👋 您好,欢迎向 MindStudio msprof 提交 Issue!
我们已收到您的反馈,感谢你对开源社区的支持。🎉
📅处理时效: 维护团队将在24小时内 查看并回复您的问题(工作日)。
🔍自助查询: 在等待期间,建议您先查阅以下资料,可能已有解决方案:
📖 MindStudio msprof官方文档
📝 贡献者指南
请确保 Issue 描述清晰,包含复现步骤和日志,这将帮助我们更快定位问题。谢谢!


#!/bin/sh
export VLLM_USE_MODELSCOPE=True # 指定模型来源为ModelScope
export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True #启用NPU显存可扩展段,减少内存碎片并避免内存不足
export HCCL_BUFFSIZE=512 # 控制两个NPU之间共享数据的缓存区大小。单位为M,需要配置为整数,取值大于等于1,默认值为200,单位M
export OMP_PROC_BIND=false # 禁用OpenMP线程绑定
export OMP_NUM_THREADS=1 # 设置OpenMP线程数
export TASK_QUEUE_ENABLE=1 # 启用任务队列
进入到你想要存放profiling配置文件及点配位文件的路径
cd ./ms_service_profiler_config/
设置环境变量, 后面跟着vll启动命令
SERVICE_PROF_CONFIG_PATH 为采集配置文件,如果指定目录下不存在该文件,将会自动生成一份默认配置
PROFILING_SYMBOLS_PATH 为需要导入的埋点配置文件,也可以选择不设置环境变量,此时将使用默认的配置文件
若指定路径下不存在该文件,系统会生成一份默认配置
SERVICE_PROF_CONFIG_PATH=ms_service_profiler_config.json
PROFILING_SYMBOLS_PATH=service_profiling_symbols.yaml
vllm serve /data/model_weights/Qwen3.5-35B-A3B-w8a8-mtp
--host 0.0.0.0
--port 8765
--data-parallel-size 1
--tensor-parallel-size 2
--seed 1024
--quantization ascend
--served-model-name qwen3.5
--max-num-seqs 32
--max-model-len 133000
--max-num-batched-tokens 8096
--trust-remote-code
--gpu-memory-utilization 0.90
--no-enable-prefix-caching
--speculative_config '{"method": "mtp", "num_speculative_tokens": 3, "enforce_eager": true}'
--compilation-config '{"cudagraph_mode":"FULL_DECODE_ONLY"}'
--additional-config '{"enable_cpu_binding":true}'
--async-scheduling


msserviceprofiler的问题请提到:
https://gitcode.com/Ascend/msserviceprofiler/issues


/label add resolved


在提交新问题之前,请确保您已经在社区中搜索过相关问题,并使用了社区中提供的资源/工具后,仍未找到满意的解决方式。
⚠️ 安全信息提醒:请仔细检查提供的文本内容,确保其不包含敏感数据信息,包括但不限于:
在分享配置信息或代码示例时,请将敏感信息脱敏处理,或使用
<TOKEN>等占位符替代原有内容。环境信息
🐛 问题描述
使用docker compose部署基于quay.io/ascend/vllm-ascend:v0.18.0rc1镜像的Qwen3.5-35B-A3B-w8a8-mtp ,安装pip install msserviceprofiler==1.2.2 通过设置环境变量的方式启动vllm服务后,设置ms_service_profiler_config.json 中的“enable”值为1后,开始采集数据,使用msserviceprofiler analyze --input-path=./ --output-path output 命令解析后,没有chrome_tracing.json文件。
欢迎加入社区,感谢您对社区的贡献 🎉!