已关闭
[RFC]: NPU-Exporter支持分组配置采集周期 #212
wuweilin创建于  4月25日关闭于  26 天前
wuweilin成员
4月25日 创建

提交提案之前,请先检索仓库内是否已有相同的提案,如已有请在同一提案中进行讨论。

需求背景

背景与价值

NPU-Exporter从驱动中查询了大量的指标数据,这些指标共用一个查询周期。这会造成两个问题

  1. A3场景有16张卡,每张卡要调用几十次驱动接口,完整执行一次查询的耗时,大于了默认查询周期5秒。造成了数据采集周期错位、协程堆积等问题。
  2. NPU利用率等重要指标,需要1秒查询1次,才能更准确的展示数据变化情况,需要进一步调低查询周期。

需求描述

  1. NPU-Exporter的指标按照业务类型、重要程度、接口耗时拆分成多个指标组
  2. 每个指标组独立配置采集的周期,也可以配置关闭采集
  3. 原本的统一周期配置也会生效,存在时强制覆盖各指标组的配置,以保证兼容性
  4. 通过指标插件,自定义的指标,也支持采集周期配置
  5. prometheus、telagraf的数据采集配置及逻辑与原来不变

提议方案

方案设计

  1. 现有的指标分组需要重新规划,将耗时超过50ms的接口拆分,指标组命令时,标识该组是请求时间长的接口
  2. 指标配置的metricConfiguration.json文件,新增查询周期字段,最低支持配置至1秒
  3. 原有的周期采集逻辑重构,遍历所有的指标组,当前时间 >= 指标组上一次采集时间+采集周期的,就进入本地采集的任务队列中,并执行采集

健壮性设计

  1. 每完成一次采集后,固定sleep 1秒,避免NPU-Exporter一直处于指标查询的运行态
  2. 永远不会变的部分指标,采集周期降低至1天一次
  3. 耗时比较长的数据,默认采集周期调整至大于一个采集周期

验收标准

  1. 将NPU利用率指标调整至1秒一次,其他指标10秒一次,调用指标获取接口,能观察到每秒NPU利用率的指标都在变更,而其他的指标每10秒更新一次
  2. 将HDK版本接口的采样周期调整为1天一次,1天内,npu-exporter不重启的话,版本获取接口一天只会调用一次

意见征集周期

2026-5-8

抄送名单

其他补充说明

欢迎加入社区,感谢您对社区的贡献 🎉!

likedislike
Wwuweilin成员
4月25日 添加了label:rfc
Wwuweilin成员
4月25日 修改了issue 的描述
Wwuweilin成员
4月25日 修改了issue 的描述
Atlas_zxp
Atlas_zxp成员
4月25日 评论:

/label add triaged

likedislike
ascend-robotascend-robot成员
4月25日 添加了label:triaged
此处折叠了10条事件消息 查看更多
董peng董peng成员
26 天前 将 dongpeng18 设为负责人
董peng
董peng成员
26 天前 评论:

/label add resolved

likedislike
ascend-robotascend-robot成员
26 天前 添加了label:resolved
lirui2381lirui2381成员
26 天前 issue状态由 TODO 改变为 DONE
lirui2381lirui2381成员
26 天前 关闭了 issue