已关闭
tokenizer data-producer 初始化失败(如模型目录无 chat_template)会让 EPP 永不就绪,经 InferencePool 的全部请求挂死/503 —— 期望 init 阶段与运行期一致 fail-open #118
edison_su创建于 7月11日关闭于 8月14日
7月11日 添加了label:sig/sig-ai-inference
openFuyao-bot
7月11日 评论:
7月11日 评论:
欢迎来到 openFuyao 社区
Hey @edison_su , 感谢你对社区的贡献.
机器人使用手册
有关指令的使用,可以点击 此处 查看详情。开发人员可以在每个PR或Issue下方评论特定指令来触发机器人任务。
联系指引
有疑问可以联系 SIG: sig-ai-inference ,
维护者是: @foxbit, @regandy ,
审核者是: @ShiroChen, @piamposer-li, @qinwenzh .


7月20日 将 lileqi 设为负责人
8月6日 添加了label:bug
8月14日 关联了里程碑:v26.09
8月14日 关联了看板:openFuyao - v26.09问题单
8月14日 issue状态由 开启 改变为 待测试
8月14日 issue状态由 待测试 改变为 已完成
8月14日 关闭了 issue
8月14日 issue状态由 已完成 改变为 开启
8月14日 重新打开了 issue
8月14日 issue状态由 开启 改变为 待测试
8月14日 issue状态由 待测试 改变为 已完成
8月14日 关闭了 issue
8月14日 将 kangzhenji 设为负责人
环境
extensionRef.failureMode: FailOpen)--tokenizer-mode deepseek_v4内置渲染,不依赖 HF 模板)现象
apply_chat_template失败: EPP 侧Plugin.Init进入无限重试:000,60-90s);上游 Envoy AI Gateway 侧表现为503 no healthy upstream(envoy access log:response_flags: UH, response_code_details: no_healthy_upstream,upstream_cluster 为该 HTTPRoute rule 对应的 InferencePool cluster);期望行为
tokenizer 插件在运行期对单请求失败已是明确 fail-open(日志
continuing without tokenized prompt,请求继续走负载信号调度)。但初始化阶段失败却导致整条路由 fail-closed,两者不一致:failureMode: FailOpen在这个拓扑下无法自然兜底 —— 这可能需要在 EPP 侧保证"永远给出一个端点"来兑现 FailOpen 语义。复现步骤(标准配置)
相关(供参考,非本 issue 诉求)
prepareDataTimeout,kubernetes-sigs/gateway-api-inference-extension#2081)。长 prompt(实测 ~3.7ms/1k token,≥50k token 且与引擎争 CPU 时)tokenize 必超时,逐请求静默 fail-open → kvcache-aware 在长上下文场景实际不生效。hermes 作为集成方或需 vendor 调整/推动上游可配置化。deepseek_v4渲染逐 token 对齐的等价 jinja chat_template(经引擎 /tokenize 多组探针比对一致)后注入 tokenizer 目录。仅为解除 init 阻塞;不改变本 issue 描述的 fail-closed 行为本身。