ai-accessibility-narrator:基于 OpenVINO™ GenAI 的端侧图像无障碍解说工具

于 Intel AI PC + OpenVINO™ 构建了一套端侧 AI 无障碍图像解说系统。核心思路是:将视觉语言模型(VLM)通过 OpenVINO 量化和运行时优化,压缩部署到普通 Intel CPU 上,再结合 TTS 文字转语音模块,实现「拍图 → 理解 → 朗读」的完整闭环。整个推理链路无需联网、无需 GPU、无需云端 API,在标准 Intel Core Ultra 设备上即可运行,NPU 加速时延迟相比 CPU 降低约 50%,功耗降低约 68%。我们为此开发了 Gradio Web 应用、命令行工具和一键演示脚本,支持三种输出模式(详细描述、关键词提取、情感朗读),并将完整能力封装为 OpenClaw Skill,使其可以被 Agent 直接调用,而不是停留在一个独立的应用孤岛。

分支1Tags0

项目介绍

于 Intel AI PC + OpenVINO™ 构建了一套端侧 AI 无障碍图像解说系统。核心思路是:将视觉语言模型(VLM)通过 OpenVINO 量化和运行时优化,压缩部署到普通 Intel CPU 上,再结合 TTS 文字转语音模块,实现「拍图 → 理解 → 朗读」的完整闭环。整个推理链路无需联网、无需 GPU、无需云端 API,在标准 Intel Core Ultra 设备上即可运行,NPU 加速时延迟相比 CPU 降低约 50%,功耗降低约 68%。我们为此开发了 Gradio Web 应用、命令行工具和一键演示脚本,支持三种输出模式(详细描述、关键词提取、情感朗读),并将完整能力封装为 OpenClaw Skill,使其可以被 Agent 直接调用,而不是停留在一个独立的应用孤岛。

定制我的领域