Recipes for shrinking, optimizing, customizing cutting edge vision models. 💜
| Files | Last commit | Last update |
|---|---|---|
| 1 year ago | ||
| 3 months ago | ||
| 2 years ago | ||
| 10 months ago | ||
| 10 months ago | ||
| 10 months ago | ||
| 10 months ago | ||
| 2 years ago | ||
| 10 months ago | ||
| 10 months ago | ||
| 10 months ago | ||
| 10 months ago | ||
| 10 months ago | ||
| 10 months ago | ||
| 10 months ago | ||
| 10 months ago | ||
| 11 months ago | ||
| 10 months ago | ||
| 11 months ago | ||
| 2 years ago | ||
| 10 months ago | ||
| 7 months ago | ||
| 10 months ago | ||
| 10 months ago | ||
| 10 months ago | ||
| 10 months ago | ||
| 10 months ago | ||
| 1 year ago | ||
| 3 months ago | ||
| 2 years ago | ||
| 1 year ago | ||
| 1 year ago | ||
| 1 year ago |
Translated by AI, submit an issue feedback
Smol Vision 🐣
用于缩减、优化、定制前沿视觉与多模态 AI 模型的实用指南。
最新示例 👇🏻
注意: GitHub 长期以来一直无法渲染笔记本,因此包含丰富输出的 smol-vision 笔记本现在托管在此处。我仍会更新此仓库,但在此处阅读体验欠佳。
| 类别 | 笔记本 | 描述 |
|---|---|---|
| 量化/ONNX | 使用 Optimum 实现更快更小的零样本目标检测 | 使用 Optimum ONNXRuntime 工具量化最先进的零样本目标检测模型 OWLv2。 |
| 视觉语言模型微调 | 微调 PaliGemma | 使用 transformers 微调最先进的视觉语言骨干模型 PaliGemma。 |
| Optimum/ORT 入门 | 使用 🤗 Optimum 优化 DETR | 关于将视觉模型导出至 ONNX 并进行量化的入门介绍。 |
| 模型缩减 | 计算机视觉中的知识蒸馏 | 用于图像分类的知识蒸馏。 |
| 量化 | 使用 Quanto 适配视觉模型 | 使用 quanto 将视觉模型适配到更小的硬件设备上 |
| 加速 | 使用 torch.compile 加速基础模型 | 使用 torch.compile 改善基础模型的延迟 |
| [新增] 视觉语言模型微调 | 微调 Florence-2 | 在 DocVQA 数据集上微调 Florence-2 |
| 视觉语言模型微调 | QLoRA/在 VQAv2 上微调 IDEFICS3 或 SmolVLM | 使用 QLoRA/全量微调在 VQAv2 数据集上微调 IDEFICS3 或 SmolVLM 模型 |
| 视觉语言模型微调(脚本) | 使用 QLoRA 在 VQAv2 上微调 IDEFICS3 | 使用 QLoRA/全量微调在 VQAv2 数据集上微调 IDEFICS3 或 SmolVLM 模型 |
| [新增] 视觉语言模型微调 | 基于 Grounded 的微调 | 用于视觉语言模型的 Grounded 微调方法 |
| [新增] 视觉模型微调 | 微调 DINOv3 | 为视觉任务微调 DINOv3 模型 |
| 多模态 RAG | 使用 ColPali 和 Qwen2-VL 的多模态 RAG | 学习使用 Byaldi 中的 ColPali 进行文档检索并构建 RAG 流水线,无需复杂的文档处理,然后使用 Qwen2-VL 进行生成 |
| 多模态检索器微调 | 为多模态 RAG 微调 ColPali | 学习在 ColPali 上应用对比微调,使其适应您自己的多模态文档 RAG 使用场景 |
| 全模态微调 | 微调 Gemma-3n 以处理所有模态(音频-文本-图像) | 微调 Gemma-3n 模型以处理任何模态:音频、文本和图像。 |
| 全模态 RAG | 使用 OmniEmbed 和 Qwen 的全模态(视频)RAG | 使用 OmniEmbed 和 Qwen 跨模态(包括视频)进行检索和生成。 |
| 加速/内存优化 | 使用 TGI 部署视觉语言模型(即将推出) | 探索使用文本生成推理(TGI)来加速视觉语言模型部署并减少内存占用 |
| 量化/Optimum/ORT | 使用 Optimum 对图像分割模型进行全级别量化和图优化(即将推出) | 使用 Optimum 进行端到端模型优化 |