smol-vision:基于 transformers/Optimum 的视觉与多模态 AI 模型优化定制项目

Recipes for shrinking, optimizing, customizing cutting edge vision models. 💜

Branch1Tags0
FilesLast commitLast update
1 year ago
3 months ago
2 years ago
10 months ago
10 months ago
10 months ago
10 months ago
2 years ago
10 months ago
10 months ago
10 months ago
10 months ago
10 months ago
10 months ago
10 months ago
10 months ago
11 months ago
10 months ago
11 months ago
2 years ago
10 months ago
7 months ago
10 months ago
10 months ago
10 months ago
10 months ago
10 months ago
1 year ago
3 months ago
2 years ago
1 year ago
1 year ago
1 year ago

Smol

Smol Vision 🐣

用于缩减、优化、定制前沿视觉与多模态 AI 模型的实用指南。

最新示例 👇🏻

注意: GitHub 长期以来一直无法渲染笔记本,因此包含丰富输出的 smol-vision 笔记本现在托管在此处。我仍会更新此仓库,但在此处阅读体验欠佳。

类别 笔记本 描述
量化/ONNX 使用 Optimum 实现更快更小的零样本目标检测 使用 Optimum ONNXRuntime 工具量化最先进的零样本目标检测模型 OWLv2。
视觉语言模型微调 微调 PaliGemma 使用 transformers 微调最先进的视觉语言骨干模型 PaliGemma。
Optimum/ORT 入门 使用 🤗 Optimum 优化 DETR 关于将视觉模型导出至 ONNX 并进行量化的入门介绍。
模型缩减 计算机视觉中的知识蒸馏 用于图像分类的知识蒸馏。
量化 使用 Quanto 适配视觉模型 使用 quanto 将视觉模型适配到更小的硬件设备上
加速 使用 torch.compile 加速基础模型 使用 torch.compile 改善基础模型的延迟
[新增] 视觉语言模型微调 微调 Florence-2 在 DocVQA 数据集上微调 Florence-2
视觉语言模型微调 QLoRA/在 VQAv2 上微调 IDEFICS3 或 SmolVLM 使用 QLoRA/全量微调在 VQAv2 数据集上微调 IDEFICS3 或 SmolVLM 模型
视觉语言模型微调(脚本) 使用 QLoRA 在 VQAv2 上微调 IDEFICS3 使用 QLoRA/全量微调在 VQAv2 数据集上微调 IDEFICS3 或 SmolVLM 模型
[新增] 视觉语言模型微调 基于 Grounded 的微调 用于视觉语言模型的 Grounded 微调方法
[新增] 视觉模型微调 微调 DINOv3 为视觉任务微调 DINOv3 模型
多模态 RAG 使用 ColPali 和 Qwen2-VL 的多模态 RAG 学习使用 Byaldi 中的 ColPali 进行文档检索并构建 RAG 流水线,无需复杂的文档处理,然后使用 Qwen2-VL 进行生成
多模态检索器微调 为多模态 RAG 微调 ColPali 学习在 ColPali 上应用对比微调,使其适应您自己的多模态文档 RAG 使用场景
全模态微调 微调 Gemma-3n 以处理所有模态(音频-文本-图像) 微调 Gemma-3n 模型以处理任何模态:音频、文本和图像。
全模态 RAG 使用 OmniEmbed 和 Qwen 的全模态(视频)RAG 使用 OmniEmbed 和 Qwen 跨模态(包括视频)进行检索和生成。
加速/内存优化 使用 TGI 部署视觉语言模型(即将推出) 探索使用文本生成推理(TGI)来加速视觉语言模型部署并减少内存占用
量化/Optimum/ORT 使用 Optimum 对图像分割模型进行全级别量化和图优化(即将推出) 使用 Optimum 进行端到端模型优化

Introduction

针对缩减、优化、定制尖端视觉模型的食谱。💜【此简介由AI生成】

Customize your domain
251.98 K151Visit GitHub