可用于准确转录多语言、方言、混合语言、歌曲歌词、知识密集型内容及嘈杂环境下的语音。该项目是小米MiMo团队开发的先进ASR模型,支持多场景识别,具备原生标点生成等亮点。【此简介由AI生成】
| Files | Last commit | Last update |
|---|---|---|
| 4 months ago | ||
| 4 months ago | ||
| 4 months ago | ||
| 4 months ago | ||
| 4 months ago | ||
| 4 months ago | ||
| 4 months ago |
━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
MiMo-V2.5-ASR:跨语言、方言及复杂声学场景的
稳健语音识别系统
━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
简介
MiMo-V2.5-ASR 是由小米MiMo团队研发的一款顶尖端到端自动语音识别(ASR)模型。该模型旨在针对普通话、英语、多种汉语方言、语码转换语音、歌曲歌词、知识密集型内容、嘈杂声学环境以及多说话人对话等场景,提供精准且稳健的转写服务。MiMo-V2.5-ASR在众多公开基准测试中均取得了领先性能。
摘要
自动语音识别系统需要能够准确转写来自不同语言、方言、口音和领域的语音信号,并且能适应各种声学环境下的采集条件。尽管传统的端到端模型在域内数据上表现出色,但在方言混杂、语码转换、知识密集型内容、嘈杂环境以及多说话人对话等复杂场景中,仍难以满足实际应用需求。为此,我们推出了由小米MiMo团队研发的端到端语音识别模型MiMo-V2.5-ASR。通过大规模中间训练、高质量有监督微调以及创新的强化学习算法,MiMo-V2.5-ASR在以下方面实现了系统性提升:
- 🗣️ 汉语方言:原生支持吴语、粤语、闽南语、四川话等多种方言。
- 🔀 语码转换:无需语言标签,即可无缝实现汉英语码转换语音的转写。
- 🎵 歌曲识别:高精度转写中英文歌曲歌词,即使在伴奏与 vocals 混合的情况下也表现出色。
- 🔊 嘈杂环境:在强噪声、远场拾音等恶劣声学条件下仍保持稳健的识别性能。
- 👥 多说话人:准确转写会议等场景中存在重叠语音的多方对话。
- 🇬🇧 复杂英语场景:在Open ASR Leaderboard上,针对如AMI等具有挑战性的英语基准测试取得领先成绩。
- 📚 知识密集型识别:精准识别古典诗词、专业术语、人名、地名等知识密集型内容。
- 📝 原生标点:直接从韵律和语义中生成标点,输出即-ready-to-use的转写文本,无需后续处理。
结果
MiMo-V2.5-ASR 已在涵盖标准普通话与英语、汉语方言、歌词识别及内部业务场景的广泛基准测试中完成评估。下方图表总结了 MiMo-V2.5-ASR 在这些场景中的平均性能表现。

有关各基准测试的具体数据及定性案例,请参考我们的 博客。
模型下载
| 模型 | 🤗 Hugging Face |
|---|---|
| MiMo-Audio-Tokenizer | XiaomiMiMo/MiMo-Audio-Tokenizer |
| MiMo-V2.5-ASR | XiaomiMiMo/MiMo-V2.5-ASR |
pip install huggingface-hub
hf download XiaomiMiMo/MiMo-Audio-Tokenizer --local-dir ./models/MiMo-Audio-Tokenizer
hf download XiaomiMiMo/MiMo-V2.5-ASR --local-dir ./models/MiMo-V2.5-ASR
快速开始
借助内置的 Gradio 应用,几分钟内即可启动 MiMo-V2.5-ASR 演示。
前提条件(Linux)
- Python 3.12
- CUDA >= 12.0
安装
git clone https://github.com/XiaomiMiMo/MiMo-V2.5-ASR.git
cd MiMo-V2.5-ASR
pip install -r requirements.txt
pip install flash-attn==2.7.4.post1
Note
如果 flash-attn 的编译耗时过长,您可以下载预编译的 wheel 包并手动安装:
pip install /path/to/flash_attn-2.7.4.post1+cu12torch2.6cxx11abiFALSE-cp312-cp312-linux_x86_64.whl
运行演示
python run_mimo_asr.py

这将启动 MiMo-V2.5-ASR 的本地 Gradio 界面。您可以:
- 上传音频文件或直接通过麦克风录制。
- 可选择指定语言标签(中文/英文/自动)以让模型偏向特定语言,或保留为自动以进行自动语言检测(推荐用于语码转换语音)。
- 该演示在后台调用
asr_sft()接口。
要在启动时自动加载模型和分词器,请在命令行中传入它们的路径:
python run_mimo_asr.py \
--model-path ./models/MiMo-V2.5-ASR \
--tokenizer-path ./models/MiMo-Audio-Tokenizer
否则,请在 模型配置 选项卡中输入 MiMo-Audio-Tokenizer 和 MiMo-V2.5-ASR 的本地路径,然后开始转录!
Python API
使用 asr_sft 接口的基本用法:
from src.mimo_audio.mimo_audio import MimoAudio
model = MimoAudio(
model_path="./models/MiMo-V2.5-ASR",
tokenizer_path="./models/MiMo-Audio-Tokenizer",
)
# Automatic language detection (recommended for code-switching)
text = model.asr_sft("path/to/audio.wav")
print(text)
# With explicit language tag
text_zh = model.asr_sft("path/to/audio.wav", audio_tag="<chinese>")
text_en = model.asr_sft("path/to/audio.wav", audio_tag="<english>")
引用
@misc{coreteam2026mimov25asr,
title={MiMo-V2.5-ASR: Robust Speech Recognition Across Languages, Dialects, and Complex Acoustic Scenarios},
author={LLM-Core-Team Xiaomi},
year={2026},
url={https://github.com/XiaomiMiMo/MiMo-V2.5-ASR},
}
联系方式
如有任何问题,请通过mimo@xiaomi.com与我们联系,或提交issue。
Introduction
可用于准确转录多语言、方言、混合语言、歌曲歌词、知识密集型内容及嘈杂环境下的语音。该项目是小米MiMo团队开发的先进ASR模型,支持多场景识别,具备原生标点生成等亮点。【此简介由AI生成】
Customize your domain