MiMo-V2.5-ASR-code:基于端到端技术的自动语音识别项目

可用于准确转录多语言、方言、混合语言、歌曲歌词、知识密集型内容及嘈杂环境下的语音。该项目是小米MiMo团队开发的先进ASR模型,支持多场景识别,具备原生标点生成等亮点。【此简介由AI生成】

Branch1Tags0
FilesLast commitLast update
4 months ago
4 months ago
4 months ago
4 months ago
4 months ago
4 months ago
4 months ago
Xiaomi-MiMo

━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
MiMo-V2.5-ASR:跨语言、方言及复杂声学场景的
稳健语音识别系统
━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━



简介

MiMo-V2.5-ASR 是由小米MiMo团队研发的一款顶尖端到端自动语音识别(ASR)模型。该模型旨在针对普通话、英语、多种汉语方言、语码转换语音、歌曲歌词、知识密集型内容、嘈杂声学环境以及多说话人对话等场景,提供精准且稳健的转写服务。MiMo-V2.5-ASR在众多公开基准测试中均取得了领先性能。

摘要

自动语音识别系统需要能够准确转写来自不同语言、方言、口音和领域的语音信号,并且能适应各种声学环境下的采集条件。尽管传统的端到端模型在域内数据上表现出色,但在方言混杂、语码转换、知识密集型内容、嘈杂环境以及多说话人对话等复杂场景中,仍难以满足实际应用需求。为此,我们推出了由小米MiMo团队研发的端到端语音识别模型MiMo-V2.5-ASR。通过大规模中间训练、高质量有监督微调以及创新的强化学习算法,MiMo-V2.5-ASR在以下方面实现了系统性提升:

  • 🗣️ 汉语方言:原生支持吴语、粤语、闽南语、四川话等多种方言。
  • 🔀 语码转换:无需语言标签,即可无缝实现汉英语码转换语音的转写。
  • 🎵 歌曲识别:高精度转写中英文歌曲歌词,即使在伴奏与 vocals 混合的情况下也表现出色。
  • 🔊 嘈杂环境:在强噪声、远场拾音等恶劣声学条件下仍保持稳健的识别性能。
  • 👥 多说话人:准确转写会议等场景中存在重叠语音的多方对话。
  • 🇬🇧 复杂英语场景:在Open ASR Leaderboard上,针对如AMI等具有挑战性的英语基准测试取得领先成绩。
  • 📚 知识密集型识别:精准识别古典诗词、专业术语、人名、地名等知识密集型内容。
  • 📝 原生标点:直接从韵律和语义中生成标点,输出即-ready-to-use的转写文本,无需后续处理。

结果

MiMo-V2.5-ASR 已在涵盖标准普通话与英语、汉语方言、歌词识别及内部业务场景的广泛基准测试中完成评估。下方图表总结了 MiMo-V2.5-ASR 在这些场景中的平均性能表现。

Results

有关各基准测试的具体数据及定性案例,请参考我们的 博客

模型下载

模型 🤗 Hugging Face
MiMo-Audio-Tokenizer XiaomiMiMo/MiMo-Audio-Tokenizer
MiMo-V2.5-ASR XiaomiMiMo/MiMo-V2.5-ASR
pip install huggingface-hub

hf download XiaomiMiMo/MiMo-Audio-Tokenizer --local-dir ./models/MiMo-Audio-Tokenizer
hf download XiaomiMiMo/MiMo-V2.5-ASR --local-dir ./models/MiMo-V2.5-ASR

快速开始

借助内置的 Gradio 应用,几分钟内即可启动 MiMo-V2.5-ASR 演示。

前提条件(Linux)

  • Python 3.12
  • CUDA >= 12.0

安装

git clone https://github.com/XiaomiMiMo/MiMo-V2.5-ASR.git
cd MiMo-V2.5-ASR
pip install -r requirements.txt
pip install flash-attn==2.7.4.post1

Note

如果 flash-attn 的编译耗时过长,您可以下载预编译的 wheel 包并手动安装:

pip install /path/to/flash_attn-2.7.4.post1+cu12torch2.6cxx11abiFALSE-cp312-cp312-linux_x86_64.whl

运行演示

python run_mimo_asr.py

MiMo-V2.5-ASR Demo

这将启动 MiMo-V2.5-ASR 的本地 Gradio 界面。您可以:

  • 上传音频文件直接通过麦克风录制。
  • 可选择指定语言标签(中文/英文/自动)以让模型偏向特定语言,或保留为自动以进行自动语言检测(推荐用于语码转换语音)。
  • 该演示在后台调用 asr_sft() 接口。

要在启动时自动加载模型和分词器,请在命令行中传入它们的路径:

python run_mimo_asr.py \
    --model-path ./models/MiMo-V2.5-ASR \
    --tokenizer-path ./models/MiMo-Audio-Tokenizer

否则,请在 模型配置 选项卡中输入 MiMo-Audio-TokenizerMiMo-V2.5-ASR 的本地路径,然后开始转录!

Python API

使用 asr_sft 接口的基本用法:

from src.mimo_audio.mimo_audio import MimoAudio

model = MimoAudio(
    model_path="./models/MiMo-V2.5-ASR",
    tokenizer_path="./models/MiMo-Audio-Tokenizer",
)

# Automatic language detection (recommended for code-switching)
text = model.asr_sft("path/to/audio.wav")
print(text)

# With explicit language tag
text_zh = model.asr_sft("path/to/audio.wav", audio_tag="<chinese>")
text_en = model.asr_sft("path/to/audio.wav", audio_tag="<english>")

引用

@misc{coreteam2026mimov25asr,
      title={MiMo-V2.5-ASR: Robust Speech Recognition Across Languages, Dialects, and Complex Acoustic Scenarios},
      author={LLM-Core-Team Xiaomi},
      year={2026},
      url={https://github.com/XiaomiMiMo/MiMo-V2.5-ASR},
}

联系方式

如有任何问题,请通过mimo@xiaomi.com与我们联系,或提交issue。

Introduction

可用于准确转录多语言、方言、混合语言、歌曲歌词、知识密集型内容及嘈杂环境下的语音。该项目是小米MiMo团队开发的先进ASR模型,支持多场景识别,具备原生标点生成等亮点。【此简介由AI生成】

Customize your domain