Announcements
No Announcements
Popular repositories
97
MiMo-V2.5-Pro作为旗舰模型,擅⻓处理复杂Agent任务,单次任务可完成近千次⼯具调⽤与⼗余轮上 下⽂压缩。
46
MiMo-V2.5-Pro-FP4-DFlash 是驱动 MiMo-V2.5-Pro-UltraSpeed 的底层模型: FP4 量化骨干网络:对 MoE 专家采用 MXFP4 量化,同时保持模型其他部分的更高精度,在几乎无损质量的前提下,显著减小模型体积并降低内存带宽压力。 BF16 DFlash 草稿生成器:用于块扩散推测解码,每次前向传播可生成一整个块的 tokens,并让骨干网络一步完成验证。 两者协同作用,既降低了每参数的位宽,又减少了骨干网络前向传播的次数,而这两者正是万亿参数模型解码过程中的两大主要成本来源。
7
MiMo-V2.5 是一款具备强大智能体能力的原生全模态模型,在统一架构下支持文本、图像、视频及音频理解。该模型基于 MiMo-V2-Flash 骨干网络构建,并扩展了专用的视觉和音频编码器,在多模态感知、长上下文推理及智能体工作流方面均展现出卓越性能。
6
小米 MiMo 系列 Agent Skills
1
MiMo-V2.5 是一款具备强大智能体能力的原生全模态模型,在统一架构下支持文本、图像、视频及音频理解
1
MiMo-V2.5-Pro 是一款开源的混合专家(MoE)语言模型,总参数量达1.02万亿,激活参数量为420亿。它采用了 MiMo-V2-Flash 中引入的混合注意力架构和3层多 token 预测(MTP)技术,上下文长度最高可达100万 token。
Project Showcase
More >- 基于超亿小时数据预训练,具备音频理解与生成少样本学习能力,在语音智能和音频理解基准上达开源SOTA,支持语音转换、风格迁移等未训练任务及高质量语音生成。like
- MiMo-Audio-7B-Instruct在音频理解基准测试、口语对话基准测试和指令TTS评估中均达到开源SOTA水平,接近甚至超越闭源模型。like
- MiMo-Audio-Tokenizer 是一个拥有 12 亿参数、运行频率为 25 Hz 的 Transformer。它采用八层 RVQ 堆叠,每秒可生成 200 个 tokens。通过联合优化语义和重建目标,我们在一千万小时的语料库上从头开始训练 MiMo-Audio-Tokenizer,实现了卓越的重建质量,并为下游语言建模提供了便利。like
- 小米 MiMo 系列 Agent SkillsStar
- MiMo-Embodied 是一款功能强大的跨具身视觉语言模型,在自动驾驶和具身智能任务中均展现出最先进的性能。它是首个融合这两个关键领域的开源视觉语言模型(VLM),显著提升了在动态物理环境中的理解与推理能力。like
- MiMo-V2-Flash 是一款混合专家(MoE)语言模型,总参数量达3090亿,激活参数量为150亿。该模型专为高速推理和智能体工作流设计,采用创新的混合注意力架构与多 token 预测(MTP)技术,在实现卓越性能的同时大幅降低推理成本。like
- MiMo-V2-Flash 是一款混合专家(Mixture-of-Experts, MoE)语言模型,总参数量达 3090 亿,激活参数量为 150 亿。该模型专为高速推理和智能体工作流设计,采用创新的混合注意力架构和多 token 预测(Multi-Token Prediction, MTP)技术,在实现业界领先性能的同时,大幅降低了推理成本。like
- MiMo-V2.5-Pro 是一款开源的混合专家(MoE)语言模型,总参数量达1.02万亿,激活参数量为420亿。它采用了 MiMo-V2-Flash 中引入的混合注意力架构和3层多 token 预测(MTP)技术,上下文长度最高可达100万 token。like
- MiMo-V2.5 是一款具备强大智能体能力的原生全模态模型,在统一架构下支持文本、图像、视频及音频理解like
- MiMo-V2.5-Pro作为旗舰模型,擅⻓处理复杂Agent任务,单次任务可完成近千次⼯具调⽤与⼗余轮上 下⽂压缩。like
Announcements
No Announcements
Achievements
162
Star
0
Fork
2.05 K
Download
Common Languages
Python
Shell

