Xiaomi MiMo · GitHub 介绍
简介
Xiaomi MiMo 是小米旗下专注于人工智能基础模型研发的开源组织,其官方理念为“激发每一个好奇心,用创意火花点亮。随时询问 Mi!”。该组织在 GitHub 上系统性地开源了多个核心模型与相关工具库,涵盖语言推理、代码生成、音频理解、多模态视觉及具身智能等方向,主要采用 MIT 与 Apache-2.0 开源协议,旨在为全球开发者、研究人员及 AI 爱好者提供高质量、可复现的大模型技术底座。
核心仓库与模型
该组织目前公开维护 15 个代码仓库,其中最具代表性的项目包括:
MiMo :专注于挖掘语言模型从预训练到后训练全流程的推理潜力。
MiMo-Code :主打“模型与智能体(Agents)协同进化”,提供强大的代码理解与生成能力(基于 TypeScript/Python)。
MiMo-V2-Flash :面向高效推理、代码生成与智能体任务的基础模型,兼顾运行效率与模型性能。
MiMo-Audio :探索音频语言模型的少样本(Few-Shot)学习能力,支持多样化的语音交互任务。
MiMo-VL :视觉-语言多模态理解模型。
MiMo-Embodied :面向具身智能(机器人控制与物理世界交互)的专项模型。
MiMo-V2.5-ASR :支持跨语言、多方言及复杂声学场景的鲁棒性语音识别模型。
生态辅助库 :如 MiMo-Skills(智能体技能集)、MiMo-Audio-Eval(音频评估基准)、MiMo-Audio-Training(训练代码)、awesome-mimo-agent(智能体生态精选)等,持续完善模型应用生态。
主要技术特点
全链路开源覆盖 :从基础语言模型延伸至代码、语音、视觉、具身智能等垂直领域,提供完整的技术栈与评估资源。
推理与 Agent 协同进化 :通过专项仓库强化大模型在复杂逻辑推理与自动化智能体任务中的自我迭代与协同能力。
高效计算与少样本适配 :V2-Flash 版本主打轻量化高效推理,Audio 系列则实现音频任务的少样本快速适配,有效降低部署与微调门槛。
多模态与鲁棒性增强 :在语音识别领域深入优化复杂声学环境适应性,并结合 VL 与 Embodied 项目推动视觉、语言与物理动作的联合理解。
适用场景
AI 研发与学术研究 :为 NLP、语音识别、多模态学习与具身智能领域的研究者提供开源基座、训练代码与标准化评估基准。
智能编程与自动化开发 :基于 MiMo-Code 与 V2-Flash 构建代码补全、自动化重构、Agent 驱动的软件开发工作流。
语音交互与音频处理 :利用少样本音频模型与高鲁棒性 ASR 技术,开发跨语种语音助手、会议转录与音频内容分析应用。
多模态应用与机器人 :结合视觉语言理解与具身控制模型,落地图像/视频问答、机器人环境感知与动作规划等前沿场景。
相关链接