
Xiaomi MiMo 大模型
小米自研的 Agent 基础模型,面向“完成任务”而非“回答问题”设计
Xiaomi MiMo(Mind in Motion)是小米集团自研的大语言模型产品线,面向 Agent 时代设计,覆盖文本生成、全模态理解、语音合成三大能力域。它被定位为一套完整的智能体基础模型体系,设计目标是“完成任务”而非仅仅是“回答问题”。MiMo 解决的核心问题是让 AI 从“能对话”进化到“能干活”,能够稳定完成近千轮工具调用的长程任务,自主诊断和恢复错误,并同时处理文本、图像、音频、视频等多种模态信息。截至 2026 年 4 月,MiMo 系列已迭代至 V2.5 版本,包含旗舰推理模型 MiMo-V2.5-Pro、全模态 Agent 模型 MiMo-V2.5、语音合成模型 MiMo-V2.5-TTS、语音识别模型 MiMo-V2.5-ASR 以及轻量快速模型 MiMo-V2-Flash。其核心架构创新包括混合注意力机制和全模态统一架构,并强调 Token 效率优化。
