项目概览
Xiaomi MiMo(Mind in Motion)是小米集团自研的大语言模型产品线,面向 Agent 时代设计,覆盖文本生成、全模态理解、语音合成三大能力域。它被定位为一套完整的智能体基础模型体系,设计目标是“完成任务”而非仅仅是“回答问题”。MiMo 解决的核心问题是让 AI 从“能对话”进化到“能干活”,能够稳定完成近千轮工具调用的长程任务,自主诊断和恢复错误,并同时处理文本、图像、音频、视频等多种模态信息。截至 2026 年 4 月,MiMo 系列已迭代至 V2.5 版本,包含旗舰推理模型 MiMo-V2.5-Pro、全模态 Agent 模型 MiMo-V2.5、语音合成模型 MiMo-V2.5-TTS、语音识别模型 MiMo-V2.5-ASR 以及轻量快速模型 MiMo-V2-Flash。其核心架构创新包括混合注意力机制和全模态统一架构,并强调 Token 效率优化。
解决什么问题
MiMo 解决的核心问题是:如何让 AI 从“能对话”进化到“能干活”。传统 LLM 能写代码片段、能回答问题,但在面对真实世界的复杂任务时,往往会中途崩溃或逻辑断裂。MiMo 的设计目标就是让模型能够稳定完成近千轮工具调用的长程任务,自主诊断和恢复错误,精确捕捉隐含需求,保持超长上下文的逻辑一致性,并同时看、听、读,将多模态理解转化为行动。
工作方式
MiMo 采用 Agent-native 训练方式,在训练阶段就接触大量的 Agent 场景,而非仅在 Chat 场景上对齐。其核心架构创新是混合注意力机制(Hybrid Attention),通过将标准注意力与稀疏注意力混合,在保持模型性能的同时降低推理成本。全模态版本采用原生统一架构,使用统一 Tokenizer 将文本、图像、音频、视频映射到同一语义空间,跨模态特征在早期就互相融合。训练流程包括大规模预训练、Agent SFT、Agent RL、多模态对齐、安全对齐和部署优化等阶段。
核心能力
- 稳定完成近千轮工具调用的长程任务
- 自主诊断和恢复错误
- 原生全模态统一理解(文本/图像/音频/视频)
- M tokens 超长上下文窗口
- 混合注意力机制降低推理成本
- Token 效率优化,比竞品节省 42%-50% Token
- 语音合成支持声纹克隆、音色设计和歌唱合成
- API 兼容 OpenAI 和 Anthropic 格式
使用前需要了解
- AI 整理 · 本地测试,未经人工复核;依据历史报告节选,不代表当前产品状态。
- 当前 V2.5 系列尚未开源,无法本地部署或进行模型层面的定制。语音合成模型仅支持 8K 上下文,不适合长文本一次性合成。V2-Flash 只有 256K 上下文,不适合复杂 Agent 任务。部分基准测试结果来自官方公告,缺少独立第三方复现。对模型可解释性有极高要求的场景可能不适用。

