MiMo-V2.5:完整规格、定价、API访问与应用场景(2026)
MiMo-V2.5 是小米推出的一款多模态、面向智能体的模型,专为编程、长上下文分析及融合文本、视觉或音频信息的工作流设计。该模型于2026年4月22日发布,采用稀疏专家混合架构,支持最高达100万上下文 token。本指南将梳理该模型的官方能力、Gate.AI 公布的定价、支持的多模态类型、运行权衡、实际应用场景以及截至2026年7月经验证的 API 接入方式。
什么是 MiMo-V2.5?
MiMo-V2.5 是小米研发的一款拥有3100亿参数的稀疏专家混合模型。推理时实际激活参数约为150亿,这意味着模型可在整体架构庞大的同时,每个 token 只需激活部分参数。
小米将该模型定位为集智能体执行、编程与多模态推理于一体的统一系统。其语言主干搭配专用的视觉和音频编码器,使其能够处理文本、图像、音频和视频信息,而非仅限于文本。小米还表示,经过指令微调的版本支持最高100万 token 的上下文窗口。
MiMo-V2.5 与 MiMo-V2.5 Pro 在定位和规模上有所不同。标准版总参数为3100亿,激活参数为150亿,而 Pro 版则拥有1.02万亿总参数和420亿激活参数。因此,标准版更侧重于多模态能力与智能体性能的成本效益平衡。
MiMo-V2.5 的核心参数与定价如何?
| 规格 | 经验证或官方数据 |
|---|---|
| 服务商 | 小米 |
| 发布时间 | 2026年4月22日 |
| 架构 | 稀疏专家混合 |
| 总参数量 | 3100亿 |
| 激活参数量 | 150亿 |
| 上下文窗口 | 最高100万 token |
| 训练 token 数 | 48万亿 |
| Gate.AI 模型ID | xiaomi/mimo-v2.5 |
| Gate.AI 输入价格 | 每100万 token $0.14 |
| Gate.AI 输出价格 | 每100万 token $0.28 |
| Gate.AI 缓存读取价格 | 每100万 token $0.0428 |
| 缓存写入价格 | 未公布 |
| 输入类型 | 文本、图像、音频、视频 |
| 主要输出 | 文本 |
小米官方确认了架构、参数量、训练 token 数、上下文窗口及多模态设计。模型ID与 token 定价由 Gate.AI 单独公布,不代表小米官方 API 价格。
例如,若一次请求包含200万未缓存输入 token 和50万输出 token,预估费用为:
(2 × $0.14) + (0.5 × $0.28) = $0.42
该计算未包含缓存折扣、重试、账户专属条款及其他可能费用。
MiMo-V2.5 在生产环境中的核心价值体现在哪里?
MiMo-V2.5 的生产力优势在于将长上下文处理、编程能力与多模态理解集于一身。
例如,软件智能体可在提出修复建议前,综合分析源码、技术文档、界面截图和错误日志,无需分别将视觉信息和代码发送至不同模型。小米还将 MiMo-V2.5 定位于多步骤、工具调用和长时上下文的智能体任务。
其100万 token 上下文窗口可容纳大型代码库、长文档或大量交互历史。但每次请求都提交最大上下文可能导致成本和处理时长增加,因此检索、文件筛选和上下文压缩依然有现实意义。
该模型还可解析录制的演示或支持会话。例如,将语音反馈与界面操作对应,并自动生成结构化的缺陷报告。这类工作流依赖多模态理解;但目前无文档显示 MiMo-V2.5 原生支持图像、音频或视频生成。
MiMo-V2.5 支持哪些多模态类型?
| 模态 | 输入 | 输出 | 实际应用场景 |
|---|---|---|---|
| 文本 | 支持 | 支持 | 分析、编程、摘要与指令 |
| 图像 | 支持 | 未确认 | 截图、图表、文档与视觉推理 |
| 音频 | 支持 | 未确认 | 语音与声音理解 |
| 视频 | 支持 | 未确认 | 录制流程与时序分析 |
| 代码 | 支持 | 支持 | 生成、调试与代码库审查 |
小米官方明确文档化了对视觉和音频的原生理解,并介绍了模型在图像、视频及多模态智能体任务中的表现。公开资料显示,文本生成是主要输出,暂未确认可直接生成原生媒体内容。
MiMo-V2.5 有哪些局限?
通过 Gate.AI 路由,部分运行细节尚未公开确认,包括最大输出长度、速率限制、微调支持、媒体上传要求及模型特定结构化输出行为。
大上下文窗口也可能导致提示词使用效率低下。直接提交整个代码库,成本较高且结果未必聚焦,不如仅检索相关文件。
多模态请求可能包含人脸、对话、客户信息、源代码或凭证。团队应在发送敏感信息前,做好脱敏、访问控制和数据留存策略。
由智能体生成的代码和工具操作需额外防护。输出结果应通过自动化测试、依赖检查和人工审核,工具权限应遵循最小权限原则。
MiMo-V2.5 适合哪些应用场景?
MiMo-V2.5 特别适用于:
- 融合源码、截图或日志的编程助手;
- 长文档与代码库分析;
- 多模态调试与界面审查;
- 录制流程或产品演示分析;
- 对成本敏感、需广泛输入支持的智能体。
当工作流需要多种输入模态、长上下文及较低 token 定价时,推荐选择 MiMo-V2.5。若任务需原生媒体生成、极高专业度编程、严格结构化输出或完整企业级管控,则建议考虑其他模型。
MiMo-V2.5 与 MiMo-V2.5 Pro 及 Gemini 2.5 Flash 对比如何?
| 对比维度 | MiMo-V2.5 | MiMo-V2.5 Pro | Gemini 2.5 Flash |
|---|---|---|---|
| 主要定位 | 高效多模态智能体 | 复杂编程与长周期智能体 | 通用多模态应用 |
| 总参数量 | 3100亿 | 1.02万亿 | 未公开 |
| 激活参数量 | 150亿 | 420亿 | 未公开 |
| 上下文窗口 | 100万 token | 100万 token | 视平台而定 |
| 多模态输入 | 文本、图像、音频、视频 | 需验证具体路由 | 多模态 |
| 主要决策因素 | 成本与多模态广度 | 更高端智能体性能 | Google 生态集成 |
MiMo-V2.5 是小米面向 token 效率与多模态理解的实用选择。MiMo-V2.5 Pro 更适合高要求的软件工程及长周期任务。
Gemini 2.5 Flash 适合已采用 Google 模型生态的团队。模型选择应基于已验证的 API 功能、任务质量、延迟及整体会话成本,而非仅关注上下文窗口大小。
如何通过 Gate.AI 访问 MiMo-V2.5?
Gate.AI 提供兼容 OpenAI 的 API,基础 URL 为 https://api.gate.ai/openai/v1。根据 Gate.AI 公告,模型标识为 xiaomi/mimo-v2.5。
Python
import osfrom openai import OpenAIclient = OpenAI(api_key=os.environ["GATEAI_API_KEY"],base_url="https://api.gate.ai/openai/v1",)try:response = client.chat.completions.create(model="xiaomi/mimo-v2.5",messages=[{"role": "user","content": "Review this Python service and identify reliability risks."}],)print(response.choices[0].message.content)except Exception as error:print(f"Request failed: {error}")
curl
curl "https://api.gate.ai/openai/v1/chat/completions" \-H "Authorization: Bearer $GATEAI_API_KEY" \-H "Content-Type: application/json" \-d '{"model": "xiaomi/mimo-v2.5","messages": [{"role": "user","content": "Create a migration plan for this Python service."}]}'
以上示例均采用 Gate.AI 公布的通用 chat-completions 路由。在实现图像、音频或视频请求前,请确认账户权限及当前媒体输入规范。
常见问题解答
MiMo-V2.5 是否支持100万 token 上下文窗口?
支持。小米官方文档明确指令微调版 MiMo-V2.5 支持最高100万 token 的上下文窗口。
MiMo-V2.5 能处理视频和音频吗?
支持。小米文档显示模型具备原生视觉和音频理解能力,并在视频及多模态任务上进行了评测。
通过 Gate.AI 使用 MiMo-V2.5 的费用是多少?
根据 Gate.AI 公布,输入每100万 token 收费$0.14,输出每100万 token $0.28,缓存读取每100万 token $0.0428。
MiMo-V2.5 适合用作编程智能体吗?
适合。该模型专为编程与智能体工作流设计,但生成的变更仍需经过测试、安全审查及人工确认。
MiMo-V2.5 是否比 MiMo-V2.5 Pro 更便宜?
Gate.AI 公布的定价显示标准版为低成本选项。若需更高端软件工程或更长周期自主流程,MiMo-V2.5 Pro 或许更为适合。


