最后更新:2026-07-20 · 在 GitHub 报告过期数据
MiMo API 定价 — 2026 年 7 月
前沿级推理能力,价格仅为闭源方案的 5–20%。2026 年 5 月起 V2.5-Pro 列表输入价降至 ¥3/百万 Token;缓存命中输入价 99% 降价至 ¥0.025/百万 Token。所有价格按 CNY / 百万 Token 计(括号内 USD 估算)。
一句话:V2.5-Pro 列表价 ¥3/¥6,缓存命中输入 99% 降价
MiMo-V2.5-Pro 列表价为 ¥3/M 输入 + ¥6/M 输出(约 $0.42 / $0.83 美元)。对于能利用 prompt 缓存的工作负载(聊天历史、RAG、代码审查、长上下文检索),缓存命中输入价为 ¥0.025/M(约 $0.0035,较 2025 年发布时降价 99%)。2026 年 5 月降价主要针对缓存命中价:列表输出价也分别下降 86%(V2.5-Pro)和 93%(V2.5 标准版)。V2.5-Pro 在长上下文推理上对齐 Claude Opus 4.5,但列表输入便宜 约 97%(¥3 vs ¥108),缓存命中输入便宜 约 99%。MiMo-7B 在 MIT 协议下完全免费(自托管可彻底消除单 Token 成本)。
所有 MiMo 权重均为 MIT 协议,自托管可彻底消除单 Token 成本。
→ 使用 Token 成本计算器(实时 USD/CNY 估算)
1. V2.5 全系定价
所有价格按百万 Token 计。"列表价"= 按量计费的常规价;"缓存命中"= 启用 prompt 缓存后,重复前缀部分的折后价。已于 2026-07-20 与 2026-05-27 官方公告核对。
| 模型 | 参数 | 上下文 | 最佳场景 | 列表输入 / 1M | 缓存命中输入 / 1M | 列表输出 / 1M | 2026 年 5 月以来变化 |
|---|---|---|---|---|---|---|---|
| MiMo-V2.5-Pro | 1T+ MoE | 1M | 智能体、长上下文、推理 | ¥3 ($0.42) | ¥0.025 ($0.0035) | ¥6 ($0.83) | 缓存命中 −99% · 输出 −86% |
| MiMo-V2.5-Pro-UltraSpeed | 1T+ MoE (FP4+DFlash) | 1M | 高吞吐编码,1000+ tok/s | ¥9 ($1.25) | ¥0.075 ($0.0104) | ¥18 ($2.50) | 内测中(需申请) |
| MiMo-V2.5(标准版) | ~309B MoE | 1M | 通用对话、内容生成、轻量智能体 | ¥1 ($0.14) | ¥0.02 ($0.0028) | ¥2 ($0.28) | 缓存命中 −98% · 输出 −93% |
| MiMo-V2.5-Omni | 待定 | 待定 | 多模态(文本/图像/视频/音频) | 待定 | 待定 | 待定 | 权重 MIT 开源,API 待定 |
| MiMo-V2.5-TTS | 待定 | 不适用 | 中英双语语音合成 | 商业 | 授权 | 授权 | 独立商业授权 |
| MiMo-V2.5-ASR | 待定 | 不适用 | 语音转文字(中英) | ¥0.5/小时 | (音频输入) | — | 权重 Apache-2.0 开源 |
| MiMo-7B | 7B 稠密 | 32k | 端侧 / 设备本地(手机、车机、IoT) | ¥0 | ¥0 | ¥0 | MIT 权重,免费自托管 |
| MiMo Code | 智能体层 | 无限 | 终端原生编码智能体 | 免费 app | + API 用量 | + API 用量 | MIT 开源 |
| MiMo-V2-Flash(已下线) | 309B / 15B active | 56k | 由 V2.5 标准版替代 | — | — | — | 2026-06-30 下线 |
2. 同等负载下 5 家主流 API 对比
所有价格为列表价(CNY / 百万 Token,括号 USD)。不包含批量折扣、prompt 缓存、批量 API 价。已于 2026 年 7 月 20 日与各家定价页核对。比较基线 = MiMo-V2.5-Pro 列表输入 ¥3。
| 厂商 | 模型 | 列表输入 / 1M | 列表输出 / 1M | vs MiMo-V2.5-Pro(输入) |
|---|---|---|---|---|
| 小米 | MiMo-V2.5-Pro | ¥3 ($0.42) | ¥6 ($0.83) | — 基线 — |
| 小米 | MiMo-V2.5(标准版) | ¥1 ($0.14) | ¥2 ($0.28) | 输入便宜 ~67% |
| DeepSeek | DeepSeek V4 Pro | ¥3.13 ($0.435) | ¥6.26 ($0.87) | 输入贵 ~3%(同档) |
| DeepSeek | DeepSeek-R1 | ¥3.96 ($0.55) | ¥15.77 ($2.19) | 输入贵 ~31% |
| 阿里 | Qwen3 Max | ¥4.32 ($0.60) | ¥17.28 ($2.40) | 输入贵 ~43% |
| OpenAI | GPT-4o mini | ¥1.08 ($0.15) | ¥4.32 ($0.60) | 输入便宜 ~64%(小模型) |
| OpenAI | GPT-5 | ¥9 ($1.25) | ¥72 ($10.00) | 输入贵 3× |
| Anthropic | Claude Haiku 3.5 | ¥5.76 ($0.80) | ¥28.80 ($4.00) | 输入贵 ~90%(小模型) |
| Anthropic | Claude Opus 4.5 | ¥108 ($15.00) | ¥540 ($75.00) | 输入贵 36× |
读表说明:MiMo-V2.5-Pro 列表价 ¥3/¥6,长上下文推理对齐 Claude Opus 4.5,编码上超过 Claude Haiku 3.5(SWE-Bench 73.4% vs 65%),价格低于 DeepSeek V4 Pro 输入。1M 上下文窗口(vs V4 Pro 128k)是法律、科研、代码审查工作负载的决胜点。对可缓存工作负载(聊天历史、RAG、重复 system prompt),缓存命中输入价 ¥0.025/M 让 V2.5-Pro 输入端基本免费。
3. 缓存命中价为什么重要
绝大多数 LLM 真实应用会重复发送同样的 token:system prompt、RAG 检索出的文档、对话历史、待审查的代码文件。MiMo(和多数现代 API)提供 prompt 缓存:请求时打个标记,前缀重复部分按低得多的缓存命中价计费。以 MiMo-V2.5-Pro 为例:
- 50k Token 的 system prompt + 200k Token 文档库,每次请求都发送
- 列表价:250k × ¥3/M = 每次请求 ¥0.75
- 缓存命中价:250k × ¥0.025/M = 每次请求 ¥0.00625(缓存部分便宜 120×)
- 加上 1k Token 用户问题(不缓存)+ 500 Token 回答(输出 ¥6/M = ¥0.003)→ 单次总计 ¥0.0093
这就是为什么 2026 年 5 月降价被表述为"99% 降价"——对生产智能体负载中占主导的重复 token 工作负载,输入端的实际单请求成本确实接近于零。用计算器按你的工作负载算一下 →
4. 定价历史
永久缓存命中价下调(−98% 至 −99%)。V2.5-Pro 缓存命中输入降至 ¥0.025/M($0.0035),V2.5 标准版缓存命中输入降至 ¥0.02/M($0.0028)。列表输出同步下调:V2.5-Pro ¥6/M(较发布 −86%),V2.5 标准版 ¥2/M(−93%)。小米官方理由是"生态扩张优先于短期利润"。技术支撑是 SGLang HiCache + 滑动窗口注意力将 KV 缓存跨级搬运量降至优化前的 1/7。
MiMo-V2 全系列正式下线。V2-Flash、V2-Pro、V2-Omni 全部退役或迁移。V2.5 系列(2026 年 4 月 23 日发布)成为唯一生产家族。权重继续保留在 HuggingFace,可自托管。
V2.5 系列开源。V2.5 标准版、V2.5-Pro(1T MoE,1M 上下文)、V2.5-Omni、V2.5-TTS、V2.5-ASR 全部 MIT 协议。Pro 公测期 60 天列表价 ¥5/¥15。
V2-Flash GA。309B/15B MoE,56k 上下文,列表价 $0.50/$1.50。是当时同参数档最便宜的 MoE 模型。
MiMo-7B 开源权重发布。MIT 协议。免费使用、修改、自托管。INT4 量化后仅需 3.5 GB 显存,单 Token 零成本。
5. 在哪买 MiMo API
① 小米 MiMo 平台(官方)
官方平台,V2.5 标准版 + V2.5-Pro 公开 API。OpenAI 兼容端点。价格最优,官方 SLA。
② OpenRouter
一个 API key 跑所有 MiMo 变体 + 200+ 其他模型。适合原型验证——切模型不用改代码。略加价。
③ HuggingFace Pro
开源权重 + Inference Endpoints + Pro 版 SLA 推理。适合大规模自托管。
④ 快速上手
5 行 Python 安装 + 首次调用。含 curl / Node / Go 示例。→
6. 定价 FAQ
为什么 MiMo 2026 年 5 月要这么激进降价?
具体来说:V2.5-Pro 缓存命中输入价降 99%(至 $0.0035/M,¥0.025/M),V2.5 标准版缓存命中输入价降 98%(至 $0.0028/M,¥0.02/M)。列表输出价同步降 86%(V2.5-Pro 至 $0.83/M,¥6)和 93%(V2.5 标准版至 $0.28/M,¥2)。小米给出的理由是 SGLang HiCache + 滑动窗口注意力让 KV 缓存跨级搬运量降至优化前的 1/7,加上生态战略。"99% 降价"指的是缓存命中输入——这才是 prompt 缓存型智能体负载真正关心的数字。列表输入(¥3/M)是另一个更大一些的数。
列表价和缓存命中价有什么区别?
列表价 = 没有缓存前缀匹配时按常规按量计费价。缓存命中价 = 请求复用服务端已有缓存前缀时的折后价(按请求显式开启)。对大多数智能体和聊天负载,绝大部分输入 token(system prompt、检索文档、对话历史)都可走缓存,所以实际输入成本更接近缓存命中价,而不是列表价。
有批量折扣吗?
官方列表价没有。企业合约(每月 1B+ Token)直接跟小米销售谈,通常列表价 7-8 折。OpenRouter 也是纯按量无阶梯。Token Plan 订阅(¥X/月换 Token 包)2026 年 5 月同步调整,同等价格用量提升 5-8 倍。
自托管比 API 便宜吗?
看规模。MiMo-7B(最小可自托管模型)单卡 A10G 盈亏平衡约 50M Token/月。V2.5 标准版和 V2.5-Pro 需要多卡基础设施,盈亏平衡 500M+ Token/月。看部署指南 →
V2.5-Omni / TTS / ASR 定价定了吗?
ASR 公开 API 价 ¥0.5/小时输入音频。Omni 和 TTS API 价截至 2026 年 7 月待定——Omni 权重 MIT 开源,TTS 独立商业授权。在 platform.xiaomimimo.com 订阅通知,API 价上线时第一时间知道。
相关页面
- Token 成本计算器 — 实时 USD/CNY 估算 vs 5 家竞品
- MiMo-V2.5 系列深度 — 架构、基准、部署
- MiMo vs DeepSeek — 最热门横评
- MiMo vs Claude Haiku 3.5 — 预算前沿模型对比
- 基准研究 — SWE-Bench、AIME、MMLU 分数
- API 快速上手 — 5 行安装 + 首次调用
非官方社区资源,与小米公司无关联。价格最后于 2026 年 7 月 20 日根据 2026-05-27 官方公告和各家定价页核对。关键预算场景请以供应商定价页为准。