最后更新:2026-07-20 · 在 GitHub 报告过期数据

MiMo API 定价 — 2026 年 7 月

前沿级推理能力,价格仅为闭源方案的 5–20%。2026 年 5 月起 V2.5-Pro 列表输入价降至 ¥3/百万 Token;缓存命中输入价 99% 降价至 ¥0.025/百万 Token。所有价格按 CNY / 百万 Token 计(括号内 USD 估算)。

一句话:V2.5-Pro 列表价 ¥3/¥6,缓存命中输入 99% 降价

MiMo-V2.5-Pro 列表价为 ¥3/M 输入 + ¥6/M 输出(约 $0.42 / $0.83 美元)。对于能利用 prompt 缓存的工作负载(聊天历史、RAG、代码审查、长上下文检索),缓存命中输入价为 ¥0.025/M(约 $0.0035,较 2025 年发布时降价 99%)。2026 年 5 月降价主要针对缓存命中价:列表输出价也分别下降 86%(V2.5-Pro)和 93%(V2.5 标准版)。V2.5-Pro 在长上下文推理上对齐 Claude Opus 4.5,但列表输入便宜 约 97%(¥3 vs ¥108),缓存命中输入便宜 约 99%。MiMo-7B 在 MIT 协议下完全免费(自托管可彻底消除单 Token 成本)。

所有 MiMo 权重均为 MIT 协议,自托管可彻底消除单 Token 成本。

注意:MiMo-V2-Flash 已于 2026-06-30 随 V2 全系列正式下线。当前在售生产版本为 V2.5 标准版、V2.5-Pro、V2.5-Pro-UltraSpeed。V2.5-Omni / V2.5-TTS / V2.5-ASR 权重已 MIT 开源,API 定价待定。

→ 使用 Token 成本计算器(实时 USD/CNY 估算)

1. V2.5 全系定价

所有价格按百万 Token 计。"列表价"= 按量计费的常规价;"缓存命中"= 启用 prompt 缓存后,重复前缀部分的折后价。已于 2026-07-20 与 2026-05-27 官方公告核对。

模型 参数 上下文 最佳场景 列表输入 / 1M 缓存命中输入 / 1M 列表输出 / 1M 2026 年 5 月以来变化
MiMo-V2.5-Pro 1T+ MoE 1M 智能体、长上下文、推理 ¥3 ($0.42) ¥0.025 ($0.0035) ¥6 ($0.83) 缓存命中 −99% · 输出 −86%
MiMo-V2.5-Pro-UltraSpeed 1T+ MoE (FP4+DFlash) 1M 高吞吐编码,1000+ tok/s ¥9 ($1.25) ¥0.075 ($0.0104) ¥18 ($2.50) 内测中(需申请)
MiMo-V2.5(标准版) ~309B MoE 1M 通用对话、内容生成、轻量智能体 ¥1 ($0.14) ¥0.02 ($0.0028) ¥2 ($0.28) 缓存命中 −98% · 输出 −93%
MiMo-V2.5-Omni 待定 待定 多模态(文本/图像/视频/音频) 待定 待定 待定 权重 MIT 开源,API 待定
MiMo-V2.5-TTS 待定 不适用 中英双语语音合成 商业 授权 授权 独立商业授权
MiMo-V2.5-ASR 待定 不适用 语音转文字(中英) ¥0.5/小时 (音频输入) — 权重 Apache-2.0 开源
MiMo-7B 7B 稠密 32k 端侧 / 设备本地(手机、车机、IoT) ¥0 ¥0 ¥0 MIT 权重,免费自托管
MiMo Code 智能体层 无限 终端原生编码智能体 免费 app + API 用量 + API 用量 MIT 开源
MiMo-V2-Flash(已下线) 309B / 15B active 56k 由 V2.5 标准版替代 — — — 2026-06-30 下线

2. 同等负载下 5 家主流 API 对比

所有价格为列表价(CNY / 百万 Token,括号 USD)。不包含批量折扣、prompt 缓存、批量 API 价。已于 2026 年 7 月 20 日与各家定价页核对。比较基线 = MiMo-V2.5-Pro 列表输入 ¥3。

厂商模型列表输入 / 1M列表输出 / 1Mvs MiMo-V2.5-Pro(输入)
小米MiMo-V2.5-Pro¥3 ($0.42)¥6 ($0.83)— 基线 —
小米MiMo-V2.5(标准版)¥1 ($0.14)¥2 ($0.28)输入便宜 ~67%
DeepSeekDeepSeek V4 Pro¥3.13 ($0.435)¥6.26 ($0.87)输入贵 ~3%(同档)
DeepSeekDeepSeek-R1¥3.96 ($0.55)¥15.77 ($2.19)输入贵 ~31%
阿里Qwen3 Max¥4.32 ($0.60)¥17.28 ($2.40)输入贵 ~43%
OpenAIGPT-4o mini¥1.08 ($0.15)¥4.32 ($0.60)输入便宜 ~64%(小模型)
OpenAIGPT-5¥9 ($1.25)¥72 ($10.00)输入贵 3×
AnthropicClaude Haiku 3.5¥5.76 ($0.80)¥28.80 ($4.00)输入贵 ~90%(小模型)
AnthropicClaude Opus 4.5¥108 ($15.00)¥540 ($75.00)输入贵 36×

读表说明:MiMo-V2.5-Pro 列表价 ¥3/¥6,长上下文推理对齐 Claude Opus 4.5,编码上超过 Claude Haiku 3.5(SWE-Bench 73.4% vs 65%),价格低于 DeepSeek V4 Pro 输入。1M 上下文窗口(vs V4 Pro 128k)是法律、科研、代码审查工作负载的决胜点。对可缓存工作负载(聊天历史、RAG、重复 system prompt),缓存命中输入价 ¥0.025/M 让 V2.5-Pro 输入端基本免费。

3. 缓存命中价为什么重要

绝大多数 LLM 真实应用会重复发送同样的 token:system prompt、RAG 检索出的文档、对话历史、待审查的代码文件。MiMo(和多数现代 API)提供 prompt 缓存:请求时打个标记,前缀重复部分按低得多的缓存命中价计费。以 MiMo-V2.5-Pro 为例:

这就是为什么 2026 年 5 月降价被表述为"99% 降价"——对生产智能体负载中占主导的重复 token 工作负载,输入端的实际单请求成本确实接近于零。用计算器按你的工作负载算一下 →

4. 定价历史

2026 年 5 月 27 日

永久缓存命中价下调(−98% 至 −99%)。V2.5-Pro 缓存命中输入降至 ¥0.025/M($0.0035),V2.5 标准版缓存命中输入降至 ¥0.02/M($0.0028)。列表输出同步下调:V2.5-Pro ¥6/M(较发布 −86%),V2.5 标准版 ¥2/M(−93%)。小米官方理由是"生态扩张优先于短期利润"。技术支撑是 SGLang HiCache + 滑动窗口注意力将 KV 缓存跨级搬运量降至优化前的 1/7。

2026 年 6 月 30 日

MiMo-V2 全系列正式下线。V2-Flash、V2-Pro、V2-Omni 全部退役或迁移。V2.5 系列(2026 年 4 月 23 日发布)成为唯一生产家族。权重继续保留在 HuggingFace,可自托管。

2026 年 4 月 23 日

V2.5 系列开源。V2.5 标准版、V2.5-Pro(1T MoE,1M 上下文)、V2.5-Omni、V2.5-TTS、V2.5-ASR 全部 MIT 协议。Pro 公测期 60 天列表价 ¥5/¥15。

2025 年 12 月

V2-Flash GA。309B/15B MoE,56k 上下文,列表价 $0.50/$1.50。是当时同参数档最便宜的 MoE 模型。

2025 年 6 月

MiMo-7B 开源权重发布。MIT 协议。免费使用、修改、自托管。INT4 量化后仅需 3.5 GB 显存,单 Token 零成本。

5. 在哪买 MiMo API

6. 定价 FAQ

为什么 MiMo 2026 年 5 月要这么激进降价?

具体来说:V2.5-Pro 缓存命中输入价降 99%(至 $0.0035/M,¥0.025/M),V2.5 标准版缓存命中输入价降 98%(至 $0.0028/M,¥0.02/M)。列表输出价同步降 86%(V2.5-Pro 至 $0.83/M,¥6)和 93%(V2.5 标准版至 $0.28/M,¥2)。小米给出的理由是 SGLang HiCache + 滑动窗口注意力让 KV 缓存跨级搬运量降至优化前的 1/7,加上生态战略。"99% 降价"指的是缓存命中输入——这才是 prompt 缓存型智能体负载真正关心的数字。列表输入(¥3/M)是另一个更大一些的数。

列表价和缓存命中价有什么区别?

列表价 = 没有缓存前缀匹配时按常规按量计费价。缓存命中价 = 请求复用服务端已有缓存前缀时的折后价(按请求显式开启)。对大多数智能体和聊天负载,绝大部分输入 token(system prompt、检索文档、对话历史)都可走缓存,所以实际输入成本更接近缓存命中价,而不是列表价。

有批量折扣吗?

官方列表价没有。企业合约(每月 1B+ Token)直接跟小米销售谈,通常列表价 7-8 折。OpenRouter 也是纯按量无阶梯。Token Plan 订阅(¥X/月换 Token 包)2026 年 5 月同步调整,同等价格用量提升 5-8 倍。

自托管比 API 便宜吗?

看规模。MiMo-7B(最小可自托管模型)单卡 A10G 盈亏平衡约 50M Token/月。V2.5 标准版和 V2.5-Pro 需要多卡基础设施,盈亏平衡 500M+ Token/月。看部署指南 →

V2.5-Omni / TTS / ASR 定价定了吗?

ASR 公开 API 价 ¥0.5/小时输入音频。Omni 和 TTS API 价截至 2026 年 7 月待定——Omni 权重 MIT 开源,TTS 独立商业授权。在 platform.xiaomimimo.com 订阅通知,API 价上线时第一时间知道。

相关页面

非官方社区资源,与小米公司无关联。价格最后于 2026 年 7 月 20 日根据 2026-05-27 官方公告和各家定价页核对。关键预算场景请以供应商定价页为准。