发布:2026 年 7 月 15 日 · 最近核对:2026 年 7 月 20 日
Xiaomi-Robotics-U0:380 亿参数统一具身基础模型,专为机器人训练数据设计
2026 年 7 月 15 日,小米发布 Xiaomi-Robotics-U0 —— 一个 380 亿参数统一多模态自回归具身生成基础模型。它是业内首个把 具身场景生成、具身迁移、机器人交互视频生成、文生图与图像编辑 四大任务统一到一套架构的模型。WorldArena 具身视频评测基准 73.64 分(126 个模型第一);真机 OOD 场景下策略任务完成进度 +26.3%(包装盒/折叠毛巾/包装手机/包装耳机四个任务从 36.9% 提升到 63.2%);FlashAR+ 加速较传统自回归生成 提速 82.9 倍。模型、训练代码、推理代码全量开源。
为什么这件事重要
机器人策略需要海量训练数据,但真实数据采集成本高、周期长,而且只覆盖实验室里那个光照、那个背景、那几样物体。2026 年之前的方案是分别训练 4 个独立模型:场景生成、轨迹迁移、视频合成、图像编辑。它们对几何理解不一致,会破坏机械臂位姿,也无法共享权重。
Xiaomi-Robotics-U0 把四大能力塞进 一个自回归模型,原生理解多视角几何与物理一致性。你可以写一段文字:"这个场景但换成大理石台面、加 3 把椅子、夕阳光照",输出会保留机器人臂位姿、相机角度和原始动作序列。这就是"用生成数据训练真实机器人策略"真正解锁的钥匙。
关键数字(2026-07-15 发布)
四大任务,一个模型
U0 统一了原本的 4 条独立流水线。每个任务在同一自回归目标下联合训练,模型可以在它们之间切换而无需重新编码。
① 具身场景生成
根据文本描述,为指定机器人本体生成多视角初始观测画面——厨房、仓库、海底、赛博城市都可以。首帧多视角几何一致(可作为下游策略训练的起始状态)。
② 具身迁移
输入一段已有机器人轨迹(多视角 RGB + 深度),加一句"大理石台面、加 3 把椅子、夕阳",U0 生成新视频,机械臂位姿、场景布局、原始动作序列都保留,但视觉风格、光照、物体配置换掉。相当于机器人视频的"图像滤镜"。
③ 机器人交互视频
给定首帧和操作指令("拿起杯子"、"折叠毛巾"),U0 生成剩余视频,动作连续、物理一致。零样本泛化到任意场景和机器人本体。
④ 文生图 + 图像编辑
通用视觉生成能力,与具身任务共享权重。互联网规模的视觉知识迁移进具身模型,所以它在学"叠毛巾"的同时也不会忘记"画猫"。
五维解耦结构化控制
具身迁移的难点是:你让模型改一个东西,它会把整个几何都搞坏。U0 的"五维解耦结构化控制"把场景拆成 5 个正交轴,自然语言独立调控:
- 工作台布局——工作区结构、材质、色彩、空间排布
- 前景目标物体——任务目标物品种类、摆放姿态
- 前景无关杂物——非目标道具的形态、位置
- 光照条件——强光、漫射日光、彩色特殊光源、反射
- 全局背景——室内/室外、环境风格、远景物体布局
改任何一维,其他四维锁定。机械臂位姿、原始场景几何、动作序列全都不动。
基准测试
WorldArena 具身视频评测(清华 + 北大):126 个模型参评,U0(匿名代号"UNIS")73.64 分,总分第一,指令遵循、交互真实度、多视角一致性三项细分全部领先。在 300 个测试样本的头对头对比中,U0 在深度一致性、结构保真、语义对齐上击败闭源 GPT-Image-2.0——关键是 GPT-Image-2.0 的输出有跨视角物体错位(无法用于机器人训练),而 U0 完整保留原始轨迹。
真机 OOD 增益:小米团队在包装盒、折叠毛巾、包装手机、包装耳机 4 个任务上做真机研究,环境采用分布外条件(新桌布、新光照、反射/彩色光干扰)。在 π₀.₅ 策略基座上加 U0 增强数据:
- 只用原始数据:OOD 成功率 36.9%
- 原始 + U0 增强:OOD 成功率 63.2%
- 平均任务进度提升:+26.3%
机器人在强视觉干扰下还发展出自我校正行为(不会卡死)。
FlashAR+:82.9× 加速,1024×1024 单图 5.44 秒
自回归图像生成慢,是因为每个像素 token 都是顺序预测。小米 FlashAR+ 加速器(早期 FlashAR 文生图方案的扩展)把目标图像 token 群并行化,输入前缀仍走串行——这样模型可以消化复杂多图/深度/文本条件,只有目标区域走并行。
结合 vLLM 分页 KV 缓存批量调度 + 对角并行解码:
- 传统 AR:450.77 秒/张 1024×1024
- FlashAR+:5.44 秒/张 1024×1024
- 加速:82.9×,画质几乎无损失
这才让工业级批量生成(百万级训练样本)成为现实——没有 FlashAR+,用普通 GPU 集群生成真实训练语料库要花几年。
开源情况
模型、训练代码、推理代码、Demo 全部开源:
- 小米机器人项目页
- GitHub: XiaomiRobotics/Xiaomi-Robotics-U0
- HuggingFace: XiaomiRobotics/xiaomi-robotics-u0
- ModelScope: XiaomiRobotics
原生兼容机器人本体:方舟无限(ARX)、智元 G1/G2(AgiBot)、松灵 PiPER(Husarion)。模型本体无关——同一套权重可微调或 prompt 到新机器人本体。
U0 与 MiMo 的关系
Xiaomi-Robotics-U0 是 MiMo LLM 家族的兄弟项目,不是替代品。分工:
- MiMo-7B / V2.5 标准版 / V2.5-Pro / V2.5-Omni / V2.5-TTS——语言 / 多模态语言模型。负责对话、智能体、代码、语音的"大脑"栈。
- Xiaomi-Robotics-U0——具身世界 / 数据生成模型。负责机器人训练的"想象"栈。
生产机器人栈两者并用:MiMo 负责高层规划与语言条件工具调用,U0 负责生成训练数据,并可能生成策略训练时的世界模型 rollout。
U0 不擅长的(局限)
- 长程 rollout。场景生成和视频生成是分开的。多分钟任务会累积误差。联合场景-未来视频训练是未来工作。
- 具身迁移仍需深度作为中间信号。U0 用估计的深度图作为几何信号,深度噪声 → 编辑噪声。直接多视角图像编辑在路上。
- 通用能力保住了,但有少数回归。U0 联合训练后保留了通用文生图/编辑能力(GenEval、ImgEval 大部分不退),但部分高度组合空间 grounding 任务有轻微退化。
怎么开始用
面向具身智能研究员和机器人团队:
- 克隆 GitHub 仓库,从 HuggingFace 或 ModelScope 拉权重。
- 推理:FlashAR+ 路径 1024×1024 需 4× A100/H100 80GB。512×512 的 INT8/FP8 路径在做。
- 数据增强:U0 具身迁移 + 任意 VLM(MiMo-V2.5-Omni 可用)生成变化 prompt,再把增强 + 原始轨迹混进你的训练 pipeline。
本页是对小米 2026-07-15 官方公告的非官方社区解读。权威技术报告和基准以小米机器人项目页为准。
相关页面
- MiMo-V2.5 系列深度——和 U0 互补的 LLM 家族
- 端侧 LLM 部署指南——MiMo-7B 跑在手机、车机、IoT
- MiMo 生态研究——人车家全生态落地
- MiMo 端侧备案——7-8 备案