发布:2026 年 7 月 15 日 · 最近核对:2026 年 7 月 20 日

Xiaomi-Robotics-U0:380 亿参数统一具身基础模型,专为机器人训练数据设计

一句话总结

2026 年 7 月 15 日,小米发布 Xiaomi-Robotics-U0 —— 一个 380 亿参数统一多模态自回归具身生成基础模型。它是业内首个把 具身场景生成、具身迁移、机器人交互视频生成、文生图与图像编辑 四大任务统一到一套架构的模型。WorldArena 具身视频评测基准 73.64 分(126 个模型第一);真机 OOD 场景下策略任务完成进度 +26.3%(包装盒/折叠毛巾/包装手机/包装耳机四个任务从 36.9% 提升到 63.2%);FlashAR+ 加速较传统自回归生成 提速 82.9 倍。模型、训练代码、推理代码全量开源。

为什么这件事重要

机器人策略需要海量训练数据,但真实数据采集成本高、周期长,而且只覆盖实验室里那个光照、那个背景、那几样物体。2026 年之前的方案是分别训练 4 个独立模型:场景生成、轨迹迁移、视频合成、图像编辑。它们对几何理解不一致,会破坏机械臂位姿,也无法共享权重。

Xiaomi-Robotics-U0 把四大能力塞进 一个自回归模型,原生理解多视角几何与物理一致性。你可以写一段文字:"这个场景但换成大理石台面、加 3 把椅子、夕阳光照",输出会保留机器人臂位姿、相机角度和原始动作序列。这就是"用生成数据训练真实机器人策略"真正解锁的钥匙。

关键数字(2026-07-15 发布)

380 亿
参数
4
统一任务
73.64
WorldArena(1/126)
+26.3%
真机 OOD 策略
82.9×
FlashAR+ 加速
5.44 秒
1024×1024 单图

四大任务,一个模型

U0 统一了原本的 4 条独立流水线。每个任务在同一自回归目标下联合训练,模型可以在它们之间切换而无需重新编码。

① 具身场景生成

根据文本描述,为指定机器人本体生成多视角初始观测画面——厨房、仓库、海底、赛博城市都可以。首帧多视角几何一致(可作为下游策略训练的起始状态)。

② 具身迁移

输入一段已有机器人轨迹(多视角 RGB + 深度),加一句"大理石台面、加 3 把椅子、夕阳",U0 生成新视频,机械臂位姿、场景布局、原始动作序列都保留,但视觉风格、光照、物体配置换掉。相当于机器人视频的"图像滤镜"。

③ 机器人交互视频

给定首帧和操作指令("拿起杯子"、"折叠毛巾"),U0 生成剩余视频,动作连续、物理一致。零样本泛化到任意场景和机器人本体。

④ 文生图 + 图像编辑

通用视觉生成能力,与具身任务共享权重。互联网规模的视觉知识迁移进具身模型,所以它在学"叠毛巾"的同时也不会忘记"画猫"。

五维解耦结构化控制

具身迁移的难点是:你让模型改一个东西,它会把整个几何都搞坏。U0 的"五维解耦结构化控制"把场景拆成 5 个正交轴,自然语言独立调控:

改任何一维,其他四维锁定。机械臂位姿、原始场景几何、动作序列全都不动。

基准测试

WorldArena 具身视频评测(清华 + 北大):126 个模型参评,U0(匿名代号"UNIS")73.64 分,总分第一,指令遵循、交互真实度、多视角一致性三项细分全部领先。在 300 个测试样本的头对头对比中,U0 在深度一致性、结构保真、语义对齐上击败闭源 GPT-Image-2.0——关键是 GPT-Image-2.0 的输出有跨视角物体错位(无法用于机器人训练),而 U0 完整保留原始轨迹。

真机 OOD 增益:小米团队在包装盒、折叠毛巾、包装手机、包装耳机 4 个任务上做真机研究,环境采用分布外条件(新桌布、新光照、反射/彩色光干扰)。在 π₀.₅ 策略基座上加 U0 增强数据:

机器人在强视觉干扰下还发展出自我校正行为(不会卡死)。

FlashAR+:82.9× 加速,1024×1024 单图 5.44 秒

自回归图像生成慢,是因为每个像素 token 都是顺序预测。小米 FlashAR+ 加速器(早期 FlashAR 文生图方案的扩展)把目标图像 token 群并行化,输入前缀仍走串行——这样模型可以消化复杂多图/深度/文本条件,只有目标区域走并行。

结合 vLLM 分页 KV 缓存批量调度 + 对角并行解码:

这才让工业级批量生成(百万级训练样本)成为现实——没有 FlashAR+,用普通 GPU 集群生成真实训练语料库要花几年。

开源情况

模型、训练代码、推理代码、Demo 全部开源:

原生兼容机器人本体:方舟无限(ARX)、智元 G1/G2(AgiBot)、松灵 PiPER(Husarion)。模型本体无关——同一套权重可微调或 prompt 到新机器人本体。

U0 与 MiMo 的关系

Xiaomi-Robotics-U0 是 MiMo LLM 家族的兄弟项目,不是替代品。分工:

生产机器人栈两者并用:MiMo 负责高层规划与语言条件工具调用,U0 负责生成训练数据,并可能生成策略训练时的世界模型 rollout。

U0 不擅长的(局限)

怎么开始用

面向具身智能研究员和机器人团队:

  1. 克隆 GitHub 仓库,从 HuggingFace 或 ModelScope 拉权重。
  2. 推理:FlashAR+ 路径 1024×1024 需 4× A100/H100 80GB。512×512 的 INT8/FP8 路径在做。
  3. 数据增强:U0 具身迁移 + 任意 VLM(MiMo-V2.5-Omni 可用)生成变化 prompt,再把增强 + 原始轨迹混进你的训练 pipeline。

本页是对小米 2026-07-15 官方公告的非官方社区解读。权威技术报告和基准以小米机器人项目页为准。

相关页面