为什么叫这个名字
基于 Scaling Law 的
通用人形基座模型
Agent · VLA · WBC 三层一体 ——
打通数字智能与物理智能的唯一路径。
推进机器人革命,迈向二型文明
具身智能的核心瓶颈——缺一颗大脑
硬件已较为成熟,但行业缺乏通用大脑。
数据与模型没有真正 Scale 起来
LLM 靠互联网文本实现 Scaling Law;
具身数据至今没真正 Scale ——
数据成本高、规模小、多样性严重不足,没有可规模化的数据引擎。
大模型的范式,会在具身智能上完整复现
LLM 用八年 scale 了七个数量级 —— 具身智能今天大致还在 GPT-2 的位置,曲线才刚刚开始。
Agent 驱动的三层一体架构
L1 MetaBot · L2 VLA · L3 WBC —— 不是三个模块,是一颗完整大脑的组成框架。
Computer Use Agent
和机器人是同一套栈
先把这件事讲清楚:Digital AI Agent 和 Physical AI Agent 不是两套系统,只是同一套 VLA + RL 栈换了身体。
不是两条路,是同一条路的两个落点
Computer Use Agent 和 Humanoid Robot,本质上是同一个问题的两种形态。 架构层面都靠 VLA,训练层面都走 预训练 → 后训练 → RL,差别只在身体和数据。
L2 · VLA · Humanoid Foundation Model 核心
感知与决策,2–10 Hz —— 视频预训练 → 后训练 → RL,与大模型完全同一套范式。
视频是物理世界
唯一可规模化的数据
DreamVPT —— 把“做梦”的视频变成训练数据
机器人数据不够,那就让它做梦 —— 合成视频 × 大规模仿真,把稀缺真机视频放大成可训练的数据流。
合成数据提升语言模型能力这件事,LLM 侧已经被充分验证,我们是在把这条已验证范式迁移到物理世界。
~1% 体量
合成 1st / 3rd person
预测合成 video 的 action
统一进 VLA Brain
合成数据预训练:真机端到端成功率 0% → 75%
同一验证集、同一训练配置、同一台 G1:五组实验唯一变量是预训练数据来源。Seedance + IDM 合成数据预训练整体优于仅真机预训练;「合成 → 真机」串行预训练效果最好。曲线为 36k 步微调训练过程(log 坐标),来自实验看板。
| 实验 | 预训练数据 | Pick | 端到端成功率端到端 | 细粒度均分细粒度 |
|---|---|---|---|---|
| EXP3 · 串行 | 合成 (Seedance+IDM) → 真机 | 90% | 75% | 8.5 / 10 |
| EXP1 · 仅合成 | Seedance+IDM 合成视频 | 50% | 40% | 5.3 / 10 |
| EXP4 · 混合 | 合成 + 真机混合 | 50% | 40% | 5.3 / 10 |
| EXP2 · 仅真机 | 真机数据 | 20% | 10% | 3.0 / 10 |
| EXP0 · 基线 | 无预训练 | 30% | 0% | 2.2 / 10 |
串行预训练 EXP3 端到端 75%、细粒度 8.5/10;仅合成 EXP1(40%)整体优于仅真机 EXP2(10%);无预训练 EXP0 无法完成全流程(0%)。
L3 · WBC · 带感知的全身运动小脑
Whole-Body Controller,50–500 Hz —— Isaac Gym 仿真 RL,带感知适配全地形。
带感知的全身运控
大规模仿真 RL 独立训练
先把小脑打到天花板
In-Context RL
先让 trajectory 进入 context
我们要做的不是把所有能力硬塞进一个 policy,而是先构建 long-context trajectory,激活 in-context learning,再往上做 RL。
把整段 trajectory 记进去
激活 in-context learning
再做在线强化学习
科学 benchmark
比 demo 更重要
通用人形基础模型 的 benchmark 要像 LLM 一样可复现、可比较、可区分能力边界。
可复现
无泄漏
能区分能力
贴近真实分布
室内操作
室外移动
双手协作
长程任务
人机协作
泛化能力
模型能力涌现 · 短期寻找适配场景,中长期高价值
模型能力会持续涌现,场景选择也随之进化;短期先寻找与当前模型能力最适配、能快速验证价值的落地场景,再向更高价值、更复杂的任务扩展。
通用家居
通用工业
实验室
农业
零售
高危场景
人形宇航员
机器人硬件工程师
机器人实验员 · AutoResearch
模型领先 → 垂直整合
Phase 1 极致聚焦模型层,Phase 2 硬件自研走向量产 —— 先快后重,专注高效。
技术验证
~100h 真机种子
核心 PoC 跑通
开源发布
模型开源 · arXiv 论文
对标 Kimi 开源路线
模拟登月 Demo
Demo 视频发布
模型 SOTA
数据飞轮全速运转
奠定模型领先地位
启动硬件自研
自研路线确立
GPT-4 时刻
整机原型 v1
整机量产
高价值场景自营 RaaS
大规模数据飞轮启动
规模落地
高价值场景优先
全栈团队 · 大模型 × Agent × 运动小脑
具身赛道最稀缺的不是单点能力,而是大模型、Agent、运控都真做过的团队。