XVI Robotics 为什么叫这个名字
CONFIDENTIAL · ANGEL++ 2026
Scaling Law · Humanoid Foundation Model

基于 Scaling Law 的
通用人形基座模型

Agent · VLA · WBC 三层一体 ——
打通数字智能与物理智能的唯一路径。
推进机器人革命,迈向二型文明

FOUNDED
2025.12
TEAM
10 + N Agents
RAISE
2 亿 RMB
STAGE
Angel++
THE CORE BOTTLENECK · 问题

具身智能的核心瓶颈——缺一颗大脑

硬件已较为成熟,但行业缺乏通用大脑。

02 · PROBLEM
ROOT CAUSE · DATA & MODEL
01

数据与模型没有真正 Scale 起来

LLM 靠互联网文本实现 Scaling Law;
具身数据至今没真正 Scale ——
数据成本高、规模小、多样性严重不足,没有可规模化的数据引擎。

COST/UNIT
HIGH
COVERAGE
LOW
SCALING LAW
N/A
TWO AXES · 具身缺乏两个维度的 SCALING
AXIS 01 · PRETRAIN SCALING
在 Pretrain 阶段,具身缺的不是算法,是能 scale 的数据引擎。
AXIS 02 · POST-TRAINING SCALING
在 Post-train 阶段,具身缺的是 test-time scaling。
CORE THESIS · 核心判断

大模型的范式,会在具身智能上完整复现

LLM 用八年 scale 了七个数量级 —— 具身智能今天大致还在 GPT-2 的位置,曲线才刚刚开始。

03 · CORE THESIS
TRAINING COMPUTE · LLM vs EMBODIED AI · 对数轴
1018 1019 1020 1021 1022 1023 1024 1025 1026 1027 TRAINING COMPUTE · FLOPs(对数轴 · 公开估计值) 2018 2019 2020 2021 2022 2023 2024 2025 2026 LLM 训练算力 · 5–10× / 年 GPT-1 · 117M GPT-2 · 1.5B GPT-3 · 175B GPT-4 · 2023 前沿模型 · 2025 ~1026+ FLOPs · 公开估计 前沿模型 · 2026 ~1026+–1027 · 量级外推 具身智能 · 今天 ≈ GPT-2 阶段
SOURCE · Epoch AI notable models dataset · GPT-3 / GPT-3.5 ≈ 3×10²³ / GPT-4 ≈ 2×10²⁵ FLOPs 等公开估计 · 2026 前沿为量级外推示意
OUR ANSWER · 我们的答案
Computer Use Agent 已经证明:Digital AI Agent 和 Physical AI Agent 可以复用同一套技术栈。
机器人不是另一条完全不同的路,而是把输入输出接口从 screen / keyboard 换成 camera / joints。
所以我们不是从零发明一套 robot stack,而是在同一套 VLA + RL 范式上做物理落地。
THREE-LAYER UNIFIED STACK · 架构

Agent 驱动的三层一体架构

L1 MetaBot · L2 VLA · L3 WBC —— 不是三个模块,是一颗完整大脑的组成框架。

04 · ARCHITECTURE
STACK OVERVIEW
数字智能 ⇋ 物理智能
Computer Use Agent 先证明了这件事:两边复用同一套栈,只是接口不同。
L1 · AGENT ALWAYS-ON
MetaBot · Agent 层
顶层调度,打通数字世界与物理世界
Agent 顶层调度:任务规划 · 多步推理 · 错误恢复
L2 · VLA 2–10 Hz
VLA · 视觉语言大脑
Humanoid Foundation Model · 感知与决策
DreamVPT + IDM · In-Context RL · 预训练 → 后训练 → RL
L3 · WBC 50–500 Hz
WBC · 运动小脑
Whole-Body Controller · 执行层
Isaac Gym RL · 带感知适配全地形
KEY INSIGHT
L2 与 L3 通过 latent space 连接 —— 决策与控制无缝衔接;CUA 证明这套结构在数字世界先跑通过。
LAYER 01 · DIGITAL ↔ PHYSICAL AGENT

Computer Use Agent
和机器人是同一套栈

先把这件事讲清楚:Digital AI Agent 和 Physical AI Agent 不是两套系统,只是同一套 VLA + RL 栈换了身体。

05 · CUA
SAME STACK · SAME PLAYBOOK

不是两条路,是同一条路的两个落点

Computer Use Agent 和 Humanoid Robot,本质上是同一个问题的两种形态。 架构层面都靠 VLA,训练层面都走 预训练 → 后训练 → RL,差别只在身体和数据。

AXIS
DIGITAL AI AGENT
PHYSICAL AI AGENT
Input
屏幕 / GUI 像素
第一视角 / 物理环境
Output
键盘 / 鼠标
关节 / 力矩
Backbone
VLA
VLA
Pretrain
录屏数据 + IDM 标注
合成视频 + DreamVPT + IDM
Post-train
SFT / 指令对齐
SFT / 指令对齐
RL
环境 RL · App / Web 任务
环境 RL · 物理任务
In-Context
现场学新网页 / 新工具
现场学新物体 / 新场景
▲
这就是为什么我们可以把 Computer Use Agent 的方法论直接迁移到机器人。 不是换赛道,是换身体。
LAYER 02 · VLA · 视觉语言大脑

L2 · VLA · Humanoid Foundation Model 核心

感知与决策,2–10 Hz —— 视频预训练 → 后训练 → RL,与大模型完全同一套范式。

06 · L2 · VLA
DREAMVPT · 数据引擎

视频是物理世界
唯一可规模化的数据

物理世界的数据天然稀缺,视频是少数能被大规模复制、编辑、生成的数据形态。
DATA MIX · NEW
1%real
99%synthetic
真机数据只做种子,每一帧都能被乘以 100×,甚至 1000×、10000×
▲
同范式已经跑通过一遍:Flood 是 Kimi Computer Use Agent 的作者。点击看详情

DreamVPT —— 把“做梦”的视频变成训练数据

机器人数据不够,那就让它做梦 —— 合成视频 × 大规模仿真,把稀缺真机视频放大成可训练的数据流。
合成数据提升语言模型能力这件事,LLM 侧已经被充分验证,我们是在把这条已验证范式迁移到物理世界。

DreamVPT Data Pipeline
①
真机数据
稀少但精确
~1% 体量
→
②
视频生成
Seedance 2.0 等 SOTA
合成 1st / 3rd person
→
③
IDM 反标
真机 + 仿真数据训出 IDM
预测合成 video 的 action
→
④
VLA 预训练
1% + 99%
统一进 VLA Brain
DREAMVPT · EVIDENCE

合成数据预训练:真机端到端成功率 0% → 75%

同一验证集、同一训练配置、同一台 G1:五组实验唯一变量是预训练数据来源。Seedance + IDM 合成数据预训练整体优于仅真机预训练;「合成 → 真机」串行预训练效果最好。曲线为 36k 步微调训练过程(log 坐标),来自实验看板。

实验预训练数据Pick端到端成功率端到端细粒度均分细粒度
EXP3 · 串行合成 (Seedance+IDM) → 真机90%75%8.5 / 10
EXP1 · 仅合成Seedance+IDM 合成视频50%40%5.3 / 10
EXP4 · 混合合成 + 真机混合50%40%5.3 / 10
EXP2 · 仅真机真机数据20%10%3.0 / 10
EXP0 · 基线无预训练30%0%2.2 / 10
2026-09-10 · Unitree G1 真机公平测试 · 任务:货架取瓶 → 放入小车 · 每组 n=10 · 仅计完全自主 · 细粒度评分 = 到架 1 + 抓取 3 + 收臂 1 + 转身 1 + 至车 2 + 放置 2(满分 10)
0k7k14k21k28k35k10.50.20.10.050.020.01Train loss ↓ (log)
EXP0 无预训练EXP1 仅合成EXP2 仅真机EXP3 合成→真机EXP4 混合
0k7k14k21k28k35k0.50.20.10.050.02Validation overall RMSE ↓ (log)
EXP0 无预训练EXP1 仅合成EXP2 仅真机EXP3 合成→真机EXP4 混合
End-to-end success rate ↑ (n=10)
exp00%
exp140%
exp210%
exp375%
exp440%
同样的真机任务,数据来源改变了结果。
串行预训练 EXP3 端到端 75%、细粒度 8.5/10;仅合成 EXP1(40%)整体优于仅真机 EXP2(10%);无预训练 EXP0 无法完成全流程(0%)。
▶
DEMO VIDEOS · 点击展开
真机遥操 + 合成视频 + IDM 反标 + VLA end-to-end 全链路验证
▲
顶层稀缺数据不再是瓶颈,而是种子;视频是唯一能把这个种子规模化的形式。
LAYER 03 · WBC · 运动小脑

L3 · WBC · 带感知的全身运动小脑

Whole-Body Controller,50–500 Hz —— Isaac Gym 仿真 RL,带感知适配全地形。

07 · L3 · WBC
CORE PROJECT · 运动小脑

带感知的全身运控

支持全地形行走与全身动作跟踪 —— 全身一体控制。
TRAINING · ISAAC GYM

大规模仿真 RL 独立训练

Isaac Gym 独立训练、单独达到最优状态 —— 经 latent space 与 L2 无缝衔接。
PRINCIPLE · 组合泛化底座

先把小脑打到天花板

人闭眼也能走路、平衡、抓东西 —— 先把“会动”打到天花板,再让大脑接管。
DEMO · 类月球地貌全地形行走 —— ISAAC GYM 仿真 RL
▶
DEMO VIDEOS · 点击展开
H2 全身运控 · 深蹲 / 舞蹈 / 遥操 / 爬楼梯 · 1x 实时无加速
团队过往经验支撑
▸Flood 在启元世界是国内最早一批用 Isaac Gym 做大规模运控强化学习的人,正是运动小脑的核心技术源头。
▸运控负责人:南大 PhD · 四足机器人自然步态成果发表于 Nature Communications、登上 CCTV;另有头部人形公司核心运控。
▸大模型 + 机器人运控,全栈从这里闭环 —— 两者都真做过的团队,具身赛道几乎没有第二家。
FUTURE THESIS · 长上下文与在线学习

In-Context RL
先让 trajectory 进入 context

我们要做的不是把所有能力硬塞进一个 policy,而是先构建 long-context trajectory,激活 in-context learning,再往上做 RL。

08 · FUTURE
STEP 01 · LONG CONTEXT

把整段 trajectory 记进去

视觉、思考、动作、结果都回灌到上下文里,让模型看到完整轨迹,而不是碎片。
STEP 02 · ICL

激活 in-context learning

让模型在上下文里自适应新任务、新场景、新约束,这就是长上下文真正的价值。
STEP 03 · RL

再做在线强化学习

有了 trajectory 和 ICL,RL 才能真正把能力往前推,形成可持续的 test-time scaling。
→
这块是我们自己的 language-model know-how:先把长上下文做对,再谈机器人上的在线学习。
GENERAL FOUNDATION · 通用人形基础模型

科学 benchmark
比 demo 更重要

通用人形基础模型 的 benchmark 要像 LLM 一样可复现、可比较、可区分能力边界。

09 · GENERAL
PRINCIPLE 01

可复现

输入、动作、成功条件、随机种子都要清楚。
PRINCIPLE 02

无泄漏

训练集、验证集、测试集要分开,不能靠记忆刷分。
PRINCIPLE 03

能区分能力

要有 hard cases、长尾 case 和 failure case,不然 benchmark 没意义。
PRINCIPLE 04

贴近真实分布

最好能对应真实业务和私有场景,benchmark 才能变成产品判断。
PUBLIC BENCHMARKS · 全量覆盖
DOMAIN 01

室内操作

家居 · 办公 · 实验室的抓取、放置与工具使用
DOMAIN 02

室外移动

复杂地形 · 长距离自主导航
DOMAIN 03

双手协作

对称/非对称双手 · 装配 · 搬运 · 交接
DOMAIN 04

长程任务

多步规划 · 错误恢复 · 工具链调用
DOMAIN 05

人机协作

自然语言 · 协同作业 · 意图推断
DOMAIN 06

泛化能力

新物体 · 新场景 · zero-shot 迁移
SCENARIOS · 应用场景

模型能力涌现 · 短期寻找适配场景,中长期高价值

模型能力会持续涌现,场景选择也随之进化;短期先寻找与当前模型能力最适配、能快速验证价值的落地场景,再向更高价值、更复杂的任务扩展。

10 · SCENARIOS
GOLDMAN SACHS · 2035
$38B
全球人形机器人市场预测 —— 较一年前的预测上调 6 倍。
MORGAN STANLEY · 2050
$5T · 10亿台
继汽车之后最大的硬件品类。
政策 · 工信部 2027
国家级赛道
《人形机器人创新发展指导意见》—— 2027 年达到世界先进水平。
NEAR-TERM · 短期场景 · 能力适配优先
SCENE 01

通用家居

家庭操作、整理与陪护
SCENE 02

通用工业

柔性产线 · 搬运装配 · 巡检维护
SCENE 03

实验室

重复性实验操作与数据采集
SCENE 04

农业

开放环境采摘、巡检与作业
SCENE 05

零售

货架整理、补货与店内服务
SCENE 06

高危场景

核电、化工、消防等危险环境替人作业
LONG-TERM VISION · 中长期愿景
VISION 01

人形宇航员

空间站巡检 · 月面/火星基地建设 · 科学载荷部署
宇航员是人类最贵的职业 —— 培养成本数亿,但月面任务 ≈ 通用人形的 baseline 能力:贵的不是任务,是承担任务的"人"。
中美太空竞赛 + 2030 登月议程 —— 唯一可规模化的劳动力就是人形机器人。中国必须有自己的机器人送上月球。
VISION 02

机器人硬件工程师

机器人测机器人 —— 机器人自研迭代的前提
上电充电、加载模型、推送权重、搀扶检修 —— 自我迭代闭环成立:24×7 自测自训,新模型直发另一台机器人。
大模型早就用上一代优化下一代 —— 这条路径在物理世界复现,RL 迭代从季度级压到周级。
VISION 03 · 终极目标

机器人实验员 · AutoResearch

完全的自主科研 —— 提出假设、设计实验、操作仪器、分析数据、撰写论文,7×24 不间断
科学进步的瓶颈从来不是算力,而是能做实验的"人"的数量与速度。实验员机器人把这个约束解除 —— 科研吞吐量不再受限于人类作息,假设-验证闭环以机器速度运转。
硬件工程师让机器人自我迭代,实验员让科学自我加速 —— 两条线合流,就是自我强化的技术爆炸。
→
模型能力持续涌现,场景是能力落地的入口 —— 以人形机器人引领人类进入星际探索时代与技术爆炸时代,通往二型文明。
ROADMAP × BUSINESS MODEL · 路线图与商业模式

模型领先 → 垂直整合

Phase 1 极致聚焦模型层,Phase 2 硬件自研走向量产 —— 先快后重,专注高效。

11 · ROADMAP
PHASE 01 · MODEL-FIRST
2026 H2 — 2027 · 模型层占得先机
2026 · H2

技术验证

DreamVPT + IDM + WBC
~100h 真机种子
核心 PoC 跑通
2027 · H1

开源发布

10 万小时级合成数据
模型开源 · arXiv 论文
对标 Kimi 开源路线
2027 · H1

模拟登月 Demo

类月球地貌
Demo 视频发布
2027

模型 SOTA

VLA benchmark 领先
数据飞轮全速运转
奠定模型领先地位
PHASE 02 · VERTICAL INTEGRATION
2028 H1 起 · 硬件自研 · 整机量产
2028 · H1

启动硬件自研

组建本体团队 · 供应链布局
自研路线确立
2028

GPT-4 时刻

具身 GPT-4 时刻
整机原型 v1
2029

整机量产

XVI 自研本体下线
高价值场景自营 RaaS
大规模数据飞轮启动
2030

规模落地

机器人走进大街小巷
高价值场景优先
CORE TEAM · MetaBot / RSI 实践

全栈团队 · 大模型 × Agent × 运动小脑

具身赛道最稀缺的不是单点能力,而是大模型、Agent、运控都真做过的团队。

13 · TEAM
宋鸿涌 · Flood Sung
FOUNDER & CEO

宋鸿涌

FLOOD SUNG
▸前月之暗面(Moonshot AI)后训练 / RL 负责人 —— 团队 2–3 人 → 70+
▸启元世界物理动画 —— 运动小脑核心技术源头,国内最早用 Isaac Gym 做大规模运控强化学习
▸大模型 · Agent · 运动小脑 · 机器人硬件 全栈经验
→ 点击查看完整履历
RESEARCH DENSITY · 科研密度
团队累计发表顶会 / 顶刊论文 120+ 篇,Google Scholar 引用 18,400+。代表性工作:
▸Relation Network(CVPR 2018)· 小样本学习经典工作
▸Kimi k1.5 / K2 / K2.5 / Kimi-VL · 旗舰大模型核心研发
▸MoBA(NeurIPS)· 长上下文稀疏注意力
▸Nature Communications · 四足机器人自然步态学习
▸InternVLA-N1 / LLaVA-3D / EmbodiedScan / DexGraspNet 2.0 · 具身相关代表工作
CORE TEAM · 核心成员
VP
YH · 技术 VP —— 前月之暗面后训练长文本负责人 / 字节 Seed 研究员,Kimi 长文本、Kimi k1.5 核心贡献,参与 MoBA 和 Computer Use Agent 项目。
NAV
WZC · 人形导航 —— 上海 AI Lab 博后,InternVLA-N1 一作,多篇 VLN 核心工作,国内机器人导航最强之一。
WBC
FHQ · 人形运控负责人 —— 南大 PhD,四足机器人自然步态成果发表于 Nature Communications,登上 CCTV。
WBC
QM · 人形运控 —— 某头部人形机器人公司核心运控,机器人马拉松领队。
META BOT · RSI PRACTICE
10 + N
HUMAN + AGENTS
MetaBot 驱动的 Agent-Native 组织,每天用同一套流程自我迭代;这就是我们自己的 RSI 实践。
闭环很简单:目标设定 → Agents 执行与协作 → 更新 Memory / Skills → 下一轮更强。组织本身就是试验场。
MULTI-AGENT INFRA · MetaBot

整个公司,都是为 Agent 设计的

CORE SYSTEM

MetaMemory

共享记忆,沉淀上下文与组织经验。

Skill Hub

共享技能,让能力可复用、可组合。

Agent Bus

连接 Agents,完成协作、分发与结果传递。

T5T

持续追踪任务与项目状态,让执行形成闭环。
人类意图 → Agent Bus → Agents 执行 → MetaMemory / Skill Hub / T5T 沉淀 → 下一轮更强
四个核心系统把整个公司连接成一个 Multi-Agent 系统。人类设定目标并做关键判断,Agents 执行、协作、沉淀和迭代;随着系统变强,human-in-the-loop 会越来越少。
THE RAISE · 融资需求

融资需求

12 · FUNDING
ROUND · 天使++轮

Angel++

RAISE AMOUNT
¥2亿
RUNWAY
18 – 24 MONTHS
MILESTONE
2027 H1 MILESTONE
ALLOCATION · 资金用途
100%
COMPUTE 40%
DATA 30%
TEAM 20%
HW 10%
WHY NOW · 为什么现在
现在做 Humanoid Foundation Model 的窗口刚刚打开:本体成熟、大模型方法论成熟、WBC 也已经进入可以独立解决的阶段。 这轮钱不是为了慢慢试,而是为了把模型、数据和人才一口气拉到能打的状态。