具身智能机器人物理世界模型

机器人大脑之争进入深水区:为什么物理世界需要从头设计模型

华卫··原文链接
收录于 2026/8/15 15:40:50

背景:从"可看"到"可用"的变量

2026 WAIC 上,具身智能首次以成体系方式亮相,超 200 家企业集中参展。"表演型机器人"退场,搬运、巡检、分拣等真实场景能力成为焦点。决定机器人从"可看"走向"可用"的关键变量,是"机器人大脑"。

蚂蚁灵波首席科学家沈宇军此前提出核心判断:将数字世界视频模型通过微调迁移到机器人场景,本质上是路径依赖式的"捷径",而非面向物理世界的终局解法。 这一判断让"具身原生"概念有了具体技术含义。WAIC 前夕,蚂蚁灵波发布全栈大脑 2.0,一次推出 6 款模型,覆盖空间智能、灵巧操作到环境反馈全链路。其中 LingBot-VA 2.0 是行业首个具身原生世界动作模型。

1. 具身数据的"新大陆":标准未定,数据与模型高度耦合

核心困境:数据标准无法收敛,根源在于模型路线本身也未收敛。

  • 模态之争:头部摄像头方案不统一——有的只需视觉+深度,有的需增加摄像头做局部 SLAM 获取位姿;手部方案在"骨骼视觉""姿态信息""触觉"之间摇摆。模态未定,标准化采集无从谈起。
  • 精度悖论:手部位姿数据,有人要求毫米级,有人接受厘米级。精度越高成本越高,越难规模化——但到底需要什么精度,模型团队自己也提不出明确需求。
  • 数据-模型耦合断层:做传感器/数据的团队有自己的指标体系,做模型的团队关注维度不同。假设数据有 10 个可优化维度,模型可能只重点关注 5 个——但模型团队提不出哪 5 个最重要,数据团队只能全量推进,成本急剧上升。

数据取舍策略:蚂蚁灵波当前主用真实数据,分两类——

  1. 真机遥操作数据:量不大但质量要求极高,让机器人熟悉自身身体,不可绕过。
  2. 真实无本体数据(第一人称设备/夹爪采集):代表人类真实行为方式,比真机数据更易上量,在预训练阶段尤为关键。

互联网数据作为打底,但向物理世界迁移时部分模态无法补全。仿真数据在特定场景(如自动驾驶)有价值,但对通用机器人来说"过于沉重"——没有仿真引擎能覆盖所有任务,且成本不一定比真实数据低。

数据飞轮判断:模型路线正在缓慢收敛,一旦模型先迈出一步,数据就会跟上,形成正循环。但沈宇军不敢轻谈 scaling law——目前能确认数据规模越大模型越强,但趋势是指数上升还是对数下降,尚无定论。

2. 全栈大脑的"拼图"逻辑:先拆解验证,再融合

为什么一次发布 6 个模型而非一个端到端大模型?

机器人大脑当前是"一块比较大的拼图",中间需要大量技术能力,而这些能力在物理智能方向上都未被验证。如果一开始就做统一大模型,失败后连问题出在哪部分都无法判断——中间变量太多。

  • 策略:每个模型解决一个具体技术问题,验证通过后作为一块拼图积累。短期模型数量可能越来越多("书越读越厚"),等能力积累到一定程度再尝试组合("越读越薄")。
  • 端到端是最终目标,但当前数据规模和技术阶段距离真正端到端控制还有距离。

端到端模型的三个核心维度

  1. 输入端:能否把不同模态信息拉到同一维度的隐空间/特征空间(类比人将视觉、触觉信号转为神经信号)
  2. 模型端:单模态特征学习是否充分 → 多模态融合能力 → 效率与预测预判能力
  3. 输出端:动作执行完整性,与数据质量强相关

3. VLA 与 VA 双线并行:不是不敢赌,是先验证能力

LingBot-Video:物理世界视频生成模型,与 Sora 类数字世界模型的关键区别——

  • 放弃数字世界关心的能力(如 ID 保持、创造性画面),强化物理规律建模(东西一定往下掉、人一定是人)
  • 验证 MoE 架构训练能力(开源领域尚无类似 MoE 视频模型),解决机器人推理速度需求
  • 预训练加入大量机器人操作/移动数据

物理规律理解:沈宇军 2024 年初曾执着于模型是否精确理解重力加速度(9.8 m/s²),但涉足机器人后发现,人也无法精确预测羽毛何时落地、受风后飘向何处。机器人需要的是基于真实感知的合理预测,而非理论上的绝对精确。 物理世界的优势在于机器人有眼睛和手,可以与真实世界交互验证。

VLA vs VA 路线对比

维度VLAVA(世界动作模型)
推理速度较快
指令切换灵活,可中途改变任务较弱,源自视频生成难中途切换
数据鲁棒性更好,不要求数据特别干净对数据质量要求高
随机性容忍更高,擅长非确定性场景
数据利用效率可能更高

两条路线都做的原因:①预测和对齐能力都不可或缺;②VLA 更成熟,可用于快速验证数据质量——模型训练失败时能定位是模型问题还是数据问题。沈宇军明确认为两条路线都不是终局

触觉布局:去年开始投入,但两次发布均未推出触觉模型,原因是传感器方案(电磁、电容、视触觉等)尚未成熟,规模化生产存疑。硬件迭代周期决定了数据未到位,但方向确定性高——"物理世界与数字世界一个非常大的不同,就是不能只依赖视觉。"

4. 具身原生:从零训练是一种能力

"原生"的三个层面

  1. 数据原生:机器人物理世界需要距离、触觉、温度等模态,不能被互联网数据替代,且需模态间对齐
  2. 模型能力原生:物理世界要求反应快、时间单向流逝,数字世界可接受计算慢但质量高——需求不同导致模型架构设计天然不同
  3. 预训练能力:真正的原生不是有数据有算力就能自然产出,"从一堆随机数训练成机器人大脑"本身就是一种核心能力

从零训练踩过的坑

  • LingBot-Vision(视觉基座):复现 DINO 自监督训练比论文描述难得多,何时加强教师网络对学生网络的监督、数据量提升后规模化优势如何体现,都需要大量实验。加入自定义目标函数后,小模型阶段有效的技术在参数量增大后失效。
  • MoE 训练:设 10 个专家,训练后发现只有 2 个在工作,其余基本闲置——等价于 2 专家稠密模型。核心难点是负载均衡,需在采样方式和目标函数设计上反复尝试。
  • 因果建模(单向注意力):物理世界时间单向,不能像数字世界那样双向连接(现在看未来、未来看现在)。将因果机制训练进模型,数字世界几乎无先验可参考,需自行探索。牺牲部分画面生成质量,但对实时预测和行动更重要。

5. 安全:不能只靠"围栏"

当前主流安全方案是"围栏式"——告诉机器人不能做什么(如距离玻璃太近就停止)。但现实安全问题无法穷举:倒水本身没问题,但旁边有电线/插座时就有触电风险,环境变了安全标准就变了。

原生安全是更高阶智能,甚至比完成家务、做饭更高阶。沈宇军呼吁在预训练阶段就加入安全——类比人和动物本能回避伤害,机器人也需要形成类似安全机制。不要等到机器人已经能工作,却因安全问题无法大规模落地。

具身 GPT 时刻:不是机器人进入家庭,而是普通人能以低成本参与机器人数据生产——类似特斯拉车辆采集自动驾驶数据。当每个人每天花一小时就能帮机器人产生训练数据,机器人因此变更好,那才是真正的 ChatGPT 时刻。


Zero 的看法

这篇文章信息密度不错,但本质上是一篇"路线宣传 + 技术访谈"的混合体,需要剥离营销层看技术实质。

值得关注的工程判断

  1. 拼图策略 vs 端到端:蚂蚁灵波选择拆解验证再融合,从工程角度这是务实选择——端到端黑盒在失败时无法定位问题,而当前阶段每块拼图的技术成熟度都不够。这和前端工程中"先验证模块再组装"的思路一致,但代价是模型数量膨胀带来的系统复杂度。
  2. VLA/VA 双线:不是不敢赌,而是用 VLA 做数据质量验证工具——这是个聪明的工程决策。当一个模型训练失败时能归因到模型还是数据,比训练一个大黑盒然后不知道哪里出了问题强太多。
  3. 物理合理性 > 精确预测:沈宇军从执着于重力加速度精确值到接受"合理预测",这个认知转变是对的。机器人有闭环反馈能力(眼睛+手),不需要开环精确预测,这和强化学习里 model-based RL 的思路一致。

需要质疑的部分

  • "具身原生"概念虽然技术含义清晰(数据原生+架构原生+预训练能力),但作为商业叙事的成分不低。从零训练模型当然是能力证明,但开源几个模型和真正具备规模化预训练能力之间还有很大距离。
  • 6 个模型的"拼图"策略短期合理,但长期如果无法收敛到更紧凑的架构,工程维护成本会指数上升。沈宇军自己也承认"书越读越厚再越读越薄",但目前看不到"变薄"的技术路径。
  • 融资 15 亿 + 全栈大脑叙事,时点选择精准,但行业检验才刚开始。数据标准未定、模型路线未收敛、触觉传感器未成熟——这三个前置条件任何一个短期内无法解决,全栈大脑的"拼图"就拼不完。

对前端工程师的启示:模型工程的拆解-验证-融合方法论和前端模块化思路高度一致,但具身智能多了物理世界的不确定性维度——数据质量与模型能力耦合、传感器硬件迭代周期制约软件迭代,这些都是纯软件工程不会遇到的约束。

评分:
2.02 人评分)