20%数据超GR00T N1.6、RoboDojo超WAM!StarVLA只用16卡训出全新VLA!
机器之心 · 人工智能
机器之心 2026-09-06 13:00 上海 Beyond Data Scaling:让每条机器人数据“学得更值” 机器人 VLA 还在疯狂卷数据,StarVLA 团队这次却把目光放到了另一个问题上: 除了继续 scale 数据以外,能不能让每一条 数据 都学得更值? 他们最新发布了面向 VLA 的 VLM 底座 VLAct 。 VLAct 的整个 continued pre-training 只使用开源数据和 16 张 GPU ,但成绩相当能打:RoboTwin 2.0 成功率达到 92.5% ;在 RoboDojo 榜单中超过所有明确标注为 World Action Model(WAM)的模型;面对预训练阶段从未见过的 GR-1 机器人,只使用 20% 的 RoboCasa-GR1 下游数据,就已经超过 NVIDIA GR00T N1.6 的全量数据基线。模型、Checkpoint、训练代码和 Pipeline 也 全部开源 。 图 1|VLAct 主要结果一览:RoboDojo、RoboTwin 2.0、RoboCasa-GR1,以及 16 GPUs 与全开源。(项目宣传图) 机器人数据 没法像互联网数据一样“爬” 过去几年,大模型已经证明了一条非常有效的路线:数据更多、模型更大、算力更强,能力就不断往上走。VLA 自然也希望复制这条 Scaling 路线。 但机器人领域有一个绕不开的现实:机器人轨迹不是网页数据,不能从互联网直接爬下来。每条数据都需要机器人真正在物理世界里完成操作,背后往往还有遥操作、数据采集和硬件成本。更麻烦的是,机器人最终面对的是几乎无限的场景、物体、任务和机器人形态组合。 所以 VLAct 并不是想否定 Data Scaling,而是补上另一个问题: 在同样的数据预算下,能不能让机器人轨迹在 Backbone 里留下更多可以跨任务、跨 Action Head、甚至跨机器人迁移的知识? 图 2|Naive VLA pre-training 容易绑定预训练场景;VLAct 把目标转向更可迁移的 Action-aware Representation。 一个有点反常识的发现: Action 学得更好,Backbone 不一定更好 VLAct 真正的起点,来自团队前期实验中一个很有意思的现象。现在很多 VLA 都会从一个 VLM 出发,挂上 Action Head,再用机器人数据继续训练。很自然的想法是:Action 预测越准,说明这次 VLA 预训练越成功。 但实验发现,并不一定。以 RoboTwin 为例,使用 OFT Head 做 continued pre-training 后,如果下游继续使用 OFT,成功率可以从 61.7%提高到 75.8%;但把同一个 Backbone 换成 PI Head,下游反而从 60.5%下降到 55.1%;换成 GR00T Head 甚至从 51.2%降到 28.9%。 换句话说: Policy 在原来的 Head 上变强了,不代表 Backbone 真的变得更通用 。 图 3|Action supervision 会直接塑造 Backbone:同 Head 性能提升,并不自动转化为 Cross-head 迁移能力。 原因也很直观。Action Head 和 Backbone 是一起训练的,只用一种 Head 时,Backbone 很容易逐渐学会一种“最方便这个 Head 读取”的 Feature Geometry。对于当前 Policy,这当然很好;但换一个 Action Head、任务甚至机器人后,这些 Representation 未必还能继续复用。论文把这种现象称为 head-specific representation collapse 。 于是 VLAct 把 continued pre-training 的目标重新定义了一遍:不是训练一个已经很会做动作的固定 Policy Initialization,而是 训练一个能被不同 Action Head、不同任务、不同机器人继续利用的 VLM Backbone 。 那怎么避免 Backbone 被“带偏”? 围绕这个目标,VLAct 没有重新发明复杂的 Policy Architecture,而是在 continued pre-training 阶段做了三件事。 第一, 别把 VLM 原来学会的东西忘了 。VLAct 保护 Vision Encoder 和较浅的 LLM 层,同时混入 Caption 数据,让模型在学习 Action 时尽量保住原来的视觉语言先验。 第二, 别让一种 Action Head 说了算 。VLAct 同时挂上 OFT、PI 和 GR00T 三种连续 Action Head