1. 引言:具身智能的“基础模型”时代
1.1 从单一任务到通用策略的范式转移
在2024年至2025年初的这段时间里,机器人学习(Robot Learning)领域经历了一场深刻的范式转移,其核心在于从针对特定环境、特定任务的“专家模型”向具备广泛泛化能力的“通才模型”(Generalist Policies)演进。这一转变的驱动力主要来自于大语言模型(LLM)和视觉语言模型(VLM)在互联网规模数据上的巨大成功。研究者们开始思考:如果语言和视觉可以通过预测下一个token来理解世界,那么物理世界的控制信号(动作)是否也可以被视为一种“语言”,从而通过类似的预训练范式来实现通用的物理智能?
这就催生了视觉-语言-动作(Vision-Language-Action, VLA)模型的概念。与传统的模仿学习(Imitation Learning)不同,VLA不再仅仅是简单的感知-动作映射网络,而是建立在庞大的语义理解基础之上的多模态基础模型。它们不仅能“看”和“读”,还能直接输出控制机器人的底层指令。
1.2 2024-2025年的技术分水岭
2023年Google DeepMind发布的RT-2模型奠定了VLA的概念基础,证明了将动作作为语言token进行联合训练是可行的。然而,进入2024年和2025年,随着OpenVLA、Octo、$\\pi_0$ (Pi-zero) 以及NVIDIA的GR00T等模型的涌现,该领域发生了显著的技术分化与深化。
当前的文献显示出两条主要的技术路线之争:
离散化自回归路线(Autoregressive Discretization): 以OpenVLA为代表。这条路线坚持“动作即语言”的哲学,通过将连续的物理量(如关节角度)离散化为词表中的token,利用成熟的Transformer架构进行序列预测。其优势在于能无缝继承LLM的推理能力,但劣势在于动作的精度受限于离散化的粒度,且推理速度较慢。
连续生成式路线(Continuous Generative Modeling): 以Octo、$\\pi_0$和GR00T为代表。这条路线认为物理动作本质上是连续且多模态的,离散化会丢失高频控制所需的精细度。因此,它们采用了**扩散模型(Diffusion Models)或流匹配(Flow Matching)**技术,将动作生成建模为去噪或向量场回归过程。这种方法能够实现高达50Hz以上的控制频率,更适合高动态的机器人任务。
此外,**双系统架构(Dual-System Architecture)**的概念在2025年逐渐成为主流,特别是在人形机器人(如GR00T)的研究中。这种架构模仿人类的认知过程,将“慢思考”(System 2,负责高层语义规划的VLM)与“快反应”(System 1,负责底层高频控制的扩散/流匹配网络)解耦又协同工作,解决了大模型推理延迟与机器人实时控制需求之间的矛盾。
本报告将对上述关键模型进行详尽的技术拆解,分析其背后的数学原理、数据策略及训练范式,并在最后基于这些顶级文献的写作风格,总结出撰写VLA论文“方法(Method)”部分的结构化指南。
2. 核心技术路线一:离散化自回归 VLA —— 以 OpenVLA 为例
2.1 架构设计哲学:为了微调而生
OpenVLA 1 是2024年中期发布的一个里程碑式工作,其核心目标是解决以往VLA模型(如RT-2-X)闭源且难以针对新机器人进行微调的问题。OpenVLA是一个70亿参数(7B)的开源VLA,它并没有重新发明轮子,而是精妙地整合了现有的最强组件,构建了一个极其稳健的基座。
2.1.1 视觉编码器的融合策略
OpenVLA在视觉前端的设计上体现了深刻的洞察。传统的VLM通常只使用CLIP或SigLIP这样的对比学习特征,这些特征擅长语义对齐(例如识别“这是一个苹果”),但在空间几何感知上较弱(例如定位“苹果的边缘在哪里”)。机器人操作不仅需要语义理解,更需要精确的几何感知。
因此,OpenVLA采用了**双视觉编码器融合(Fused Visual Encoder)**策略:
-
SigLIP (Sigmoid Loss for Language Image Pre-training): 负责捕捉图像的高层语义信息,确保模型能理解复杂的自然语言指令与视觉场景的对应关系。
-
DINOv2 (Self-distillation with NO labels): 负责提供密集的、像素级的几何特征。DINOv2在自监督训练中习得的特征对物体的空间布局、纹理和形状极为敏感,这对于精准的抓取和操作至关重要。
这两种特征在通道维度或token维度进行融合后,通过一个多层感知机(MLP)投影器映射到语言模型的嵌入空间。这种设计直接解决了以往模型“懂任务但手不准”的痛点。
2.1.2 动作的Token化(Action Tokenization)
OpenVLA沿用了RT-2的动作离散化思路,但在细节上进行了优化。
-
动作空间定义: 模型输出的是7自由度(7-DoF)的末端执行器动作:$\\Delta x, \\Delta y, \\Delta z$(位置变化),$\\Delta roll, \\Delta pitch, \\Delta yaw$(姿态变化),以及夹爪开合状态。
-
分位数分桶(Quantile Binning): 与简单的线性分桶不同,OpenVLA采用了分位数分桶策略。研究团队统计了Open X-Embodiment数据集中所有动作的分布,根据数据的概率密度来划分256个桶(bins)。这意味着在动作数据密集的区域(通常是微小的精细调整动作),桶的宽度更窄,分辨率更高;而在稀疏区域(大幅度的快速移动),桶更宽。这种非线性离散化极大地提升了控制精度。
-
词表覆写: 这256个动作token直接覆写了Llama 2词表中原本使用频率最低的256个token。这样,Llama 2就被“欺骗”着去预测这些代表物理动作的词,从而无缝利用了其强大的序列推理能力。
2.2 训练配方与参数高效微调(PEFT)
OpenVLA在Open X-Embodiment数据集的97万条轨迹上进行了全量预训练。然而,其真正的贡献在于探索了如何让这个庞然大物适应新的机器人。
在机器人领域,全量微调(Full Fine-Tuning)7B模型不仅显存开销巨大,而且容易导致“灾难性遗忘”(Catastrophic Forgetting),即模型学会了新机器人的操作,却丧失了原本的通用语义能力。OpenVLA团队系统性地评估了LoRA (Low-Rank Adaptation) 在VLA中的应用。
-
LoRA的有效性: 实验表明,仅对Attention层的权重矩阵进行低秩更新(仅占总参数量的1.4%),其效果甚至优于或持平于全量微调 4。这表明,预训练的VLA已经掌握了物理交互的“语法”,适应新环境只需要调整少量的“词汇映射”。
-
训练效率: 这种方法使得OpenVLA可以在单个消费级GPU(如RTX 3090或4090)上进行微调,极大地降低了具身智能研究的门槛。这也是OpenVLA在开源社区获得广泛采用的关键原因。
2.3 局限性与反思
尽管OpenVLA在静态操作任务(如Pick-and-Place)上表现出色,但其自回归的本质带来了一个不可忽视的缺陷:推理延迟。生成一个动作需要LLM串行预测7个以上的token,导致控制频率通常在5Hz-10Hz左右。对于需要快速反应的动态任务(如接球、甚至快速切菜),这种频率显得捉襟见肘。这也为后续的Octo和$\\pi_0$留出了创新空间。
3. 核心技术路线二:连续生成式 VLA —— 从 Octo 到 $\\pi_0$
为了突破离散化带来的精度损失和频率限制,2024-2025年的另一派研究者转向了生成式模型。这一流派认为,动作分布本质上是多模态的(同一个任务可能有多种解法),且应当是连续的。
3.1 Octo:模块化的扩散策略专家
Octo 5 是由Berkeley、Stanford和DeepMind联合推出的开源通用机器人策略。它的核心在于将Transformer的主干网络与**扩散模型(Diffusion Head)**相结合。
3.1.1 扩散策略(Diffusion Policy)的数学原理
Octo采用了去噪扩散概率模型(DDPM)来生成动作。其数学表述不再是分类问题(预测哪个bin),而是去噪问题。
给定观测 o_t 和语言指令 l,模型的目标是从高斯噪声 x_K ∼ 𝒩(0, I) 中逐步去噪,恢复出动作序列 x_0。
训练时的损失函数通常为预测噪声的均方误差(MSE):
$$\\mathcal{L} = \\mathbb{E}_{k, x_0, \\epsilon} \\left[ \\| \\epsilon – \\epsilon_\\theta(x_k, k, o_t, l) \\|^2 \\right]$$
其中 k 是扩散步数,ε_θ 是神经网络预测的噪声。
3.1.2 模块化设计与观察历史
Octo的一个显著特点是其模块化(Block-wise)的Transformer架构。它将不同模态的输入(腕部相机图像、第三人称视角图像、本体感知数据、语言指令)分别Token化,然后送入Transformer进行注意力交互。 与OpenVLA不同,Octo不仅关注当前帧,还显式地处理观察历史(Observation History)。这使得模型能够推断物体的速度和加速度,对于动态任务至关重要。
3.1.3 动作分块(Action Chunking)
为了解决推理速度问题并保证动作的平滑性,Octo采用了动作分块技术。模型一次推理不是预测这一秒的动作,而是预测未来 $H$ 步(例如16步或32步)的动作序列。在执行时,机器人可以依次执行这一串动作,或者通过“重托水平”(Receding Horizon)控制,每步都重新预测并仅执行第一步。这种机制结合扩散模型的生成能力,使得Octo能够产生极其平滑、连贯的轨迹,避免了离散化模型常见的“抖动”现象。
3.2 $\\pi_0$ (Pi-zero):流匹配带来的速度革命
如果说Octo证明了扩散模型在VLA中的潜力,那么Physical Intelligence公司推出的 $\\pi_0$ 8 则是将这一路线推向了极致,特别是针对高频控制的优化。
3.2.1 从扩散到流匹配(Flow Matching)
扩散模型虽然生成质量高,但往往需要几十步的去噪迭代,导致推理延迟高。π₀ 引入了流匹配(Flow Matching)技术。流匹配是一种基于常微分方程(ODE)的生成模型。它不是去学习如何去除噪声,而是学习一个向量场(Vector Field)v_t(x),该向量场定义了从噪声分布直接"流"向数据分布的最佳路径(通常是直线路径)。
其训练目标是回归这个向量场:
$$\\mathcal{L}_{FM} = \\mathbb{E}_{t, x_1, x_0} \\left[ \\| v_t(\\phi_t(x_1)) – (x_1 – x_0) \\|^2 \\right]$$
这里 x_1 是数据,x_0 是噪声,φ_t 是插值路径。
由于流匹配可以直接学习从噪声到数据的直线轨迹,推理时只需要极少的步数(例如1-10步)即可通过ODE求解器生成高质量动作。这使得 π₀ 能够在保持强大生成能力的同时,实现高达50Hz的控制频率 8。
3.2.2 跨具身(Cross-Embodiment)与协同训练
$\\pi_0$ 的另一个核心贡献是其大规模的跨具身训练。它不仅在单一类型的机器人上训练,而是在包括单臂、双臂、移动底盘等8种不同构型的机器人数据上联合训练。 更进一步,其升级版 $\\pi_{0.5}$ 引入了**协同训练(Co-training)**策略 11。模型不仅学习输出动作,还同时学习纯文本和纯视觉任务(如VQA)。
-
思维链(Chain of Thought)在机器人中的应用: $\\pi_{0.5}$ 在执行任务时,会先在内部生成一个高层的语义规划(High-level Action,文本形式),例如“我现在需要折叠衬衫的左袖子”,然后再通过流匹配头(Flow Matching Head)生成对应的底层关节角度。这种显式的语义引导极大地增强了模型在长程复杂任务(如整理房间、折叠衣物)中的鲁棒性。
4. 前沿架构三:双系统人形机器人模型 —— GR00T
NVIDIA在2025年发布的GR00T N1 9 代表了VLA在人形机器人(Humanoid)领域的最高水平。人形机器人的控制难度远超机械臂,因为它们需要同时处理平衡、行走和双臂操作,自由度极高。
4.1 System 1 与 System 2 的认知架构
GR00T的设计灵感直接来源于认知心理学中的双系统理论:
-
System 2(慢思考): 由一个强大的VLM(基于NVIDIA Eagle-2)构成。它运行频率较低(如10Hz),负责“看”和“想”。它解析复杂的环境语义,理解模糊的语言指令,并生成一个潜在的意图嵌入(Intent Embedding)。
-
System 1(快反应): 由一个基于**DiT(Diffusion Transformer)**的动作生成网络构成。它运行频率极高(如50-100Hz),负责“动”。它接收System 2传来的意图嵌入,结合当前的本体感知(关节位置、速度、IMU数据),通过去噪生成实时的电机控制信号。
这种解耦设计完美解决了VLM推理慢与机器人控制快之间的矛盾。System 2 就像大脑皮层,负责规划;System 1 就像小脑和脊髓,负责具体的肌肉协调。
4.2 数据金字塔(Data Pyramid)与仿真
GR00T的成功很大程度上归功于其数据策略。由于真实世界的人形机器人数据极其稀缺,NVIDIA构建了一个庞大的数据金字塔:
-
塔基(Web Data): 数以亿计的互联网图文数据,用于训练System 2的通用语义理解。
-
塔身(Simulation Data): 利用Isaac Lab和OSMO编排系统,在物理仿真中并行生成数百万条机器人操作轨迹。通过域随机化(Domain Randomization),仿真数据为System 1提供了极其丰富的物理交互先验。
-
塔尖(Real World Data): 少量的高质量遥操作数据,用于将模型对齐到真实的物理世界。
这种“Sim-to-Real”的大规模应用,配合双系统架构,使得GR00T能够在没有见过的场景中展现出惊人的零样本(Zero-shot)泛化能力。
5. 其他新兴模型与技术概览
除了上述三大巨头,2024-2025年还有多个值得关注的模型填补了生态位的空缺:
|
模型 |
核心特点 |
适用场景 |
|
SmolVLA |
轻量化。针对端侧部署优化,参数量极小,旨在在算力受限的嵌入式设备上运行。 |
移动机器人、低成本机械臂 |
|
Helix |
双系统架构先驱。由Figure AI开发,同样采用LLM规划+策略网络执行的架构,强调端到端的神经网络控制而非传统的MPC。 |
Figure 01/02 人形机器人 |
|
Gemini Robotics |
云端协同。利用Gemini 2.0的超长上下文和多模态推理能力在云端做规划,配合端侧轻量级策略执行,解决了长程任务记忆问题。 |
复杂家庭服务任务 |
|
RDT-1B |
双臂协同。专门针对双臂操作优化的扩散Transformer,解决了双臂协调中的高维空间探索难题。 |
双臂组装、精细操作 |
6. 数据:VLA能力的源泉
6.1 Open X-Embodiment 数据集
上述所有模型的成功都离不开Open X-Embodiment数据集 6。这是一个由全球34个机器人实验室联合构建的数据集,包含了:
-
22种机器人构型: 从Franka、UR5等工业臂,到WidowX等低成本臂,再到各种移动底盘。
-
100万+ 轨迹: 涵盖了从简单的拾取放置到复杂的物体操作。
-
标准化格式(RLDS): 统一了数据格式,使得跨具身训练成为可能。
6.2 数据的“异质性”挑战与应对
在训练VLA时,不同来源的数据往往具有不同的模态(有的有语言标注,有的没有)、不同的视角(腕部相机 vs 全局相机)和不同的控制频率。
-
混合策略: OpenVLA和Octo都采用了特定的数据混合比例(Mixture Ratios),通常会给高质量、多样性强的子数据集(如Bridge Data V2)更高的采样权重。
-
动作重标注: 为了统一动作空间,研究者通常会将不同机器人的动作统一映射到从末端执行器坐标系下的6-DoF位姿变化 + 夹爪状态。
7. 学术论文写作指南:如何撰写“方法(Method)”部分
基于对OpenVLA、Octo、$\\pi_0$等顶级论文的深度解构,本节为研究人员提供一份关于如何撰写VLA论文“方法”部分的结构化指南。该部分是论文的核心,旨在建立数学形式化、解释技术决策并保证可复现性。
7.1 核心写作原则
数学形式化先行(Formalization First): 不要一上来就堆砌网络结构图。首先要定义你的控制问题。是马尔可夫决策过程(MDP)?还是部分可观测(POMDP)?
输入-处理-输出(Input-Process-Output)逻辑: 按照数据流动的方向组织章节。感知 -> 推理/融合 -> 生成。
为每一个设计决策辩护(Justify Every Choice): 审稿人不仅想知道你做了什么,更想知道为什么。为什么选SigLIP而不是CLIP?为什么选流匹配而不是扩散?(例如:“为了解决扩散模型的推理延迟问题……”)。
7.2 推荐的结构大纲与内容细节
7.2.1 预备知识与问题定义 (Preliminaries & Problem Formulation)
-
内容:
-
定义策略 π_θ(a_t | o_t, l)。
-
观测空间 O:明确定义 o_t 包含什么。例如:o_t = {I_wrist, I_third, p_prop},其中 I ∈ ℝ^{H×W×3}。
-
动作空间 A:明确定义 a_t。是关节角度(Joint Positions)还是末端位姿(EEF Pose)?是绝对坐标还是相对增量(Delta)?
-
示例句式:"We formulate the vision-language-action task as learning a policy π that maps a sequence of observations and a natural language instruction to a sequence of future actions."
7.2.2 模型架构 (Model Architecture)
这是最长、最详细的小节。建议配合一张清晰的系统框图(System Overview)来写。
-
视觉编码器 (Visual Encoders):
-
描述使用的Backbone(如SigLIP-SO400M)。
-
解释特征提取的细节(如:提取倒数第二层的Patch Features)。
-
关键点:如果使用了多编码器(如OpenVLA),必须解释融合机制(Concatenation, Cross-Attention, or MLP Projection)。
-
VLM/Transformer主干 (Backbone):
-
指定LLM型号(如Llama 2 7B)。
-
描述多模态对齐方法(Projector的设计)。
-
动作头/解码器 (Action Head/Decoder):这是VLA论文的灵魂。
-
如果是自回归模型(OpenVLA):必须详细描述分词(Tokenization)过程。给出分位数分桶的公式,解释词表扩充的细节。
-
如果是生成式模型(Octo/π₀):必须写出生成过程的数学公式。
-
扩散公式:ℒ_Diff = ||ε – ε_θ(x_t, t, cond)||²
-
流匹配公式:定义向量场回归目标。
-
关键点:解释动作分块(Chunking)策略。为什么一次预测 H 步?这对平滑性有何影响?
7.2.3 训练方法 (Training Methodology)
-
训练目标 (Training Objective):写出总的损失函数。
-
例如:ℒ_total = ℒ_action + λℒ_auxiliary
-
例如:$\\mathcal{L}_{total} = \\mathcal{L}_{action} + \\lambda \\mathcal{L}_{auxiliary}$。
-
微调策略 (Fine-tuning Strategy):
-
详细描述参数冻结情况。视觉编码器冻结了吗?LLM是全量微调还是LoRA?
-
如果是LoRA,秩(Rank)是多少?应用在哪些模块(q, k, v, o)?
7.2.4 推理与部署 (Inference & Deployment)
很多论文容易忽略这一部分,但它对复现至关重要。
-
内容:
-
时序集成 (Temporal Ensembling): 如果使用了动作分块,如何处理重叠的动作序列?是只取第一步,还是加权平均?
-
控制频率 (Control Frequency): 模型的推理耗时是多少?实际下发给机器人的频率是多少?
-
硬件细节: 这一部分可以放在实验设置中,但如果涉及端侧优化(如量化),应在此处说明。
8. 结论与展望
2024-2025年是具身智能从“作坊式”走向“工业化”的关键时期。
-
模型层面: 我们见证了从简单的自回归Token预测(OpenVLA)向更符合物理规律的连续生成模型($\\pi_0$, GR00T)的演进。
-
架构层面: 双系统(System 1/2)架构的成熟,标志着机器人开始拥有类似人类的“思考”与“本能”分离的能力。
-
数据层面: Open X-Embodiment和合成数据金字塔的建立,初步缓解了困扰机器人领域几十年的数据饥渴问题。
对于未来的研究者而言,单一的模型架构创新可能不再是唯一的出路。如何高效地利用异构数据、如何实现更强的Sim-to-Real迁移、以及如何让VLA模型具备长程的因果推理能力(而不仅仅是动作克隆),将是接下来的核心命题。撰写高质量的论文,不仅需要扎实的实验,更需要清晰、规范且具有洞察力的方法论表述,希望本报告的写作指南能为此提供有益的参考。
数据引用表格:主流模型参数对比
|
特性 |
OpenVLA |
Octo |
π0 (Pi-zero) |
GR00T N1 |
|
核心架构 |
Prismatic VLM (Llama 2) |
Transformer + Diffusion |
VLM + Flow Matching |
System 2 (VLM) + System 1 (DiT) |
|
动作表示 |
离散 Token (256 bins) |
连续向量 (Continuous) |
连续向量 (Continuous) |
连续向量 (Continuous) |
|
生成机制 |
自回归 (Autoregressive) |
扩散去噪 (Denoising) |
向量场回归 (ODE) |
去噪/流匹配 |
|
推理频率 |
低 (<10Hz) |
中 |
高 (50Hz+) |
极高 (System 1: 100Hz) |
|
微调方式 |
LoRA (PEFT) |
Full / Head Only |
Full / Co-training |
Domain Adaptation |
|
主要数据集 |
Open X-Embodiment |
Open X-Embodiment |
Proprietary + Open Mix |
Data Pyramid (Web+Sim+Real) |
(注:本报告中涉及的具体参数和性能指标均基于2024-2025年公开发表的论文及技术报告整理。)
引用的著作
OpenVLA: An Open-Source Vision-Language-Action Model – OpenReview, 访问时间为 二月 1, 2026, Verifying your browser | OpenReview
OpenVLA: An Open-Source Vision-Language-Action Model – arXiv, 访问时间为 二月 1, 2026, https://arxiv.org/html/2406.09246v1
[2406.09246] OpenVLA: An Open-Source Vision-Language-Action Model – arXiv, 访问时间为 二月 1, 2026, [2406.09246] OpenVLA: An Open-Source Vision-Language-Action Model
OpenVLA: An Open-Source Vision-Language-Action Model, 访问时间为 二月 1, 2026, OpenVLA: An Open-Source Vision-Language-Action Model
🐙 Octo: An Open-Source Generalist Robot Policy, 访问时间为 二月 1, 2026, 🐙 Octo: An Open-Source Generalist Robot Policy
An Open-Source Generalist Robot Policy – Octo, 访问时间为 二月 1, 2026, https://octo-models.github.io/paper.pdf
[2405.12213] Octo: An Open-Source Generalist Robot Policy – arXiv, 访问时间为 二月 1, 2026, [2405.12213] Octo: An Open-Source Generalist Robot Policy
π 0 : Our First Generalist Policy – Physical Intelligence, 访问时间为 二月 1, 2026, Our First Generalist Policy
Vision-language-action model – Wikipedia, 访问时间为 二月 1, 2026, https://en.wikipedia.org/wiki/Vision-language-action_model
[Paper Review] Pi0, Pi0.5, Pi0-FAST – Tracing the Path of Physical Intelligence (PI), 访问时间为 二月 1, 2026, https://bequiet-log.vercel.app/pi-review
A VLA with Open-World Generalization – Physical Intelligence, 访问时间为 二月 1, 2026, A VLA with Open-World Generalization
GR00T N1: An Open Foundation Model for Generalist Humanoid Robots – arXiv, 访问时间为 二月 1, 2026, [2503.14734] GR00T N1: An Open Foundation Model for Generalist Humanoid Robots
GR00T N1: An Open Foundation Model for Generalist Humanoid Robots – arXiv, 访问时间为 二月 1, 2026, https://arxiv.org/pdf/2503.14734
Paper notes: OpenVLA. With the large-scale accessibility of… | by Jay Vakil | Toward Humanoids | Medium, 访问时间为 二月 1, 2026, https://medium.com/correll-lab/paper-notes-openvla-17540381187e
网硕互联帮助中心



评论前必须登录!
注册