之前的 VLA 方法大致可以分成几类:有的在 VLM 后面接一个 MLP 动作头,有的接连续扩散头,也有的走传统自回归动作生成路线。

这些方法都能工作,但有一个共同问题:动作生成模块往往被放在主干网络之外。也就是说,感知、语言理解和动作决策并不完全在同一个统一结构中完成。

这会破坏模型的端到端表征连续性推理统一性。更直白一点说,就是前面一个网络理解世界,后面另一个模块负责动作,两边并不一定真正“长在一起”。

这篇论文想解决什么?

这篇论文的核心亮点,是把离散扩散引入 VLA,并让模型在统一 Transformer 架构内完成感知、指令对齐和动作解码。

这样做的好处是:动作生成不再只是外接模块,而是可以更自然地继承预训练主干的表征能力,为后续扩展模型和数据集打基础。

核心做法

一句话概括:先把连续动作空间映射成离散的 action tokens,再把完整轨迹切成固定长度的 chunk,在离散 token 空间中做扩散式生成。

具体来说,它主要依赖两个关键设计:

  1. 动作离散化:把连续动作映射为离散 action tokens,让动作生成可以被放进 Transformer 的 token 体系里。
  2. 动作分块:把完整轨迹切成固定长度的 chunk,让模型一次处理一段动作,而不是一步一步零散生成。

在解码阶段,论文还用了两个很关键的技巧:二次重掩码自适应顺序解码

自适应顺序解码:先易后难

自适应顺序解码的思路很像“先做确定的题,再回头处理不确定的题”。

模型会先解码当前轨迹里置信度高、比较容易预测的动作 token,并把它们固定下来。置信度低的 token 继续保持 masked 状态,等下一轮再预测。

在多轮推理中,上一轮中更可信的预测会成为新的上下文,帮助模型重新预测那些不确定 token。这样既能提高稳定性,也能减少无效解码。

实验结果

在 Benchmark 实验中,Discrete Diffusion VLA 在多项评测中表现领先。

尤其是在 OOD 泛化实验中,面对语音增强和视觉增强两种扰动,模型准确率下降只有 1% 出头,说明这种统一架构确实有不错的鲁棒性。

我的理解

这篇工作的思路很清爽:它不是简单地在 VLM 外面再接一个动作模块,而是尝试把动作也纳入统一 token 化建模框架。

如果这个方向继续发展下去,VLA 可能会越来越像真正的端到端机器人 Transformer:视觉、语言、状态和动作都在同一套结构里流动,而不是靠外接模块勉强拼起来。