2026 年的 VLA 很少有很深的技术积累,上层还是比较空的,所以速通的时间可以比较快。但后面想要做深、做 work,就要好好学习基础。

这份学习路线有几个特点:

  1. 不从 CNN 等传统内容开始,而是直接从 LLM 到 VLA。学习时间比较短,适合三个月速通,或者适合一些想要等有一定知识之后再补基础的人。
  2. 从项目入手,由上至下地学习。不先打完整基础,而是锚定一个核心目的猛扎,在这个过程中学习需要掌握的知识。但是这样一定需要养成独立思考的能力、询问问题的能力,认知范围和圈子才能不断扩大。

具体的入门历程,我个人推荐如下。

1. 大模型基础

这一部分可以不按照传统的深度学习路线来,直接从 Transformer 开始看起。

推荐炮哥带你一起学的 Transformer 教程,深度了解 Transformer 的基础。如果想要学得深一点,可以看苏剑林的博客或者李沐。然后去过一下 ViT,知道什么是 VLM,了解模型训练和推理的基本流程。

这两个网课再速通,也可以不跟着炮哥做项目。

2. 工程基础

这里可以去做 CS336 A1 或者 DeepMind 等项目,目的是了解完整的模型和整个框架。

不推荐用 Agent 等工具一键生成之后再去读代码,而是自己慢慢读、慢慢写,用小数据跑通,再加上简单的推理。做到这一步时,对模型的信息流以及工程基础就有感觉了。

3. VLA 入门

去看论文和开源代码,不要怕看不懂。

这里推荐看 StarVLA 这个项目,目的是了解 VLA 发展,以及知道什么是 VLA。目前很多 VLA 都使用它作为 codebase。熟悉它里面的 OFT、Pi、GR00T 等几个模型,在一定程度上就能看到 VLA 的几个分支。

在这个过程中去补基础,比如什么是 Flow Matching,什么是 Diffusion,什么是 VAE,什么是 CNN,什么是 SFT 等。看的时候可以顺带看最近日期的综述,了解当前 VLA 的发展;也可以上手改 StarVLA,修改动作头,重新训练并跑 benchmark。

4. 论文精读和知识拓展

这时候可以去看 JEPA、Fast-WAM、WAM 综述、世界模型,看《强化学习的数学原理》,看 PI0.5、PI 等论文。

然后也可以去刷感兴趣的论文,批判论文,看 Agent、VLN 等其他方向的论文,培养自己的感受。

千万不要挂死在 VLA 上。可以反过来把 VLA 当成自己入门深度学习的一个工具。

5. 学习基础数学原理

最后还是要学习基础的数学原理,追求深度和 solid。

如果有真机资源

如果有真机资源,尽可能跑一遍完整的数采、训练、推理流程。

在数采的时候,可以去学 ROS2、IK、MPC;如果做 RL,可以去学 MuJoCo、Isaac Sim 等基础。

这里给我写的一个脚本打个广告:panda667/single-piper-recoder。它可以在 WSL 上使用单个 Piper 机械臂,无需 leader 或者遥操作等方式,来采集 LeRobot 格式的数据。

SO-100 机械臂 LeRobot 采集项目,整体流程可以参考:LeRobot 中使用 SO100/101Arm 机器人手臂 | Seeed Studio Wiki