VLA 详细的入门基础
2026 年的 VLA 很少有很深的技术积累,上层还是比较空的,所以速通的时间可以比较快。但后面想要做深、做 work,就要好好学习基础。 这份学习路线有几个特点: 不从 CNN 等传统内容开始,而是直接从 LLM 到 VLA。学习时间比较短,适合三个月速通,或者适合一些想要等有一定知识之后再补基础的人。 从项目入手, …
2026 年的 VLA 很少有很深的技术积累,上层还是比较空的,所以速通的时间可以比较快。但后面想要做深、做 work,就要好好学习基础。 这份学习路线有几个特点: 不从 CNN 等传统内容开始,而是直接从 LLM 到 VLA。学习时间比较短,适合三个月速通,或者适合一些想要等有一定知识之后再补基础的人。 从项目入手, …
在当前的 VLA 工作中,核心 benchmark 大部分选择的都是 LIBERO。通常再紧跟着做一个 LIBERO-Plus,放在实验的最开头作为主要实验部分,接着再放一些 RoboTwin 等其他 benchmark 作为第二组实验。 但是,看着每篇论文都有 98、99.2、100 的漂亮指标,我很疑惑 …
论文:HiPolicy,arXiv: 2604.06067。 这篇论文最吸引我的地方,是它把机器人动作输出拆成了“快动作”和“慢动作”:不是让模型永远用同一个频率生成动作,而是根据任务状态,自适应选择更合适的动作频率。 核心问题:为什么单一频率不够? 主流模仿学习方法,比如 DP、ACT、DP3,通常采用固定频率的动作 …
上海交大学生手册里有一句话,我一直记得很清楚: 做科研最重要的,不是你在做什么,而是你知道正在做的是什么。 看论文也是一样。很多时候我们读完一篇论文,只记得“这篇论文做了什么”,但到了下一篇论文,又重新开始迷路。 这不是因为论文太多,而是因为脑子里还没有技术路线图。 为什么需要技术路线图? 如果没有路线图,看论文就很容 …
PI0.5有一个很有意思的地方,他在动作头中,引入了一些随机初始化的token作为Q来和VLM输出进行交叉注意力 论文中把他们称为future token,即让模型想象一下“未来” 但是,这只是作者的声明,为什么就一定是future呢? 这只是融合了当前 VLM 表示,并不自动等价于预测未来状态 并且不会觉得相似吗? …
之前的 VLA 方法大致可以分成几类:有的在 VLM 后面接一个 MLP 动作头,有的接连续扩散头,也有的走传统自回归动作生成路线。 这些方法都能工作,但有一个共同问题:动作生成模块往往被放在主干网络之外。也就是说,感知、语言理解和动作决策并不完全在同一个统一结构中完成。 这会破坏模型的端到端表征连续性和推理统一性。更 …
为什么 Flow Matching 能成为 VLA 的主流方法之一?这篇笔记想用 pi0 的架构,把它背后的直觉讲清楚。 在讲 Flow Matching 之前,需要先回顾一下 diffusion 的思想。 先理解 diffusion:从噪声中还原 扩散模型的完整逻辑由两个过程组成: 正向扩散:不断加噪声,把清晰样本破 …
今天这篇 2025 年 9 月的论文,在 VLA 这个卷到飞起的领域里确实算有点 “老” 了 VLA-Adapter arxiv 编号:2509.09372 但是不妨它还是小模型之王! 它的核心做法,一句话就能讲清:用一套由两个交叉注意力 + 一个自注意力构成的 Bridge Attention 桥接模块,实现了极致轻 …
自从具身大火之后,之前很多做LLM,VLM的人涌进来很多 VLA是建立在VLM的基础上的,早年的VLA很朴素,一般是VLM加个自回归生成的动作头,再用机器人数据微调一下 既然是VLA从VLM发展过来的,那VLM上的method都应该在VLA上能够施展开来 于是,这波论文潮随之而来了 某种意义上,论文数量的涌现效应甚至比 …
这个栏目用于整理 VLA / WAM 相关资料,包括多模态理解、动作生成、机器人控制和系统集成。