VLA 详细的入门基础
2026 年的 VLA 很少有很深的技术积累,上层还是比较空的,所以速通的时间可以比较快。但后面想要做深、做 work,就要好好学习基础。 这份学习路线有几个特点: 不从 CNN 等传统内容开始,而是直接从 LLM 到 VLA。学习时间比较短,适合三个月速通,或者适合一些想要等有一定知识之后再补基础的人。 从项目入手, …
按时间顺序整理学习笔记、论文阅读、工程实践和阶段性思考。
2026 年的 VLA 很少有很深的技术积累,上层还是比较空的,所以速通的时间可以比较快。但后面想要做深、做 work,就要好好学习基础。 这份学习路线有几个特点: 不从 CNN 等传统内容开始,而是直接从 LLM 到 VLA。学习时间比较短,适合三个月速通,或者适合一些想要等有一定知识之后再补基础的人。 从项目入手, …
在当前的 VLA 工作中,核心 benchmark 大部分选择的都是 LIBERO。通常再紧跟着做一个 LIBERO-Plus,放在实验的最开头作为主要实验部分,接着再放一些 RoboTwin 等其他 benchmark 作为第二组实验。 但是,看着每篇论文都有 98、99.2、100 的漂亮指标,我很疑惑 …
PI0.5有一个很有意思的地方,他在动作头中,引入了一些随机初始化的token作为Q来和VLM输出进行交叉注意力 论文中把他们称为future token,即让模型想象一下“未来” 但是,这只是作者的声明,为什么就一定是future呢? 这只是融合了当前 VLM 表示,并不自动等价于预测未来状态 并且不会觉得相似吗? …
自从具身大火之后,之前很多做LLM,VLM的人涌进来很多 VLA是建立在VLM的基础上的,早年的VLA很朴素,一般是VLM加个自回归生成的动作头,再用机器人数据微调一下 既然是VLA从VLM发展过来的,那VLM上的method都应该在VLA上能够施展开来 于是,这波论文潮随之而来了 某种意义上,论文数量的涌现效应甚至比 …
今天这篇 2025 年 9 月的论文,在 VLA 这个卷到飞起的领域里确实算有点 “老” 了 VLA-Adapter arxiv 编号:2509.09372 但是不妨它还是小模型之王! 它的核心做法,一句话就能讲清:用一套由两个交叉注意力 + 一个自注意力构成的 Bridge Attention 桥接模块,实现了极致轻 …