LIBERO 被刷爆之后,VLA 还应该刷什么?
在当前的 VLA 工作中,核心 benchmark 大部分选择的都是 LIBERO。通常再紧跟着做一个 LIBERO-Plus,放在实验的最开头作为主要实验部分,接着再放一些 RoboTwin 等其他 benchmark 作为第二组实验。 但是,看着每篇论文都有 98、99.2、100 的漂亮指标,我很疑惑 …
研究判断、学习方法、技术路线与阶段性想法。
在当前的 VLA 工作中,核心 benchmark 大部分选择的都是 LIBERO。通常再紧跟着做一个 LIBERO-Plus,放在实验的最开头作为主要实验部分,接着再放一些 RoboTwin 等其他 benchmark 作为第二组实验。 但是,看着每篇论文都有 98、99.2、100 的漂亮指标,我很疑惑 …
论文:HiPolicy,arXiv: 2604.06067。 这篇论文最吸引我的地方,是它把机器人动作输出拆成了“快动作”和“慢动作”:不是让模型永远用同一个频率生成动作,而是根据任务状态,自适应选择更合适的动作频率。 核心问题:为什么单一频率不够? 主流模仿学习方法,比如 DP、ACT、DP3,通常采用固定频率的动作 …
上海交大学生手册里有一句话,我一直记得很清楚: 做科研最重要的,不是你在做什么,而是你知道正在做的是什么。 看论文也是一样。很多时候我们读完一篇论文,只记得“这篇论文做了什么”,但到了下一篇论文,又重新开始迷路。 这不是因为论文太多,而是因为脑子里还没有技术路线图。 为什么需要技术路线图? 如果没有路线图,看论文就很容 …
研究大模型和多模态模型时,我们经常会用 attention map 来观察 token 之间的依赖关系。很多人会把它当成一种“信息流”分析工具。 但问题是:attention 分数真的能说明模型用了哪些信息吗? 这篇论文的核心观点是:只看 attention 可能不够,应该进一步看 saliency,也就是 …
PI0.5有一个很有意思的地方,他在动作头中,引入了一些随机初始化的token作为Q来和VLM输出进行交叉注意力 论文中把他们称为future token,即让模型想象一下“未来” 但是,这只是作者的声明,为什么就一定是future呢? 这只是融合了当前 VLM 表示,并不自动等价于预测未来状态 并且不会觉得相似吗? …
之前的 VLA 方法大致可以分成几类:有的在 VLM 后面接一个 MLP 动作头,有的接连续扩散头,也有的走传统自回归动作生成路线。 这些方法都能工作,但有一个共同问题:动作生成模块往往被放在主干网络之外。也就是说,感知、语言理解和动作决策并不完全在同一个统一结构中完成。 这会破坏模型的端到端表征连续性和推理统一性。更 …
为什么 Flow Matching 能成为 VLA 的主流方法之一?这篇笔记想用 pi0 的架构,把它背后的直觉讲清楚。 在讲 Flow Matching 之前,需要先回顾一下 diffusion 的思想。 先理解 diffusion:从噪声中还原 扩散模型的完整逻辑由两个过程组成: 正向扩散:不断加噪声,把清晰样本破 …
今天这篇 2025 年 9 月的论文,在 VLA 这个卷到飞起的领域里确实算有点 “老” 了 VLA-Adapter arxiv 编号:2509.09372 但是不妨它还是小模型之王! 它的核心做法,一句话就能讲清:用一套由两个交叉注意力 + 一个自注意力构成的 Bridge Attention 桥接模块,实现了极致轻 …
自从具身大火之后,之前很多做LLM,VLM的人涌进来很多 VLA是建立在VLM的基础上的,早年的VLA很朴素,一般是VLM加个自回归生成的动作头,再用机器人数据微调一下 既然是VLA从VLM发展过来的,那VLM上的method都应该在VLA上能够施展开来 于是,这波论文潮随之而来了 某种意义上,论文数量的涌现效应甚至比 …