WAM和VLA,本质上都是在预测“状态”
PI0.5有一个很有意思的地方,他在动作头中,引入了一些随机初始化的token作为Q来和VLM输出进行交叉注意力 论文中把他们称为future token,即让模型想象一下“未来” 但是,这只是作者的声明,为什么就一定是future呢? 这只是融合了当前 VLM 表示,并不自动等价于预测未来状态 并且不会觉得相似吗? …
PI0.5有一个很有意思的地方,他在动作头中,引入了一些随机初始化的token作为Q来和VLM输出进行交叉注意力 论文中把他们称为future token,即让模型想象一下“未来” 但是,这只是作者的声明,为什么就一定是future呢? 这只是融合了当前 VLM 表示,并不自动等价于预测未来状态 并且不会觉得相似吗? …
这个栏目用于整理 VLA / WAM 相关资料,包括多模态理解、动作生成、机器人控制和系统集成。