在当前的 VLA 工作中,核心 benchmark 大部分选择的都是 LIBERO。通常再紧跟着做一个 LIBERO-Plus,放在实验的最开头作为主要实验部分,接着再放一些 RoboTwin 等其他 benchmark 作为第二组实验。

但是,看着每篇论文都有 98、99.2、100 的漂亮指标,我很疑惑:LIBERO 被刷爆之后,为什么大家还在刷?未来该何去何从?

大家好,我是 33。

是 benchmark 的锅,还是模型的锅?

这个话题的讨论从来就没有停止过。

从 2025-2026 年的发展来看,VLA 模型肯定是越来越成熟的,也有很多优秀的工作涌现,扩展了数据类型、推理方式等等。

在知乎答主梦落花的分享会议上听过一个很有意思的观点(群友冒头):有些 VLA 模型在用很多数据进行大规模训练之后,在这些 benchmark 上的增长并没有这么明显,甚至是衰减。他们举的例子是最近下场的英伟达和 Qwen。不过我觉得这点相对较老的 pi 系列就能说明:在通过大规模预训练之后,LIBERO 的指标没那么光鲜,但在真实世界的表现上得到了一致的好评。

所以,benchmark 的原因可能要占大头。

在标准 LIBERO 设置中,训练分布和测试分布高度接近,很多模型确实可以学到稳定的动作模式。但这并不必然说明模型真正理解了语言指令、物体语义和空间关系。

2025 年有一篇 LIBERO-PRO 做了一个实验:他们把推理的指令替换成 corrupted instruction 或 meaningless tokens,模型的动作输出仍然可能几乎不变,VLA 完全变成了“VA”。同时,改变物体位置,或者切换任务顺序等情况,模型的表现会变得特别差。

这在一定程度上可以说明,模型不是在“理解任务后执行”,而是在特定布局和指令模板下复现高概率轨迹。

对于模型,我觉得也有一部分因素

肉眼可见的一个现象是当前论文的膨胀:arXiv 一星期的论文就能 20+,还没有算上投了没中的工作。高校在卷,企业也开始合作或者下场加速。

当前的 VLA 模型也可以改改模态类型,做排列组合,甚至炒冷饭也可以。毕竟因为 codebase 的指标在那,新方法的指标不大会降。

为什么还在用?

但是,大家还在用的原因,具体到点我觉得无非是这几个。

第一,有很牛的 baseline 模型可以对比。pi0.5、OpenVLA-OFT 等被大家广泛认可的模型指标就在 96.9 左右,但像 StarVLA 作为 codebase 就能到 97-98%。对于新方法来说,只要不是大幅破坏原有 recipe,LIBERO 指标通常不会太难看。换句话说,LIBERO 仍然是一个方便的 sanity check,但它越来越难单独证明一个方法真的带来了本质能力提升。

第二,容易训练。数据集相对小,训练快,重资产的具身组只要有卡,一天就能把实验全部跑完。在 Agent 年代下,迭代速度恐怖。

第三,大家都在用,也都认可,论文能中,为什么不用?

VLA 到底该何去何从?

这部分不该是我能说的,不过这里我还是说下我的想法,欢迎大家攻击。

首先,benchmark 要跟上。据说新的 LIBERO 中了之后可能会放出来给大家刷。检验模型的指标,不能单看成功率,甚至不是加上扰动等泛化指标就够了,更应该关注的是模型真实的学习能力。

模型是否真的学习了、理解了?是否学习并压缩到了物理世界语义?还是只学习了重放轨迹?

更要注意的是模型的真实能力。方向不应该只是加上“XX 思考”或者“XX CoT”,模型更应该关注有没有学习到真正表达压缩的能力。具体比如长时序下的操作,或者是能够实现类似 LLM 一样的长任务操作。最好的期盼是:一次训练,跑所有 benchmark。

不应该只是关注涨了 1 个点,而应该解释这个 1 个点来自哪里:是更好的语言 grounding?更好的空间泛化?更好的历史记忆?更强的失败恢复?还是只是更适配当前 benchmark 的 recipe?

最后

我没有实习过,没有真机经验,只有我的 toy SO-101 机械臂玩。

我个人的表达极其脆弱,正在学习,以上判断可能不完整,欢迎补充和反驳。

本篇有少量 GPT 修改成分。

这篇会同步更新到我的博客:syl.moe5200。

提到的工作

  • LIBERO-PRO:2510.03827
  • PI0.5:2504.16054
  • StarVLA:2604.05014
  • OpenVLA-OFT:2502.19645
  • LIBERO:2306.03310