<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>Benchmark on 33</title>
    <link>https://syl.moe5200.com/tags/benchmark/</link>
    <description>Recent content in Benchmark on 33</description>
    <generator>Hugo</generator>
    <language>zh-cn</language>
    <copyright>2026 33</copyright>
    <lastBuildDate>Wed, 08 Jul 2026 00:00:00 +0000</lastBuildDate>
    <atom:link href="https://syl.moe5200.com/tags/benchmark/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>LIBERO 被刷爆之后，VLA 还应该刷什么？</title>
      <link>https://syl.moe5200.com/posts/vla-wam/libero-after-saturation/</link>
      <pubDate>Wed, 08 Jul 2026 00:00:00 +0000</pubDate>
      <guid>https://syl.moe5200.com/posts/vla-wam/libero-after-saturation/</guid>
      <description>&lt;p&gt;在当前的 VLA 工作中，核心 benchmark 大部分选择的都是 LIBERO。通常再紧跟着做一个 LIBERO-Plus，放在实验的最开头作为主要实验部分，接着再放一些 RoboTwin 等其他 benchmark 作为第二组实验。&lt;/p&gt;
&lt;p&gt;但是，看着每篇论文都有 98、99.2、100 的漂亮指标，我很疑惑：LIBERO 被刷爆之后，为什么大家还在刷？未来该何去何从？&lt;/p&gt;
&lt;p&gt;大家好，我是 33。&lt;/p&gt;
&lt;h2 id=&#34;是-benchmark-的锅还是模型的锅&#34;&gt;是 benchmark 的锅，还是模型的锅？&lt;/h2&gt;
&lt;p&gt;这个话题的讨论从来就没有停止过。&lt;/p&gt;
&lt;p&gt;从 2025-2026 年的发展来看，VLA 模型肯定是越来越成熟的，也有很多优秀的工作涌现，扩展了数据类型、推理方式等等。&lt;/p&gt;
&lt;p&gt;在知乎答主梦落花的分享会议上听过一个很有意思的观点（群友冒头）：有些 VLA 模型在用很多数据进行大规模训练之后，在这些 benchmark 上的增长并没有这么明显，甚至是衰减。他们举的例子是最近下场的英伟达和 Qwen。不过我觉得这点相对较老的 pi 系列就能说明：在通过大规模预训练之后，LIBERO 的指标没那么光鲜，但在真实世界的表现上得到了一致的好评。&lt;/p&gt;
&lt;p&gt;所以，benchmark 的原因可能要占大头。&lt;/p&gt;
&lt;p&gt;在标准 LIBERO 设置中，训练分布和测试分布高度接近，很多模型确实可以学到稳定的动作模式。但这并不必然说明模型真正理解了语言指令、物体语义和空间关系。&lt;/p&gt;
&lt;p&gt;2025 年有一篇 LIBERO-PRO 做了一个实验：他们把推理的指令替换成 corrupted instruction 或 meaningless tokens，模型的动作输出仍然可能几乎不变，VLA 完全变成了“VA”。同时，改变物体位置，或者切换任务顺序等情况，模型的表现会变得特别差。&lt;/p&gt;
&lt;p&gt;这在一定程度上可以说明，模型不是在“理解任务后执行”，而是在特定布局和指令模板下复现高概率轨迹。&lt;/p&gt;
&lt;h2 id=&#34;对于模型我觉得也有一部分因素&#34;&gt;对于模型，我觉得也有一部分因素&lt;/h2&gt;
&lt;p&gt;肉眼可见的一个现象是当前论文的膨胀：arXiv 一星期的论文就能 20+，还没有算上投了没中的工作。高校在卷，企业也开始合作或者下场加速。&lt;/p&gt;
&lt;p&gt;当前的 VLA 模型也可以改改模态类型，做排列组合，甚至炒冷饭也可以。毕竟因为 codebase 的指标在那，新方法的指标不大会降。&lt;/p&gt;
&lt;h2 id=&#34;为什么还在用&#34;&gt;为什么还在用？&lt;/h2&gt;
&lt;p&gt;但是，大家还在用的原因，具体到点我觉得无非是这几个。&lt;/p&gt;
&lt;p&gt;第一，有很牛的 baseline 模型可以对比。pi0.5、OpenVLA-OFT 等被大家广泛认可的模型指标就在 96.9 左右，但像 StarVLA 作为 codebase 就能到 97-98%。对于新方法来说，只要不是大幅破坏原有 recipe，LIBERO 指标通常不会太难看。换句话说，LIBERO 仍然是一个方便的 sanity check，但它越来越难单独证明一个方法真的带来了本质能力提升。&lt;/p&gt;</description>
    </item>
  </channel>
</rss>
