Introduction 的目标不是简单介绍背景,而是把读者一步步带到你的研究问题前面。

一篇清楚的 intro,通常需要完成四件事:说明领域重要性、指出现有方法进展、提出核心瓶颈、给出本文解决方案和贡献。

1. 开篇定调:领域背景 + 研究意义

第一段要回答一个问题:为什么这个方向值得研究?

写作时可以从宏观领域突破切入。例如在 VLA 论文中,可以先以多模态 LLM 的进展为背景,说明它如何推动机器人系统和具身智能发展。

这一段通常包括三件事:

  1. 说明领域背景:例如多模态模型、机器人操作、指令跟随等方向正在快速发展。
  2. 定义研究对象:明确 VLA(Vision-Language-Action)模型是什么,它解决什么问题。
  3. 引用代表性工作:用近年的关键文献支撑领域重要性和时效性。

相比 Related Work,Introduction 的背景可以写得更完整一些,因为它承担的是“带读者进入问题”的任务。

2. 深入现状:现有方案 + 核心瓶颈

第二到第三段要做的是:先承认已有方法的进展,再指出它们还没有解决什么。

以 VLA 为例,可以先讲当前方法的通用流程:

  • 使用大规模具身数据预训练 VLM。
  • 再通过 Policy 网络生成动作。
  • 代表性数据集和方法可以包括 Open X-Embodiment、DROID 等。

接着用转折引出瓶颈,例如:

  • 依赖大尺度 VLM。
  • 训练和微调成本高。
  • GPU 显存消耗大。
  • 推理吞吐量低。

如果有数据或图表,最好在这里使用。例如用 Figure 1 对比 7B 模型和 0.5B 模型在显存、速度、性能上的差异。这样问题会更具体,而不是停留在“效率低”这种泛泛表述上。

最后,可以用设问句提出核心研究问题:

Can we build a lightweight VLA model that preserves strong performance while reducing training and inference cost?

这个问题最好具有稀缺性,也就是强调它重要但还没有被充分讨论。

3. 给出方案:本文方法概述

当问题已经铺垫清楚之后,就可以引出本文方法。

这一段要简洁回答:为了解决上述问题,本文提出了什么?

例如写 VLA-Adapter 时,可以明确说明它是一个新的桥接范式,通过轻量级 Bridge Attention 模块,把视觉-语言条件更有效地注入动作空间。

方法概述可以按这个顺序写:

  1. 方法名称与定位:直接点出方法是什么。
  2. 核心机制:说明它如何解决前文提出的问题。
  3. 主要优势:用简短指标或关键词强调价值,例如 tiny-scale backbone、high performance、fast inference speed。

这一段不需要展开全部技术细节,只要让读者知道:本文的方法正好对应前面的瓶颈。

4. 总结价值:主要贡献

最后一段通常用于总结贡献。贡献不要写成空泛口号,而要对应论文真正的增量。

比较清楚的贡献可以分成 3-4 点:

  • 方法创新:例如首次系统分析不同视觉-语言条件对动作生成的影响。
  • 机制设计:例如提出新的 Bridge Attention 模块,降低对大模型的依赖。
  • 实验验证:例如在模拟和真实场景中取得高成功率和低成本。
  • 实际价值:例如显著降低训练和推理开销,提高部署可行性。

每个贡献最好聚焦一个维度,不要把多个点混在一句话里。

小结

Introduction 的核心逻辑可以概括为:

领域重要 → 现有进展 → 核心瓶颈 → 本文问题 → 本文方法 → 本文贡献

只要这条线是顺的,读者就会自然理解:为什么这篇论文有必要存在,以及它到底填补了哪个空白。