Introduction 的目标不是简单介绍背景,而是把读者一步步带到你的研究问题前面。
一篇清楚的 intro,通常需要完成四件事:说明领域重要性、指出现有方法进展、提出核心瓶颈、给出本文解决方案和贡献。
1. 开篇定调:领域背景 + 研究意义
第一段要回答一个问题:为什么这个方向值得研究?
写作时可以从宏观领域突破切入。例如在 VLA 论文中,可以先以多模态 LLM 的进展为背景,说明它如何推动机器人系统和具身智能发展。
这一段通常包括三件事:
- 说明领域背景:例如多模态模型、机器人操作、指令跟随等方向正在快速发展。
- 定义研究对象:明确 VLA(Vision-Language-Action)模型是什么,它解决什么问题。
- 引用代表性工作:用近年的关键文献支撑领域重要性和时效性。
相比 Related Work,Introduction 的背景可以写得更完整一些,因为它承担的是“带读者进入问题”的任务。
2. 深入现状:现有方案 + 核心瓶颈
第二到第三段要做的是:先承认已有方法的进展,再指出它们还没有解决什么。
以 VLA 为例,可以先讲当前方法的通用流程:
- 使用大规模具身数据预训练 VLM。
- 再通过 Policy 网络生成动作。
- 代表性数据集和方法可以包括 Open X-Embodiment、DROID 等。
接着用转折引出瓶颈,例如:
- 依赖大尺度 VLM。
- 训练和微调成本高。
- GPU 显存消耗大。
- 推理吞吐量低。
如果有数据或图表,最好在这里使用。例如用 Figure 1 对比 7B 模型和 0.5B 模型在显存、速度、性能上的差异。这样问题会更具体,而不是停留在“效率低”这种泛泛表述上。
最后,可以用设问句提出核心研究问题:
Can we build a lightweight VLA model that preserves strong performance while reducing training and inference cost?
这个问题最好具有稀缺性,也就是强调它重要但还没有被充分讨论。
3. 给出方案:本文方法概述
当问题已经铺垫清楚之后,就可以引出本文方法。
这一段要简洁回答:为了解决上述问题,本文提出了什么?
例如写 VLA-Adapter 时,可以明确说明它是一个新的桥接范式,通过轻量级 Bridge Attention 模块,把视觉-语言条件更有效地注入动作空间。
方法概述可以按这个顺序写:
- 方法名称与定位:直接点出方法是什么。
- 核心机制:说明它如何解决前文提出的问题。
- 主要优势:用简短指标或关键词强调价值,例如 tiny-scale backbone、high performance、fast inference speed。
这一段不需要展开全部技术细节,只要让读者知道:本文的方法正好对应前面的瓶颈。
4. 总结价值:主要贡献
最后一段通常用于总结贡献。贡献不要写成空泛口号,而要对应论文真正的增量。
比较清楚的贡献可以分成 3-4 点:
- 方法创新:例如首次系统分析不同视觉-语言条件对动作生成的影响。
- 机制设计:例如提出新的 Bridge Attention 模块,降低对大模型的依赖。
- 实验验证:例如在模拟和真实场景中取得高成功率和低成本。
- 实际价值:例如显著降低训练和推理开销,提高部署可行性。
每个贡献最好聚焦一个维度,不要把多个点混在一句话里。
小结
Introduction 的核心逻辑可以概括为:
领域重要 → 现有进展 → 核心瓶颈 → 本文问题 → 本文方法 → 本文贡献
只要这条线是顺的,读者就会自然理解:为什么这篇论文有必要存在,以及它到底填补了哪个空白。

评论
由 GitHub Discussions 提供,首次加载可能需要一点时间。