什么是无似然元学习(Model-Agnostic Meta-Learning)?
无似然元学习(Model-Agnostic Meta-Learning,MAML)是 Chelsea Finn、Pieter Abbeel 与 Sergey Levine 在 2017 年论文《Model-Agnostic Meta-Learning for Fast Adaptation of Deep Networks》中提出的一种元学习算法。它不限定模型结构,只要模型用梯度下降训练即可适用,目标是让模型仅用少量样本和少量梯度步骤就能适应新任务。
无似然元学习(Model-Agnostic Meta-Learning,缩写 MAML)是一种元学习(meta-learning)算法,由 Chelsea Finn、Pieter Abbeel 与 Sergey Levine 在 2017 年的论文《Model-Agnostic Meta-Learning for Fast Adaptation of Deep Networks》中提出。按该论文的表述,它之所以被称为「模型无关」(model-agnostic),是因为它与任何用梯度下降(gradient descent)训练的模型兼容,并且可以用于分类、回归和强化学习等多种不同的学习问题。它要解决的问题是:让模型在一批学习任务上接受训练之后,面对新的学习任务时,只用很少的训练样本就能取得较好的表现。
用论文自己的话说,该方法的做法是显式地训练模型参数,使得「用新任务的少量训练数据做少量梯度步骤」就能在该任务上产生良好的泛化性能;论文把这一效果概括为「训练模型使其易于微调」。
为什么重要
在 MAML 出现之前,要让一个模型适应新任务,通常的做法是在大量数据上预训练,再针对新任务做微调(fine-tuning)。这条路径的痛点在于:微调往往需要新任务上足够多的标注样本和足够多的优化步骤,才能把模型拉到可用的状态。而在少样本(few-shot)场景里,新任务能提供的样本本来就极少,微调的空间被严重压缩。
元学习试图换一个思路:不是只学「怎么解某一个任务」,而是学「怎么快速学会一个任务」。论文把元学习的目标描述为「在一批不同的学习任务上训练模型,使其仅用少量训练样本就能解决新的学习任务」。MAML 的贡献在于给出了一种与模型结构解耦的实现方式——它不要求模型具备特殊的结构,也不要求引入额外的、专门用于元学习的参数化模块,只要模型可以用梯度下降训练,就可以套用这套训练流程。这一点使它的适用范围从监督学习延伸到强化学习等目标形式不同的场景。
论文报告的结果包括:该方法在两个少样本图像分类基准上取得了当时的最优性能(state-of-the-art),在少样本回归上产生了良好结果,并加速了使用神经网络策略的策略梯度(policy gradient)强化学习的微调过程。这些结论出自该论文自身的实验,属于作者报告的结果。
工作机制
MAML 的核心思想可以拆成以下几个要点来理解。
- 任务分布而非单一任务。训练不再针对一个数据集,而是针对一批任务。每个任务自带自己的训练样本(论文语境中常称为支持集)和用于评估的样本。模型要在任务之间共享同一套参数。
- 内层适应:用少量梯度步骤。面对某个具体任务时,从当前参数出发,用该任务的少量训练数据做少量梯度步骤,得到一个针对该任务的临时参数。这一步对应的是「适应」,也是部署时真正会执行的操作。
- 外层优化:让适应后的表现变好。关键不在于临时参数在该任务上表现如何,而在于以「适应之后的表现」作为优化目标,反过来更新初始参数。也就是说,被优化的对象是那个「起点」,评价标准是「从这个起点出发、走少量梯度步骤之后的结果」。
- 模型无关性。上述流程只依赖梯度下降这一件事,不依赖具体的网络结构,因此论文称其与任何用梯度下降训练的模型兼容,并适用于分类、回归与强化学习等不同问题。
- 易于微调。论文把这一训练目标的效果总结为「训练模型使其易于微调」:得到的参数不是某个任务的解,而是一个对多个任务都便于快速调整的起点。
需要说明的是,外层优化涉及对「内层梯度步骤」求导,因此实现上需要计算梯度的梯度。论文在摘要层面只描述了算法目标与适用条件,具体的实现细节与超参数设置应以原文为准。
典型例子
论文中给出的验证场景包括以下几类,均为该论文自身报告的内容:
- 少样本图像分类。论文称该方法在两个少样本图像分类基准上取得了当时的最优性能。
- 少样本回归。论文称该方法在少样本回归任务上产生了良好结果。
- 强化学习中的策略梯度微调。论文称该方法加速了使用神经网络策略的策略梯度强化学习的微调过程。
论文的发表信息为 ICML 2017。作者在论文页面中提供了代码、强化学习结果的视频以及一篇博客文章等外部资源,这些资源的具体地址不在本词条中列出。
边界与常见误解
第一,「模型无关」不等于「任务无关」或「数据无关」。论文所说的模型无关,指的是与任何用梯度下降训练的模型兼容;它并不表示该方法不需要任务分布,也不表示它可以脱离训练任务集合直接使用。恰恰相反,它的训练前提就是存在一批可供元训练的任务。
第二,MAML 不是「零样本」方法。论文的目标设定是「仅用少量训练样本」解决新任务,适应阶段仍然需要新任务的少量数据与少量梯度步骤。把它理解为完全不需要新任务数据,是对论文设定的误读。
第三,论文报告的最优性能与加速效果,是在该论文所选的基准与实验设置下得到的,属于作者报告的结果,不应被推广为在所有任务、所有模型上都成立的普遍结论。这些结论是否复现,取决于具体实现与实验条件。
第四,适用性存在前提。该方法要求模型可以用梯度下降训练,并且要求内层适应确实能通过少量梯度步骤带来改善;对于不适合梯度下降、或任务间差异过大导致共享起点意义有限的情形,论文并未给出适用性保证。
第五,代价方面,论文摘要层面并未展开讨论计算开销,但可以确认的是,该方法的训练过程需要在一批任务上反复执行内层适应步骤,其训练流程比常规的单任务训练更复杂。具体的开销与权衡应以原文及后续工作为准,本词条不作推断。