AB
AiBoss
Wiki

什么是掩码图像建模(Masked Image Modeling)?

掩码图像建模(Masked Image Modeling,MIM)是一种自监督学习技术:遮住图像中的部分信息(像素、图块乃至潜在表示),让模型依据可见部分的上下文预测缺失内容。它通常以自编码器为骨架,可归为重建与对比学习两类实现路径,在区域感知学习上表现突出,但像素级重建目标也带来高层语义不足等问题。

掩码图像建模(Masked Image Modeling,MIM)是一种在计算机视觉中使用的自监督学习技术。按照 arXiv 论文《Masked Image Modeling: A Survey》的表述,MIM 任务的做法是遮住(mask)图像中的部分信息——例如像素、图块(patch),甚至潜在表示(latent representation)——然后训练一个模型(通常是自编码器)利用输入可见部分所提供的上下文去预测缺失的信息。它要解决的问题是:在没有人工标注标签的情况下,如何从大量未标注图像中学习到可迁移的视觉表示。

为什么重要

在 MIM 这类方法被系统研究之前,视觉表示学习对标注数据的依赖较重。为图像分类、检测、分割等任务准备大规模标注成本高昂,而标注本身也容易受主观判断影响。自监督学习试图绕开这一瓶颈,让模型直接从数据自身的结构中构造监督信号。

MIM 提供的正是这样一种「预文本任务」(pretext task):不需要外部标签,遮住一部分输入、让模型把缺失部分补回来,就构成了训练目标。上述综述论文指出,MIM 已经发展成为一种强有力的自监督学习技术。另一篇论文《Towards Latent Masked Image Modeling for Self-Supervised Visual Representation Learning》则称,MIM 是一种有前景的方法,能够从无标签图像数据中导出视觉表示,它在区域感知(region-aware)学习方面表现突出,并能为多种任务提供较强的初始化。

不过该论文同时指出,MIM 也存在明显短板:若不经过进一步的有监督微调,它较难捕捉高层语义,原因很可能在于其像素重建目标本身处于较低层次。这一判断来自该论文作者,而非整个领域的统一结论。

工作机制

按综述论文的归纳,MIM 的核心流程可以拆成几个环节。

  • 遮罩:对输入图像施加掩码,被遮住的对象可以是像素、图块,也可以是潜在表示。遮罩比例、形状与采样方式会直接影响任务难度与学到的表示性质。
  • 编码:模型只看到未被遮住的可见部分,需要把这部分编码成上下文表示。
  • 预测:模型依据可见部分的上下文,推断被遮住位置原本的内容。综述论文把承担这一角色的模型描述为通常是一个自编码器。
  • 目标函数:预测结果与真实缺失信息之间的差异构成损失,用于更新模型参数。

综述论文进一步识别并形式化了实现 MIM 作为预文本任务的两类路径:一类基于重建(reconstruction),另一类基于对比学习(contrastive learning)。在此基础上,论文构建了一套分类体系(taxonomy),并回顾了近年最具代表性的论文;作者还用层次聚类算法生成树状图,通过人工检查该树状图来识别相关聚类。综述还覆盖了 MIM 研究中常用的数据集,并汇总了多种掩码图像建模方法在最流行数据集上的性能结果,以便比较相互竞争的方法,最后指出了研究空白并提出了若干未来工作方向。

另一条路线是潜在空间中的掩码重建,论文《Towards Latent Masked Image Modeling for Self-Supervised Visual Representation Learning》将其称为 Latent MIM。该论文称,这一框架试图把 MIM 的局部性与高层目标结合起来,但训练挑战显著:重建目标是与模型一起被学出来的,可能导致平凡解或次优解。作者称其研究属于首批系统分析与应对该框架挑战的工作之一,通过一系列精心设计的实验与大量分析,定位了这些挑战的来源,包括联合在线/目标优化带来的表示坍缩、学习目标、潜在空间中较高的区域相关性,以及解码条件(decoding conditioning)。在依次处理这些问题之后,作者展示了 Latent MIM 确实能够学到高层表示,同时保留 MIM 模型的优势。

典型例子

素材中出现的具体对象包括以下几项。

  • 综述论文本身:《Masked Image Modeling: A Survey》,作者为 Vlad Hondru、Florinel Alin Croitoru、Shervin Minaee、Radu Tudor Ionescu、Nicu Sebe,被 International Journal of Computer Vision 接收。该文除正文外还附带一个公开仓库,用于整理相关参考文献。
  • Latent MIM 研究:《Towards Latent Masked Image Modeling for Self-Supervised Visual Representation Learning》,作者为 Yibing Wei、Abhinav Gupta、Pedro Morgado,聚焦潜在空间中的掩码重建。
  • 遮罩对象的层次:综述论文明确列举了像素、图块与潜在表示三类可被遮住的信息,这本身也反映了 MIM 方法在「遮什么」上的分化。
  • 数据集与性能汇总:综述论文汇总了 MIM 研究中常用数据集以及多种方法在这些数据集上的性能结果,用于横向比较。

需要说明的是,上述两篇论文均未在素材给出的摘要中列出具体的数值结果、模型规模或版本号,因此这里不作补充。

边界与常见误解

第一,MIM 不等于「任何带遮罩的视觉任务」。综述论文把它界定为一种自监督学习技术,其预文本任务的实现被形式化为重建与对比学习两类;脱离这一框架的遮罩操作未必属于 MIM 的讨论范围。

第二,像素级重建目标并不自动带来高层语义。前述 Latent MIM 论文指出,MIM 在区域感知学习上出色,但若不进一步有监督微调,较难捕捉高层语义,这很可能源于像素重建目标的低层次性质。这是该论文的判断,不应被读作对全部 MIM 方法的定论。

第三,潜在空间重建并非免费的改进。同一论文指出,当重建目标与模型联合学习时,会出现表示坍缩、学习目标设计、潜在空间区域相关性偏高、解码条件等问题,需要逐一处理才可能既学到高层表示又保留 MIM 的优势。

第四,综述论文的定位是梳理与比较。它构建分类体系、汇总性能结果、指出研究空白,这些属于该综述作者的工作成果与观点,不代表领域内已形成统一共识。

第五,MIM 的收益与代价依赖于具体设定。遮罩对象、遮罩比例、预测目标与训练方式的选择都会改变结果,因此不宜把某一篇论文的结论直接外推到其他配置。

参考资料