NASA与IBM发布开源月球基础模型,整合17年轨道器观测数据
NASA与IBM Research联合多家学术机构发布NASA-IBM月球基础模型,称其为最早的开源月球科学基础模型之一,训练语料整合17年月球勘测轨道器观测数据,在极区冰沉积预测与撞击坑检测上表现突出。
NASA与IBM Research联合多家学术机构发布了NASA-IBM月球基础模型(NASA-IBM Lunar Foundation Model),双方称其为最早面向月球科学的开源基础模型之一。该模型基于多模态地球观测模型TerraMind,但研究团队是从零开始训练,而非在其基础上微调。模型已在Hugging Face公开,代码托管于GitHub,并集成进开源工具包TerraTorch;团队同时释出可直接用于机器学习的预训练数据集与基准集合。
据NASA介绍,训练语料SomBench被称为迄今规模最大的共配准多模态月球数据集,包含近200万个瓦片包、11种模态与两个空间尺度:约100万张高分辨率图像来自窄角相机(NAC,约1米/像素),近96.4万张多光谱图像来自广角相机(100米/像素)。数据主体来自月球勘测轨道器(LRO)17年的观测,NASA称其数据量超过其他所有NASA行星任务之和;此外还纳入GRAIL重力场、Lunar Prospector氢元素以及日本JAXA的Kaguya/SELENE矿物学数据,合计汇集9台仪器、4项任务的30多个空间对齐数据层。为避免训练、验证与测试数据泄漏,语料按地图分区而非随机分配瓦片进行切分。模型把成像几何(光照角度、太阳位置、瓦片范围)作为显式上下文输入,并将图像、高程与几何信息切分为token,通过预测被遮蔽部分学习其间关系。
据IBM称,在极区冰沉积预测任务上,该模型相较最佳基线SwinV2-B将预测误差最多降低22%;在粗尺度撞击坑检测上以仅一半训练数据领先SwinV2-B近19%。不过研究也显示,模型不适用于绝对大地定位,生成测试中经纬度有时偏差达数十度,高程结构的绝对高度值也可能发生偏移;作者将其定位为可复用的下游任务基础,而非物理测量仪器的替代品。隔离各项创新贡献的对照实验尚待开展,部分测试数据集规模较小。该模型属于NASA与IBM“AI for Science”合作,双方自2022年初起依据《太空法案协议》推进基础模型工作。具体功能、数据与使用条件请以官方页面当前信息为准。