AB
AiBoss
ニュース

Google DeepMind 发布 EmbeddingGemma 2:740M 开源多模态嵌入模型

Google DeepMind 发布 EmbeddingGemma 2,一个 740M 参数的开源多模态嵌入模型,可将文本、代码、图像、视频与音频映射到同一 768 维向量空间,采用 Apache 2.0 许可,权重已在 Hugging Face 与 Kaggle 上线。

核心事实

据 MarkTechPost 报道,Google DeepMind 发布了 EmbeddingGemma 2,一个 740M 参数的开源多模态嵌入模型,可将文本、代码、图像、视频和音频嵌入到同一个 768 维向量空间。该模型基于 Gemma 4 架构,上下文窗口为 8,192 token,采用 Apache 2.0 许可。报道称权重已在 Hugging Face 和 Kaggle 上线,并提供 Ollama、llama.cpp GGUF 与 LiteRT 构建版本。

模型采用模块化设计:文本与代码主干 270M 参数,视觉编码器 170M 参数(可选),音频编码器 300M 参数(可选)。开发者可按需加载,从纯文本的 270M 到全模态的 740M,各配置共享同一向量空间。

背景与影响

嵌入模型把内容转换为捕捉语义的数值向量,在 RAG 流程中帮助大模型检索训练数据之外的信息。本地生成嵌入可让数据留在设备上、降低延迟并支持离线使用。报道称该模型面向端侧搜索、分类和隐私优先的 RAG 场景。

据 Google 研究团队报告,该模型在 MTEB Code 与 MAEB 等基准上取得 10 亿参数以下多模态嵌入模型中的领先成绩。报道给出的全精度 768 维结果包括:MTEB Code v1 为 78.68(上一代为 68.76),MTEB 多语言 v2 为 61.36,MIEB lite(图像)为 64.64,MMEB v2 总体为 59.01。报道同时提到,参数规模更大的模型仍在部分榜单上领先。

限制与来源

上述基准数据、内存占用与延迟数字均来自 Google 研究团队与 Google AI Edge 团队的测量,尚未经独立第三方验证。报道称在 Pixel 11 Pro 上量化后,纯文本权重活跃内存约 191MB,全模态约 567MB;在 MacBook M5 Pro GPU 上每张图像约 37.3ms。这些结果依赖具体硬件、量化方式与配置,实际表现可能不同。

模型支持 Matryoshka 表示学习,可将向量截断至 512、256 或 128 维;报道称 128 维主要用于纯文本任务。可用框架、平台支持、许可条款与地区可用性请以 Google 官方模型页与 Hugging Face 模型卡当前信息为准。本文信息来自 MarkTechPost 报道,未获 Google 官方直接确认。