Google 今日正式发布开源多模态嵌入模型 EmbeddingGemma 2。该模型体积小巧,专为在智能手机等端侧设备上运行而设计,标志着 EmbeddingGemma 系列从纯文本处理正式扩展至多模态领域。

与此前仅支持文本的首个版本不同,新版模型让图像、音频和视频与文本共享同一嵌入空间。这意味着基于该模型构建的应用可直接在手机上处理语音备忘录,并精准定位视频中的对应时刻,无需云端交互。

架构升级与端侧优化

EmbeddingGemma 2 基于今年 4 月发布的 Gemma 4 架构构建,总参数量达 7.4 亿,是原版的两倍有余。新增参数主要服务于视觉和音频编码器,纯文本应用可省略这部分模块。在 Google Pixel 11 Pro 上的测试显示,仅含 2.7 亿参数的文本核心模块量化后仅占用约 191 MB 内存。

为解决本地存储压力,模型引入了“套娃表示学习”(Matryoshka Representation Learning)技术。开发者可将包含 768 个数字的嵌入向量缩减至最少 128 个,使存储空间减少多达六倍。官方指南指出,即便维度降至 256,图像、视频和语音的检索质量仍能保持全量水平的 95% 左右。

代码检索能力显著跃升

基准测试显示,EmbeddingGemma 2 在大规模文本嵌入基准测试(MTEB)的代码部分得分高达 78.68,较第一版提升近 10 分,多语言文本得分则保持稳定。Google 建议编程代理开发者利用这一优势构建检索功能。公司声称,在参数量低于 10 亿的多模态嵌入模型中,该模型处于领先地位,其在视听任务上的表现甚至优于部分规模两倍的专用模型。

得益于与 Gemma 4 共享文本分词器和音频编码器,同时运行这两个模型的端侧检索增强生成(RAG)系统,其内存占用低于两个独立模型之和。目前,Google 面向 Mac 的 AI Edge Foresight 会议应用已实现双模型并行运行,其 AI Edge Gallery 演示应用中的“视频时刻查找器”功能也展示了通过文字或语音查询定位视频场景的能力。

EmbeddingGemma 2 模型权重现已通过 Hugging Face 和 Kaggle 平台开放下载,采用允许商业使用的 Apache 2.0 许可证,并兼容 vLLM、llama.cpp 和 Ollama 等主流开源推理工具。Google 表示,该模型即将上线 Gemini Enterprise Agent Platform 的 Model Garden。