谷歌正式推出 EmbeddingGemma 2,这是目前最强大的设备端多模态嵌入模型。该模型基于 Gemma 4 架构构建,采用 Apache 2.0 许可证开源,拥有 7.4 亿参数,能够将文本、代码、图像、音频和视频原生映射到统一的嵌入空间中。

去年发布的初代 EmbeddingGemma 专注于文本嵌入,下载量已超 2000 万次。新一代模型在保持轻量级的同时,将能力扩展至全模态,适用于驱动注重隐私的设备端搜索工具和检索增强生成(RAG)管道。

核心特性与技术优势

EmbeddingGemma 2 沿用与 Gemini 嵌入模型相同的技术栈,具备以下关键优势:

  • 同规模性能领先:在 MTEB Code 和 MAEB 等基准测试中,其表现优于其他 10 亿参数以下的多模态嵌入模型,并在多项任务中匹配或超越更大规模的模型。
  • 模块化架构:纯文本处理仅需 2.7 亿参数;可选配视觉(1.7 亿参数)和音频(3 亿参数)编码器以启用完整多模态功能。
  • 高效存储:引入马特里约什卡表示学习(MRL),支持将输出向量动态截断至 128、256 或 512 维度,相比原始 768 维度,最多可减少 6 倍的存储空间和内存占用。
  • 极致的端侧优化:经量化处理后,在 Google Pixel 11 Pro 上,纯文本模式活跃 RAM 占用仅约 191MB,全多模态模式约 567MB。
  • 扩展上下文:上下文窗口扩大至 8K token(较前代提升 4 倍),支持本地处理长达 5.5 分钟的音频、29 张图像或 58 个视频帧及其交错组合。

多模态性能突破

在多语言文本性能保持稳定的基础上,EmbeddingGemma 2 的代码处理能力显著增强,MTEB Code 得分从 68.76 提升至 78.68,适用于本地代码库索引和语义代码搜索。在视觉和音频领域,该模型树立了 10 亿参数以下模型的“每参数质量”新标杆,性能甚至超越部分两倍体积的专用模型。

赋能端侧语义搜索与 RAG

EmbeddingGemma 2 专为边缘硬件设计,支持完全离线的跨模态搜索和检索,确保数据隐私并降低延迟。由于与 Gemma 4 共享文本标记器和音频编码器,两者可协同运行于统一管道中,进一步降低内存开销,实现复杂的设备端 RAG 应用。

典型应用场景包括:基于语义相似度的媒体库检索、视频特定时刻定位、以及结合 Gemma 4 进行上下文推理的本地文件检索。此外,开发者可通过 MediaPipe Decision Task API 构建实时决策引擎。

生态支持与部署

目前,开发者可通过 Hugging Face 和 Kaggle 下载模型权重,Gemini Enterprise Agent Platform Model Garden 也将随后上线。针对设备端优化的模型可在 Hugging Face 的 LiteRT Community 获取。

在部署方面,支持使用 Google AI Edge MediaPipe 开发跨平台应用,或通过 LiteRT、transformers.js 及 WebGPU 集成至浏览器端。主流开发工具如 transformers、sentence-transformers、MLX、vLLM、llama.cpp、SGLang、Ollama 和 LMStudio 均已提供支持,向量存储可对接 Qdrant。如需自定义用例,可参考 Unsloth 提供的微调指南。