谷歌正式发布开源模型 EmbeddingGemma 2。这款拥有 7.4 亿参数的多模态嵌入模型,能够将文本、代码、图像、音频和视频映射至统一的向量空间,并支持在手机或小型开发板上完全离线运行。

端侧运行与资源占用

EmbeddingGemma 2 采用 Apache 2.0 许可证。其核心优势在于极低的资源占用:在 Pixel 9 Pro 上,仅处理文本任务约需 191MB 内存,若同时处理全部五种模态则需约 567MB。此外,该模型也可在价值 80 美元的树莓派等低功耗设备上运行。

通过将数据保留在设备本地,EmbeddingGemma 2 构建了一个完全不依赖网络的检索流程,避免了敏感数据上传云端,从而回应了欧洲等地对数据隐私保护的关切。

技术架构与性能提升

据谷歌介绍,该模型将所有内容映射到 768 维空间中。其 7.4 亿参数中,文本处理占 2.7 亿,视觉编码器占 1.7 亿,音频编码器占 3 亿。这些编码器仅在需要时加载,且因基于 Gemma 4 架构并共享文本分词器和音频编码器,整体内存占用更低。

相比初代版本,EmbeddingGemma 2 在每个模态下支持的上下文窗口达到 8192 个令牌,提升四倍,相当于可处理 29 张图像、58 帧视频或 5.5 分钟的音频。同时,向量维度可从 768 维压缩至 128 维,存储需求最多降低六倍。

局限性与生态背景

谷歌坦言,该模型未经过安全微调或输出审核,相关缓解措施仅应用于训练数据阶段;尽管支持超过 100 种语言,但各语言间的性能表现并不均衡。

目前,Gemma 系列模型累计下载量已突破十亿次,其中首个 EmbeddingGemma 贡献了 2000 万次下载。分析认为,谷歌此举旨在通过开放权重和端侧能力,确立行业默认标准,让欧洲等企业能在自有硬件上使用通用许可证模型,尽管其研发源头仍位于山景城。