我们于去年推出了 EmbeddingGemma,为高质量文本嵌入提供了一个轻量级选择,帮助你的应用直接在消费级硬件上组织、搜索和关联信息。开发者社区的反响远超我们的预期。凭借超过 2000 万次下载,开发者们用它打造了更智能的端侧搜索工具和隐私优先的检索增强生成(RAG)管道。
今天,我们正式发布 EmbeddingGemma 2,将能力从文本扩展到代码、图像、视频和音频,并将它们统一到共享嵌入空间中。EmbeddingGemma 2 基于 Gemma 4 架构构建,以商业友好的 Apache 2.0 许可证发布,拥有 7.4 亿参数,是实现端侧推理的理想选择。它可以根据语音备忘录找到特定的视频片段,或通过文本查询搜索数小时的音频录音,这一切都由单个原生多模态模型完成处理。
EmbeddingGemma 2 源自与 Gemini Embedding 模型相同的技术,它具有以下特点:
EmbeddingGemma 2 延续了 EmbeddingGemma 强大的多语言文本性能,同时在代码性能上实现了 9.92 分的显著提升(MTEB Code 从 68.76 提升至 78.68),非常适合本地代码库索引、语义代码搜索和编码智能体检索。在图像、视频、文档和音频方面,它为亚 1B 参数模型树立了单位参数质量的新标准,甚至超越了某些体积是其两倍以上的专业模型。
完整评估指标和模型信息请参阅 EmbeddingGemma 2 模型卡。
EmbeddingGemma 2 将强大能力直接带到边缘硬件上。在本地生成嵌入有助于保障数据隐私、降低管道延迟,并让开发者能够构建完全离线运行的跨模态搜索与检索功能。
与 Gemma 4 等生成模型搭配使用时,EmbeddingGemma 2 可实现能够理解复杂多模态数据的端侧 RAG 管道。由于 EmbeddingGemma 2 基于 Gemma 4 构建,并共享其文本分词器和音频编码器,开发者可以在统一管道中同时运行两个模型,且两者合计的内存占用更低。
使用文本或图像,基于语义相似度在媒体库中找到最匹配的内容。可以在 Google AI Edge Gallery 的 Instant Media Search 中体验。
使用文本或音频查询定位视频中的特定时刻。可以在 Google AI Edge Gallery 的 Video Moments Finder 中体验。
将 EmbeddingGemma 2 用于本地文件检索,并搭配 Gemma 4 进行上下文推理。可以在 Google AI Edge Foresight 应用中体验。