谷歌推出EmbeddingGemma 2多模态嵌入模型
谷歌发布EmbeddingGemma 2,将文本嵌入能力扩展至代码、图像、视频和音频,基于Gemma 4架构,采用Apache 2.0许可,总参数7.4亿,支持模块化多模态组件、向量维度截断与端侧量化运行。
驱动中国10月7日消息,谷歌推出EmbeddingGemma 2,将此前面向文本的嵌入能力扩展到代码、图像、视频和音频,并把上述内容统一映射到同一个嵌入空间。
此前,谷歌推出EmbeddingGemma,为开发者提供轻量文本嵌入方案,下载量超过2000万次,主要用于端侧搜索工具和隐私优先检索增强生成(RAG)管线。EmbeddingGemma 2在此基础上扩展多模态能力。
EmbeddingGemma 2基于Gemma 4架构开发,采用Apache 2.0许可发布,总参数为7.4亿,面向端侧推理场景。该模型基于Gemini嵌入模型同源技术打造,在子1B参数多模态嵌入模型中,于MTEB Code、MAEB等基准测试取得领先分数,性能接近或超过部分更大尺寸模型。
该模型采用模块化设计,纯文本任务仅需2.7亿参数,可按需添加1.7亿参数的视觉编码器和3亿参数的音频编码器,实现完整多模态支持。借助Matryoshka表示学习(MRL),开发者可将输出向量从768维动态截断至512、256或128维,本地向量数据库存储和内存占用可缩减6倍。
端侧运行方面,EmbeddingGemma 2量化后在谷歌Pixel 11 Pro上,纯文本权重约需191MB运行内存,完整多模态模型约需567MB。模型配备8K Token上下文窗口,比初代EmbeddingGemma大4倍,可在本地硬件直接处理5.5分钟音频、29张图像、58个视频帧,或上述内容的交错组合。
性能表现上,EmbeddingGemma 2保留前代多语言文本性能,代码性能提升9.92分,在MTEB Code测试中从68.76提升至78.68,可用于本地代码库索引、语义代码搜索和编程代理检索。在图像、视频、文档和音频任务中,该模型在子1B参数模型中提升单位参数质量表现,并超过部分尺寸为其两倍的专业模型。