↑

Google|EmbeddingGemma 2开源多模态嵌入模型

PromptTree|阅读 0
2026/10/07 09:41
GoogleEmbeddingGemma 2多模态嵌入端侧AIGemma
Google于10月6日发布EmbeddingGemma 2:基于Gemma 4、约7.4亿参数的原生多模态嵌入模型,统一映射文本、代码、图像、音频与视频,Apache 2.0许可,面向端侧检索与RAG。

检索层如果只能吃文本,Agent在本地媒体库里永远像「睁眼瞎」。

10月6日,Google DeepMind发布EmbeddingGemma 2。前代EmbeddingGemma主打轻量文本嵌入,下载量已超两千万;新版扩展到代码、图像、视频与音频共享嵌入空间。模型基于Gemma 4架构,完整多模态约7.4亿参数,Apache 2.0许可;模块化设计允许文本/代码场景仅加载约2.7亿参数,再按需加视觉(约1.7亿)与音频(约3亿)编码器。

性能与效率: 官方称在同尺寸sub-1B多模态嵌入中领先,MTEB Code得分由约68.76升至约78.68;并在文本、视觉、音频任务上匹敌或超过更大模型。采用Matryoshka表示学习,可将768维向量截断至512/256/128维,本地向量库存储可降约6倍。量化后,在Pixel 11 Pro上文本权重活跃内存约191MB,完整多模态约567MB。上下文扩至8K token,约可处理5.5分钟音频、29张图或58帧视频及交错组合。

落地: 权重已上Hugging Face与Kaggle;可与MediaPipe、LiteRT、sentence-transformers、vLLM、Ollama等工具链配合,构建完全离线的跨模态搜索与端侧RAG。与Gemma 4共享分词器与音频编码器,可降低联合部署内存。这补齐了「生成模型热、嵌入模型仍偏文本」的缺口。

事实以Google官方博客为准。