谷歌发布 EmbeddingGemma 2:740M 参数统一文本图像音频视频 embedding,Apache 2.0 开源、手机可跑
Google 美东时间 10 月 6 日发布 EmbeddingGemma 2:740M 参数的多模态 embedding 开源模型,Apache 2.0 协议,权重已上线 Hugging Face 和 Kaggle。它把文字、代码、图片、音频、视频统一塞进同一个向量空间:纯文本版只占约 191MB 内存,完整多模态版约 567MB,8K token 上下文是上一代的 4 倍,原生支持 LiteRT、MediaPipe、LangChain 和 llama_index。

事件经过
Google 官方博客美东时间 10 月 6 日宣布 EmbeddingGemma 2,@GoogleDeepMind 官方 X 账号在中午约 12:15 同步发布。这是一个为端侧设备(手机、笔记本)打造的多模态 embedding 模型,构建在 Gemma 4 架构上。设计上是模块化的:用不上的视觉或音频组件可以裁掉,以节省端侧设备的内存。
它成为 r/LocalLLaMA 当天最热的帖子之一(42 赞、8 评论),发布一小时内就有人发帖展示在浏览器 WebGPU 里本地运行。
关键事实
- 740M 参数 + Apache 2.0:协议是 Apache 2.0,不是 Gemma 系列以往带附加条款的社区许可,可商用、修改和分发。上一代 EmbeddingGemma 一年下载超 2000 万次,此次多模态版同样以 Apache 2.0 发布。
- 主要数据:MTEB Code 涨 9.92 分(68.76 → 78.68);8K token 上下文是上一代的 4 倍;Matryoshka 表示学习把向量存储压到原来的六分之一;一次前向能处理 5.5 分钟音频、29 张图片或 58 帧视频;纯文本版约 191MB 内存,完整多模态版约 567MB。
- “同尺寸最强”的比较范围:官方表述是 best-in-class for its size:在 740M 这个体量里最强,能胜过部分两倍大的模型。比较范围不包括谷歌自家云端的 Gemini Embedding 2。谷歌的分工是:端侧、离线场景用 EmbeddingGemma,大规模服务端用 Gemini Embedding API。
- 一个模型替代多套管线:以前做跨模态搜索,文本、图片、音频、视频各用一套 embedding 模型、各自建索引,再写代码合并结果。现在是一个模型、一次调用、一个向量空间。
背景
第一代 EmbeddingGemma 在 2025 年 9 月发布,主打端侧文本 embedding,一年下载 2000 万次,被用于本地 RAG。Embedding 模型不生成、不对话,负责把内容转成向量用于理解和检索;在 agent 和 RAG 管线里,embedding 质量影响检索效果。此次谷歌把多模态 embedding 能力放到了端侧设备上。
为什么重要
上一代一年下载超 2000 万次;新版把文字、代码、图片、音频、视频放进同一向量空间,按 Apache 2.0 发布,纯文本版约 191MB 内存。
相关公司谷歌
评论
今天
10月12日 星期一- 早报GSK 扩大与 Chai 合作:AI 设计通过湿实验室验证
共 9 条 · 10月11日
- 三问
- 预测
