第 2 版多模态 vs 旧文本 300M
EmbeddingGemma 2 对比旧版 300M 文本模型。
`google/embeddinggemma-300m` 是较早的文本线。`google/embeddinggemma-2` 是多模态后继——规模、8K 上下文与模型卡评测不同。
打开 EmbeddingGemma 2 模型卡Google EmbeddingGemma 2 模型卡写明的差异
模态:EmbeddingGemma 2 原生把文本(含代码)、图像、视频、音频嵌到同一 768 维空间。旧文本线(含 HF `embeddinggemma-300m`)偏文本;Google 第 2 版评测表里 EmbeddingGemma 1 的图/视频/音频栏为空。
规模与模块化:第 2 版共 740M,约 270M 文本骨干,外加可选视觉(170M)与音频(300M)编码器。博客(2026-10-06)称上下文 8K token——描述为 EmbeddingGemma 1 的 4 倍。v2 模型卡写明 MRL 可截断到 128 / 256 / 512 / 768。
模型卡部分数字(768 维、全精度):多语 MTEB v2 Mean(Task) 61.36(v2)对 61.15(v1);代码 MTEB v1 NDCG@10 78.68(v2)对 68.76(v1)。Google 公告亦概括代码大幅提升;我们引用模型卡表格,不编造名次。请务必在自有语料上重测。
该用哪个 id?
- 01
需要多模态 / 第 2 版
用 google/embeddinggemma-2 → /download/
- 02
旧教程里写 300m
多半是 HF 上 EmbeddingGemma 1 文本权重;复制示例前确认模型卡日期。
- 03
搜 GGUF
第 2 版社区包 → /gguf/(非 Google 官方)。
限制
我们未自行重跑 MTEB。营销名「300M」未必与旧模型卡内部拆分完全一致——以你实际加载的 HF 模型页为准。本站独立。来源:EmbeddingGemma 2 模型卡评测表 + Google 博客 2026-10-06,核对于 2026-10-11。
获取 EmbeddingGemma 2 权重
HF 下载与许可说明。