多模态预算(来自模型卡)

各模态共用 8,192 token 窗口。模型卡默认:每张图约 280 token,每视频帧约 140,音频约每秒 25 token(单声道 16 kHz)。视频默认约 1 FPS 过视觉编码器。交错示例:文本里放 `<|image|>` / `<|video|>` / `<|audio|>`,由并行列表填充。用 `config_kwargs` 关掉不用的编码器以省内存(纯文本 vs 完整 740M)。

相对偏文本的 EmbeddingGemma 1,第 2 版增加原生多模态评测(模型卡上的 MIEB、MMEB、MSEB/MAEB)。「当前最好的嵌入模型」取决于你的模态组合、延迟,以及要开源端侧权重还是托管 API——请在自有语料上重测。

权重与 SentenceTransformers 见 /huggingface/ 与 /download/。旧文本版 EmbeddingGemma(300M)与本多模态版对比见 /vs-300m/。核对于 2026-10-11。

限制

截到 128 维时多模态质量下降比纯文本更明显。混合模态会挤占各自可用长度。本站不跑演示;可试 AI Edge 博客链接的 Gallery / Foresight。

回到总览

EmbeddingGemma 2 首页笔记。