谷歌把"在本地把东西找出来"这件事,做成了一个能装进手机的小模型。它最新推出的EmbeddingGemma2,是自家首个原生多模态的开源嵌入模型,参数规模740M,却能把文字、代码、图片、视频、音频一股脑儿映射进同一个语义空间,让跨模态检索第一次在端侧跑得这么轻。
最直观的卖点是小和能离线。完整的多模态模型内存占用不到600MB,意味着它能在手机、笔记本、浏览器里直接运行,全程不必把任何内容上传到云端——你的相册、录音、视频,都留在自己设备上被检索,隐私这道关天然就守住了。上下文窗口给到8K,是上一代的四倍,能吞下更长的材料再做匹配;语言覆盖也拉到100多种,跨语种找东西不再是障碍。
性能上,谷歌宣称它在图像、视频和代码这几类检索任务上,明显领先同量级的开源对手。更贴心的是模块化设计:用不上的部分可以按需加载,索引体积也能压一压,省下的既是空间也是算力。落到真实场景,它能干的事很具体——在本地相册里按语义翻出某张照片或某段媒体,在长视频里直接定位到某个片段,离线检索散落各处的文件,或者在本地代码库里按意图搜函数与片段,而不必先把仓库推到某个远程服务去查。
当一个多模态嵌入模型小到能揣进手机、又开源到谁都能改,AI检索的重心正在从"把数据交给云端"悄悄挪回"让能力待在设备里"。谷歌这步,给端侧隐私化搜索撕开了一道口子。