Google 开源 EmbeddingGemma 2,是其首个原生多模态开放嵌入模型,740M 参数可处理文本、代码、图像、视频和音频,权重已上架 Hugging Face。
作者分析了这个嵌入模型的本地运行方式和模态统一检索能力,也指出纯文本检索几乎没进步,读者可以据此判断适用场景。
Google 昨天开源的 EmbeddingGemma 2,把搜索这一层直接搬进了浏览器,大多数人会因为它不会聊天直接划走,但它可能比下一个大模型更能改你的工作流。
文字、图片、视频、音频都在本机算,不要服务器,不要 API key,
Hugging Face 的 Victor 说浏览器 WebGPU 上单次查询大约 20 到 70 毫秒,数据留在你自己的电脑里。
它不是聊天模型,不会写文案,
它只干一件事:把一段内容变成一串坐标,意思接近的东西挨得近,
搜索、RAG、去重,底层全靠这个。
以前跨模态搜索是裂开的,
图片先转成文字,语音先转成文字,再拿文本模型去算,
每转一次就丢一层信息,多一段延迟,多一次把数据送出门。
现在五种内容进同一个 768 维空间,
一段语音备忘录可以直接对上某段视频画面,不用先转写。
而且它是拆着装的,只要文字 270M,加图片 440M,全上才 740M,
向量还能从 768 维截到 256 维,一百万条从将近 3GB 缩到三分之一,质量只掉 1 到 2%。
最狠的是它走 Apache 2.0,能微调,能塞进自己的产品,
检索这一层的成本被打到接近零,
对卖 embedding API 的人是威胁,对做本地工具的人是零件。
但也别神化,纯文本检索几乎没进步,MTEB 61.36 对上一代 61.15,
它赢的是模态和体积,视频也还是抽帧。
下周大家还会去追会说话的模型,
真正改个人工作流的,往往是这种不会说话、只负责让你找得到东西的小模型。
铁汁们最想先让哪一堆东西变得能搜,相册、会议录音,还是收藏夹呢 https://x.com/victormustar/status/2107521244870615416/video/1
Introducing EmbeddingGemma 2, a new open multimodal model that sets the standard for on-device efficiency. - our first open, natively multimodal embedding model - handles text, code, image, video, and audio tasks within a lightweight, modular 740M parameter form factor - ideal for offline, privacy-first RAG when paired with Gemma 4 - outperforms some specialist models more than twice its size Weights available now on Hugging Face.在 X 查看被引用的帖子
来源:AYi · x.com