跳到正文
@berryxia· @berryxia · X·· 2026-05-13AI 评分62
AI 导读

Jina 发布 jina-embeddings-v5-omni,其首个同时支持文本、图像、音频和视频的统一 Embedding 模型。它提供 Small(1.57B,1024 维,32K 上下文)与 Nano(0.95B,768 维,8K 上下文)两个尺寸,均支持 Matryoshka 截断到 32 维。

正文

兄弟们!Jina 今天直来了个大 的!

Jina-embeddings-v5-omni 来了!

这是他们首个真正支持 text + image + audio + video 的统一 Embedding 模型!(多模态的EMB~!)

两个尺寸:

Small(1.57B,1024维,32K 上下文)

Nano(0.95B,768维,8K 上下文)

还支持 Matryoshka 截断到 32 维,超级灵活。

最爽的是完全向后兼容:你原来的 v5-text 索引不用动,直接换成 omni 就能开始搜图片、音频、视频了!同一向量空间,无需 reindexing。

性能也很猛,小模型就打平甚至超越好几个参数量大几倍的开源模型。

现在已经在 Hugging Face、Jina API、Elastic Inference Service 上架了。

这波多模态 embedding 真的要爽了兄弟们!

你们已经在做多模态 RAG 或者多媒体搜索了吗?😂

引用Jina AI (@JinaAI_)@JinaAI_
jina-embeddings-v5-omni is here! Our first universal embedding model for text, images, audio, and video. Available in two sizes: small (1.57B, 1024-dim, 32K context) and nano (0.95B, 768-dim, 8K context). Both support Matryoshka truncation down to 32 dimensions. v5-omni is back-compatible: if you already use jina-embeddings-v5-text-small/nano, the existing text indexes work with v5-omni out of the box. Without reindexing the text, just index your multimodal content with v5-omni and start searching images, audio, and video. Video
在 X 查看被引用的帖子

来源:@berryxia · x.com