跳到正文
@AYi_AInotes· @AYi_AInotes · X·· 2026-08-27AI 评分62
AI 导读

作者基于微信开源的 WeMM-Embedding 多模态模型,列出三个自己最想落地的场景:智能相册与知识库语义搜索、给 Agent 装视觉长记忆、视频与电商内容低成本打标推荐。他提到 2B 模型加 256 维截断用一张消费级显卡就能跑,256 维保住近 99% 的性能,向量库存储成本明显下降。代码一行 SentenceTransformers.encode 即可运行。

正文

前一条分享了微信开源的这个多模态模型,
好多兄弟问这模型到底能干嘛,
说三个我最想拿它干的场景,
每一个都是以前想做但做不成的,

说实话:凡是以前因为数据太杂、向量库太贵而做不起混合搜索的地方,现在都可以低成本重做一遍了

1️⃣ 智能相册与知识库语义搜索(解决“搜个寂寞”):
以前搜“去年在海边吃烧烤的视频”,
要么手动给几千张图打标,
要么文字归文字图片归图片,根本搜不出来

现在直接用一句话搜,对应的图和视频切片秒级定位
2B 模型加 256 维截断,一张消费级显卡就能跑,个人相册、团队素材库直接起飞

2️⃣ 给 Agent 装上视觉长记忆(这个是我最兴奋的):
现在的 Coding Agent 和桌面助手最大的痛点是关了窗口就忘,看过的截图、报错日志、UI 稿下次还得重新喂

用 WeMM 把这些视觉资产全部向量化,
Agent 需要时直接按语义精准召回,
文字多图视频混着一次 forward 全搞定,
不用再费劲分别编码再拼接,
智能体终于有了生产级的视觉记忆底座

3️⃣ 视频与电商内容低成本打标推荐:
以前文字、封面图、视频切片要用不同模型分别编码再对齐,成本高还费劲
现在一次 encode 出来的向量直接可比,256 维保住近 99% 的性能,向量库存储成本直接给你砍到了脚脖子,中小团队也能玩得起大厂级的多模态推荐

大模型负责在大脑里做推理,它负责在海量数据里帮大模型长出一双精准检索的眼睛

代码一行 SentenceTransformers.encode 就能跑,别光收藏,
这三个方向里,你手头的项目最先能用上哪一个,欢迎评论区交流铁汁们~

引用@AYi_AInotes@AYi_AInotes
卧槽兄弟们,@Weixin_WeChat 微信刚刚干了件特别不微信的事,极其低调但又极其炸裂, 他们把每天给视频号、公众号、朋友圈和电商做搜索推荐的隐形AI,全盘开源了, 真正每天默默影响十几亿人体验的顶级技术,甚至根本不需要和你说一句话 这东西不会写文案,也不会陪你聊天,是那种不露脸的后台苦力, 但这次开源的 WeMM-Embedding,最吓人的根本不是 9B 拿了双榜第一, 而是那个区区 2B 的小版本,跑分直接干翻了上一代 8B 的开源顶流 2个B打赢8个B,靠的是工业级训练配方在抽暴力堆参数的耳光: 几亿级数据对齐加上细粒度蒸馏, 在微信内部 14 个真实业务测试里全线跑赢 做多模态 RAG、视频检索和 Agent 记忆的兄弟,这次真的省大钱了: 文字、多张图、长视频随便混着一次性喂进去, 最绝的是俄罗斯套娃维度,直接把维度截断到 256 维还能保住近 99% 的性能, 向量数据库的存储和检索成本,直接给你砍到了脚脖子 大模型负责在大脑里思考,Embedding 负责在万物里精准找到东西, 两个少了一个,所谓的 AI 智能体全都是盲人摸象 微信把自家每天扛几十亿流量的内容理解底座直接端出来, 对真正做工程落地的人来说,这比再发十个聊天模型都要痛快得多啊
在 X 查看被引用的帖子

来源:@AYi_AInotes · x.com