跳到正文
@berryxia· @berryxia · X·· 2026-06-01AI 评分57
AI 导读

KwaiKeye 在 Hugging Face 发布多模态模型 Keye VL 2.0-30B-A3B,总参数 30B、活跃参数 3B,采用 Apache 2.0 完全开源。

正文

刚刚在Hugging Face刷新模型时,看到KwaiKeye放出了Keye VL 2.0-30B-A3B。

这个多模态模型总参数30B,活跃参数只有3B,Apache 2.0完全开源。

它直接用DeepSeek Sparse Attention实现了256K上下文。

最有意思的是视频理解部分的表现。

你喂给它的帧数越多,模型准确率反而稳步上升。

这和我们以前觉得长视频容易让模型迷失的直觉完全相反。

它在多个长视频基准上已经和Qwen3 VL、Gemini 3 Flash打成平手。

以前大家总觉得多模态模型要么上下文够长,要么理解够深,二者很难兼得。

现在KwaiKeye把稀疏注意力真正落地,把这两件事同时推到一个新水平。

实际效果如何,后面看看真实case册书。

引用Adina Yakup (@AdinaYakup)@AdinaYakup
Keye VL 2.0-30B-A3B 🔥 New multimodal model from @KwaiKeye ✨ 30B/3B active - Apache 2.0 ✨ 256K context via DeepSeek Sparse Attention (probably the first model to ship this in production?👀) ✨ Gets MORE accurate as you feed it more frames ✨ Matchs Qwen3 VL and Gemini 3 Flash on benchmarks
在 X 查看被引用的帖子

来源:@berryxia · x.com