AI 导读
KwaiKeye 在 Hugging Face 发布多模态模型 Keye VL 2.0-30B-A3B,总参数 30B、活跃参数 3B,采用 Apache 2.0 完全开源。
正文
刚刚在Hugging Face刷新模型时,看到KwaiKeye放出了Keye VL 2.0-30B-A3B。
这个多模态模型总参数30B,活跃参数只有3B,Apache 2.0完全开源。
它直接用DeepSeek Sparse Attention实现了256K上下文。
最有意思的是视频理解部分的表现。
你喂给它的帧数越多,模型准确率反而稳步上升。
这和我们以前觉得长视频容易让模型迷失的直觉完全相反。
它在多个长视频基准上已经和Qwen3 VL、Gemini 3 Flash打成平手。
以前大家总觉得多模态模型要么上下文够长,要么理解够深,二者很难兼得。
现在KwaiKeye把稀疏注意力真正落地,把这两件事同时推到一个新水平。
实际效果如何,后面看看真实case册书。
Keye VL 2.0-30B-A3B 🔥 New multimodal model from @KwaiKeye ✨ 30B/3B active - Apache 2.0 ✨ 256K context via DeepSeek Sparse Attention (probably the first model to ship this in production?👀) ✨ Gets MORE accurate as you feed it more frames ✨ Matchs Qwen3 VL and Gemini 3 Flash on benchmarks在 X 查看被引用的帖子
来源:@berryxia · x.com