DeepSeek 发布 DeepSeek-V4.1-Flash,支持 1M 上下文与 FP4 KV 缓存
DeepSeek AI Released DeepSeek-V4.1-Flash with 1M Context, FP4 KV Cache, and Cross-Layer Attention Reuse
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
DeepSeek 发布多模态 MoE 模型 DeepSeek-V4.1-Flash,具备 1M token 上下文窗口,全局 KV 缓存占用约 890 字节每 token,约为 DeepSeek-V4-Flash 的 1/4。
推荐理由
DeepSeek-V4.1-Flash 把全局 KV 缓存压到 890 字节每 token,长上下文推理的部署成本变化构成主要看点。
来源:MarkTechPost · marktechpost.com