Together AI 解析 DeepSeek-V4 服务化:百万 token 上下文是推理系统工程问题
Serving DeepSeek-V4: why million-token context is an inference systems problem
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
Together AI 发布 DeepSeek-V4 服务化解析,指出 V4 通过 CSA、HCA、SWA 混合注意力在存储前压缩上下文,支持 1M token 上下文窗口。
推荐理由
文章基于 Together 的 B200 实测拆解 V4 的三种 KV 缓存布局与 SWA 存储策略,给出可迁移的长上下文服务优化思路。
来源:Together AI Blog · together.ai