跳到正文
Together AI Blog·· 2026-03-04AI 评分42

Together AI 提出 CPD:长上下文 LLM 推理吞吐最高提升 40%

Cache-aware prefill–decode disaggregation (CPD) for up to 40% faster long-context LLM serving

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

Together AI 提出缓存感知的 prefill–decode 分离架构 CPD,在标准 PD 基础上新增 pre-prefill 节点层和三级 KV-cache 层级(GPU 显存、主机 DRAM、RDMA 分布式缓存),将低复用率的冷请求与高复用率的暖请求分流到不同计算资源。

来源:Together AI Blog · together.ai