跳到正文
@AYi_AInotes· @AYi_AInotes · X·· 24 天前AI 评分45
AI 导读

Redis 推出托管语义缓存服务 LangCache,在模型门外拦截语义重复的请求,直接返回已验证答案。实测显示,原本需 2.232 秒、消耗 514 输入 Token 和 250 输出 Token 的调用,经其拦截后 0.37 秒返回,Token 消耗为 0,提速 6 倍;官方测算极端重复场景最高可省 90% 账单、提速 15 倍。

正文

Redis 构建一个缓存竟然能把LLM 成本降低90%?🤯。。

很多做大模型落地的工程团队,以为开了大厂的“前缀缓存(Prefix Caching)”就已经万事大吉了。
但实测数据狠狠抽了所有人一记耳光:
哪怕前缀全部命中,你的请求依然在老老实实调用 LLM、依然要消耗输出 Token、依然要忍受漫长的逐字解码等待。

在真实的生产环境里,客服和咨询助手每天处理的提问,绝大多数全是同义废话:
“购买月度计划能退款吗?”
“月度订阅支持退费吗?”
“我可以取消计划把钱拿回来吗?”
措辞完全不同,但核心语义和标准答案从头到尾没有变过。
然而传统的 LLM 架构极度愚蠢:它们把每个版本都当成全新的请求,重新拼 Prompt、重新调模型、重新为已经生成过一万遍的答案全额买单。

这就是为什么必须引入「语义缓存(Semantic Caching)」:
不让请求去撞大模型,而是直接在模型大门外面就把问题拦截下来!

结合与 Redis 合作的真实基准实测,这组对比数据极其残忍:

1️⃣ 传统调用 vs 语义拦截(算术暴击):
• 调模型直接推理:耗时 2.232 秒,白白烧掉 514 个输入 Token + 250 个输出 Token;
• Redis LangCache 拦截:在 0.37 秒内直接返回已验证过的标准答案,消耗 0 个输入 Token、0 个输出 Token!耗时直接砍掉五分之四,整整快了 6 倍;
2️⃣ 彻底颠覆底层链路:
新问题进来,系统先算轻量 Embedding 向量,去跟历史回答做相似度检索。只要语义过线,模型甚至根本不知道有这个请求发生过,官方测算极端重复场景下最高能省掉 90% 的账单、提速 15 倍;
3️⃣ 工业级落地不是玩具:
自己手搓向量缓存极其容易踩雷(相似度阈值设错就会答非所问)。Redis 把这一整套做成了托管服务(Redis LangCache),把访问权限、动态 TTL、冷热驱逐和防误判监控全部打包成了开箱即用的 REST API。

大模型时代最昂贵的商业幻觉,就是把所有力气花在“换更便宜的模型”上;
真正的高手早就看明白了:
最便宜、响应最快的 LLM 调用,永远是那个“根本不需要发生的调用”。

业务里重复提问占比超过 30% 的团队,真的该把这套架构搬回去了。 https://t.co/52orItDf9Z

来源:@AYi_AInotes · x.com