AI 导读
DeepSeek-V4.1-Flash 的 core attention 让同一个存储向量同时承担 K 和 V 的作用:先用 Q 与该向量计算匹配分数,归一化得到权重后,再让同一向量按权重参与输出加权求和。不同 query heads 可读取同一份 KV,各自得到权重分布和输出。
正文
理解 attention,可以先区分 K 和 V 的作用:
K 参与计算 Q 与各个条目的匹配分数。
V 根据 attention weights 加权求和,形成输出。
DeepSeek-V4.1-Flash 的 core attention 使用同一个存储向量,同时承担 K 和 V 的作用。
先用 Q 与该向量计算匹配分数;经过归一化得到权重后,再让同一个向量按权重参与输出的加权求和。
不同 query heads 可以读取同一份 KV,同时得到各自的权重分布和输出。
来源:@dongxi_nlp · x.com