跳到正文
@karminski3· @karminski3 · X·· 22 天前AI 评分22
AI 导读

有人提出一个玄学猜想:当模型并发为1、只有单个请求时,在极端量化下走GEMV而非GEMM,累计精度损失更低,模型表现更聪明。该猜想将推理并发量与矩阵运算方式(GEMV/GEMM)同量化精度损失关联起来。

正文

我有个玄学猜想, 如果是模型特别闲的情况, 即并发开到1, 只有一个人请求. 那么在极端量化情况下, 走GEMV而不是GEMM, 累计精度损失低, 模型更聪明. https://t.co/vHankHjf2L

来源:@karminski3 · x.com