AI 导读
有人提出一个玄学猜想:当模型并发为1、只有单个请求时,在极端量化下走GEMV而非GEMM,累计精度损失更低,模型表现更聪明。该猜想将推理并发量与矩阵运算方式(GEMV/GEMM)同量化精度损失关联起来。
正文
我有个玄学猜想, 如果是模型特别闲的情况, 即并发开到1, 只有一个人请求. 那么在极端量化情况下, 走GEMV而不是GEMM, 累计精度损失低, 模型更聪明. https://t.co/vHankHjf2L
来源:@karminski3 · x.com
有人提出一个玄学猜想:当模型并发为1、只有单个请求时,在极端量化下走GEMV而非GEMM,累计精度损失更低,模型表现更聪明。该猜想将推理并发量与矩阵运算方式(GEMV/GEMM)同量化精度损失关联起来。
我有个玄学猜想, 如果是模型特别闲的情况, 即并发开到1, 只有一个人请求. 那么在极端量化情况下, 走GEMV而不是GEMM, 累计精度损失低, 模型更聪明. https://t.co/vHankHjf2L
来源:@karminski3 · x.com