跳到正文
Hugging Face Daily Papers·· 2026-08-24AI 评分40

Llama-Mobile:面向 VLM 的高效 2.7-bit 量化框架

Llama-Mobile: Efficient 2.7-Bit Quantization of VLMs

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

Llama-Mobile 提出一套面向 VLM 的量化框架,采用每参数 2.7-bit 的新格式,可在 Arm CPU 上高效执行,且量化流程由模型自身生成训练数据、无需访问原始训练环境。该框架将 Llama 3.2 11B Vision Instruct 压缩至 3.7 GB(8-bit 激活),在标准视觉问答任务上保持较强性能。

来源:Hugging Face Daily Papers · arxiv.org