Llama-Mobile:面向 VLM 的高效 2.7-bit 量化框架
Llama-Mobile: Efficient 2.7-Bit Quantization of VLMs
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
Llama-Mobile 提出一套面向 VLM 的量化框架,采用每参数 2.7-bit 的新格式,可在 Arm CPU 上高效执行,且量化流程由模型自身生成训练数据、无需访问原始训练环境。该框架将 Llama 3.2 11B Vision Instruct 压缩至 3.7 GB(8-bit 激活),在标准视觉问答任务上保持较强性能。
来源:Hugging Face Daily Papers · arxiv.org