AI 导读
Ivan Fioravanti 将 Step 3.7 Flash 加入 mlx-vlm,完成 MLX 转换后视觉与文本生成全部跑通。4bit 量化版可在 128GB Apple Silicon 上支持 32K 上下文,Mac Studio 实测生成速度超 53 tokens/s。截图分析能快速准确提取结构与关键元素,本地多模态能力进一步提升。
正文
我今天刷到Ivan Fioravanti在mlx-vlm项目里的更新。
Step 3.7 Flash模型正式加进去了。
转换到MLX之后,视觉理解和文本生成全部跑通。
这个模型速度特别快。
4bit量化版本在128GB Apple Silicon机器上就能支持32K上下文。
他直接在Mac Studio上测了benchmark,生成速度达到53 tokens/s以上。
拿一张截图让它分析,模型把结构信息、关键元素提取得又快又准。
以前我们总觉得高质量视觉语言任务必须靠云端。
现在它把这种能力真正塞进了个人Mac。
隐私、速度、零额外费用,全都兼顾到位。
本地多模态AI又往前走了一步,真正能落地到日常项目里。
Step 3.7 Flash support added to mlx-vlm! 🚀 ✅ Conversion to MLX ✅ Vision ✅ Text This model is ultra fast! I'm gonna publish some benchmarks tests soon! 4bit can run on 128GB Apple Silicon machines up to 32K contexts. We need to squeeze this model a little more to use it comfortably here. Gonna upload MLX models on Hugging Face and create a PR for @Prince_Canuma to review 🚀在 X 查看被引用的帖子
来源:@berryxia · x.com