Liquid AI 发布 LFM2.5-2.6B 端侧智能体模型
Liquid AI 发布 LFM2.5-2.6B,一款可完全在设备端运行的智能体模型,支持工具调用与多步工作流,预训练约 34T tokens,中期训练将上下文窗口扩展至 128K。
推荐理由:官方给出与约 4 倍参数量模型的逐项基准对比和 CPU 解码速度,可供判断端侧智能体的可用边界。
跑在手机、电脑与边缘设备上的 AI:小模型、本地推理与端侧芯片的进展。
当前仅显示精选新闻Liquid AI 发布 LFM2.5-2.6B,一款可完全在设备端运行的智能体模型,支持工具调用与多步工作流,预训练约 34T tokens,中期训练将上下文窗口扩展至 128K。
推荐理由:官方给出与约 4 倍参数量模型的逐项基准对比和 CPU 解码速度,可供判断端侧智能体的可用边界。
NVIDIA 在 Hugging Face 的 Cosmos 3 仓库发布 Cosmos 3 Edge,一个 40 亿参数的开源世界模型,帮助机器人和视觉 AI 智能体理解环境、实时推理并生成机器人动作。
推荐理由:40 亿参数模型在边缘设备上实现实时推理与机器人控制,为端侧物理 AI 提供了可直接部署的开源世界模型。
inclusionAI 发布 SingGuard-NSFA 智能体安全护栏模型,覆盖 0.8B、2B、4B、9B 四个尺寸,基于 Qwen3.5 微调并采用 Apache 2.0 许可。
推荐理由:模型卡列出四个尺寸的 F1 表现与约 50 ms 实时检测延迟,读者可据此比较它在智能体安全拦截上的部署取舍。
PaddleOCR 发布 PP-OCRv6 通用 OCR 模型家族,提供 tiny、small、medium 三档,参数从 1.5M 到 34.5M,其中 medium 在官方多场景基准上达到 86.2% 检测 Hmean 和 83.2% 识别准确率。
推荐理由:PP-OCRv6 给出三档参数与多后端入口,读者可据此比较轻量 OCR 在各自部署场景中的取舍。
Hugging Face 发布开源评测工具 agent-eval,用于衡量开放模型驱动智能体使用某个库完成任务时的过程成本,而不只看最终答案。
推荐理由:这篇评测以 transformers 为样本,把智能体完成任务的过程成本拆成可量化指标,方法可迁移到其他库。
Tomer Tunguz 梳理了一篇 Hacker News 热帖的 500 多条评论,勾勒出本地编码栈的现状:Qwen 3.6 35B-A3B 以 33% 的提及率居首,27B 变体占 20%,DeepSeek Pro 与 Gemma4 31B 进入前四;智能体框架方面 Pi 以 49% 领先,OpenCode 紧随其后达 45%。
推荐理由:帖子数据勾勒出本地编码模型与智能体工具的占比,并与 Claude 做能力对比,便于判断本地替代的可行边界。
Google DeepMind 发布 Gemma 4 12B,采用无编码器统一架构,视觉与音频输入直接进入 LLM backbone,是该系列首个支持原生音频输入的中等规模模型。
推荐理由:官方说明新模型以无编码器统一架构把性能接近 26B 的多模态能力压到 16GB 内存笔记本可跑,开发者可据此评估端侧部署选择。
Apple 发布新一代基础模型,共五款,均与 Google 合作打造,其中 AFM 3 Core Advanced 是 200 亿参数、完全在 iPhone 17 Pro 端侧运行的模型。


推荐理由:原文交代了 200 亿参数端侧模型用专家分片加载绕过 DRAM 瓶颈的思路,可据此了解其实现路径。
推荐理由:文章列出 Gemma 4 QAT 的 GGUF 与移动端两种量化方案,可用于判断本地部署的体积与质量取舍。
Google Research 在 Nature 发表 PHRM 研究系统,利用人脸解锁后的前摄视频,在日用手机过程中后台跟踪心率与每日静息心率(RHR)。
推荐理由:原文给出跨肤色验证数据和开放数据集申请入口,读者可以据此评估手机摄像头被动心率监测的可用性。
Introducing Magenta RealTime 2 (MRT2): the live music model you can play as an instrument. MRT2 offers MIDI and prompt controls, and runs natively on a MacBook with <200ms latency. Open weights. Open source inference engine. Suite of apps and plugins. Hear what it can do and try it out for yourself below 🧵 Video
推荐理由:开放权重与开源推理引擎一并给出,读者可了解实时音乐模型在笔记本上的本地延迟表现。
Meet Gemma 4 12B! A unified, encoder-free multimodal model designed to bring high-performance intelligence directly to your laptop, and released under an Apache 2.0 license. Bridging the gap between edge efficiency and advanced reasoning. Here is what’s new with Gemma 4 12B: 👇
推荐理由:Gemma 4 12B 采用 Apache 2.0 许可并主打端侧多模态,可据此判断 16G 内存本地运行的可行性。
谷歌DeepMind发布并开源Gemma 4 12B,这是一个统一、无编码器的多模态模型,只需16GB显存或统一内存即可在消费级笔记本上运行。它在标准评测基准上的成绩接近26B MoE模型,总内存占用不到后者一半,采用Apache 2.0协议,预训练与指令微调权重可从Hugging Face和Kaggle下载。
推荐理由:原文介绍了无编码器多模态架构如何降低延迟和内存占用,并列出16GB笔记本可用的本地运行入口。
Today we’re introducing Gemma 4 12B — our latest open model that brings advanced agentic reasoning, vision and audio directly to your laptop. It delivers performance nearing our larger Gemma models with a much smaller total memory footprint, while being small enough to run locally with just 16GB of VRAM. It’s open and accessible for everyone to use under a permissive Apache 2.0 license. This is all made possible by our new, unified architecture that removes separate multimodal encoders. Here’s how we did it 🧵
推荐理由:它把视觉与音频编码器并入主干,让 12B 模型能在 16GB 显存本地运行,读者可据此判断端侧多模态的门槛变化。
Google 发布 Gemma 4 12B,一款基于 Apache 2.0 许可的免编码器统一多模态模型,把传统 ViT 视觉编码器的 150M-550M 参数压到 35M 轻量嵌入器。


Meet Gemma 4 12B! A unified, encoder-free multimodal model designed to bring high-performance intelligence directly to your laptop, and released under an Apache 2.0 license. Bridging the gap between edge efficiency and advanced reasoning. Here is what’s new with Gemma 4 12B: 👇
推荐理由:借 Gemma 4 12B 取消视觉编码器的设计,讨论统一多模态模型可能如何替代现有拼装式流水线。
推荐理由:官方给出无编码器架构与 16GB VRAM 本地运行的定位,读者可据此判断端侧多模态模型的选型边界。
H 公司发布 Holo3.1 计算机使用智能体模型家族,提供 0.8B、4B、9B 和 35B-A3B 四种尺寸,并首次推出 FP8、Q4 GGUF 和 NVFP4 量化权重。
推荐理由:Holo3.1 在移动端与跨框架适配上补齐短板,量化权重把计算机使用智能体带到本地设备。
推荐理由:从芯片参数到生态规则,梳理了 NVIDIA 入局 PC 对 Intel、AMD、苹果和高通各自意味着什么。
⚡️ Step 3.7 Flash is here: The new frontier is agent efficiency. #1 ClawEval-1.1 (67.1), #1 SimpleVQA Search (79.2), #2 SWE-PRO (56.3), 95.3 on V* Python. Open weights under Apache 2.0. Built for agentic, coding, search, and multimodal workflows — balancing speed, cost, and reliable execution. - 400 TPS. 198B sparse MoE, ~11B active. 256K context, 3 reasoning levels. - Understands UIs, charts, docs, images — then writes code or calls tools to act on what it sees. - Web + visual search reaches further: more sources, deeper follow-up. - Reliable tool use — less drift, fewer broken toolcalls. 98%+ on τ²-bench across all difficulty levels. - Works with Claude Code, KiloCode, Hermes Agent, OpenClaw, and protocols like MCP. - Runs locally on Mac Studio M4 Max, DGX Spark, AMD AI Max+ 395. GitHub: github.com/stepfun-ai/Step-3… HuggingFace: huggingface.co/stepfun-ai/St… GGUF: huggingface.co/stepfun-ai/St… ModelScope: modelscope.cn/models/stepfun… API: platform.stepfun.ai Blog: static.stepfun.com/blog/step…
推荐理由:从开放权重和速度成本平衡切入 agent 场景,读者可对照其编程与搜索评测及本地部署支持。
Hugging Face 发布教程,用自家 speech-to-speech 库把 Reachy Mini 的对话链路全部搬到本地,无需云服务、API key,音频不出本机。
推荐理由:给出了一条可整套照搬的本地语音链路,读者能据此把 VAD、STT、LLM、TTS 各环节换成自己的模型。