跳到正文

端侧 AI

跑在手机、电脑与边缘设备上的 AI:小模型、本地推理与端侧芯片的进展。

当前仅显示精选新闻

最新精选

第 21–40 条 · 共 48 条
8月4日周二
7月20日周一
7月16日周四
6月22日周一
6月18日周四
6月16日周二
  1. Tomer Tunguz65

    本地编码栈格局:Qwen 3.6 35B-A3B 提及率居首,Pi 以 49% 领跑智能体框架

    Tomer Tunguz 梳理了一篇 Hacker News 热帖的 500 多条评论,勾勒出本地编码栈的现状:Qwen 3.6 35B-A3B 以 33% 的提及率居首,27B 变体占 20%,DeepSeek Pro 与 Gemma4 31B 进入前四;智能体框架方面 Pi 以 49% 领先,OpenCode 紧随其后达 45%。

    推荐理由:帖子数据勾勒出本地编码模型与智能体工具的占比,并与 Claude 做能力对比,便于判断本地替代的可行边界。

6月9日周二
  1. Google DeepMind67

    Google DeepMind 发布 Gemma 4 12B:无编码器统一架构的多模态模型

    Google DeepMind 发布 Gemma 4 12B,采用无编码器统一架构,视觉与音频输入直接进入 LLM backbone,是该系列首个支持原生音频输入的中等规模模型。

    推荐理由:官方说明新模型以无编码器统一架构把性能接近 26B 的多模态能力压到 16GB 内存笔记本可跑,开发者可据此评估端侧部署选择。

6月6日周六
  1. @googleaidevs71

    Google 发布 Gemma 4 QAT 检查点,可在消费级 GPU 和移动设备上本地运行且质量损失很小。其中 GGUF(Q4_0)检查点覆盖各尺寸与 drafter 模型以追求本地性能,定制移动方案通过混合精度把 Gemma 4 压缩到 1GB 以内,包含针对性 2-bit 解码层、优化 KV cache 和静态激活。

    推荐理由:文章列出 Gemma 4 QAT 的 GGUF 与移动端两种量化方案,可用于判断本地部署的体积与质量取舍。

6月5日周五
  1. @googleaidevs69

    Google 发布开放权重的实时音乐模型 Magenta RealTime 2(MRT2),支持 MIDI 与提示词控制,可在 MacBook 上本地运行且延迟低于 200ms。官方同时提供开放权重、开源推理引擎及一系列应用和插件,演示中还展示了用 MIDI 键盘、实时文本提示乃至手势来演奏。

    引用Google Magenta Project (@GoogleMagenta)@GoogleMagenta

    Introducing Magenta RealTime 2 (MRT2): the live music model you can play as an instrument. MRT2 offers MIDI and prompt controls, and runs natively on a MacBook with <200ms latency. Open weights. Open source inference engine. Suite of apps and plugins. Hear what it can do and try it out for yourself below 🧵 Video

    推荐理由:开放权重与开源推理引擎一并给出,读者可了解实时音乐模型在笔记本上的本地延迟表现。

6月4日周四
  1. @berryxia73

    Google 昨晚发布 Gemma 4 12B 多模态模型,采用 Apache 2.0 许可,至少需要 16G 内存即可运行。该模型为统一的无编码器多模态模型,主打把高性能智能直接带到笔记本上,衔接端侧效率与高级推理。作者认为应与 Qwen 的模型对比其效果。

    引用Google Gemma (@googlegemma)@googlegemma

    Meet Gemma 4 12B! A unified, encoder-free multimodal model designed to bring high-performance intelligence directly to your laptop, and released under an Apache 2.0 license. Bridging the gap between edge efficiency and advanced reasoning. Here is what’s new with Gemma 4 12B: 👇

    推荐理由:Gemma 4 12B 采用 Apache 2.0 许可并主打端侧多模态,可据此判断 16G 内存本地运行的可行性。

  2. AI寒武纪 · 微信公众号80

    谷歌DeepMind开源Gemma 4 12B,16GB内存笔记本可本地跑多模态

    谷歌DeepMind发布并开源Gemma 4 12B,这是一个统一、无编码器的多模态模型,只需16GB显存或统一内存即可在消费级笔记本上运行。它在标准评测基准上的成绩接近26B MoE模型,总内存占用不到后者一半,采用Apache 2.0协议,预训练与指令微调权重可从Hugging Face和Kaggle下载。

    推荐理由:原文介绍了无编码器多模态架构如何降低延迟和内存占用,并列出16GB笔记本可用的本地运行入口。

  3. @kimmonismus81

    Google 发布 Gemma 4 12B 开源模型,采用 Apache 2.0 许可,可在 16GB 显存笔记本上本地运行,支持智能体推理、视觉与音频,作者称其质量接近 Google 的 26B 模型。

    引用Google (@Google)@Google

    Today we’re introducing Gemma 4 12B — our latest open model that brings advanced agentic reasoning, vision and audio directly to your laptop. It delivers performance nearing our larger Gemma models with a much smaller total memory footprint, while being small enough to run locally with just 16GB of VRAM. It’s open and accessible for everyone to use under a permissive Apache 2.0 license. This is all made possible by our new, unified architecture that removes separate multimodal encoders. Here’s how we did it 🧵

    推荐理由:它把视觉与音频编码器并入主干,让 12B 模型能在 16GB 显存本地运行,读者可据此判断端侧多模态的门槛变化。

  4. @AYi_AInotes73

    Google 发布 Gemma 4 12B,一款基于 Apache 2.0 许可的免编码器统一多模态模型,把传统 ViT 视觉编码器的 150M-550M 参数压到 35M 轻量嵌入器。

    引用Google Gemma (@googlegemma)@googlegemma

    Meet Gemma 4 12B! A unified, encoder-free multimodal model designed to bring high-performance intelligence directly to your laptop, and released under an Apache 2.0 license. Bridging the gap between edge efficiency and advanced reasoning. Here is what’s new with Gemma 4 12B: 👇

    推荐理由:借 Gemma 4 12B 取消视觉编码器的设计,讨论统一多模态模型可能如何替代现有拼装式流水线。

  5. @googleaidevs75

    Google 发布 Gemma 4 12B,一款不含多模态编码器的统一模型,可直接在笔记本上运行。该模型定位在移动端 E4B 与更大的 26B MoE 模型之间,视觉和音频输入直接进入 LLM 主干,原生支持音频,采用 Apache 2.0 许可。官方称在 16GB VRAM 下可本地运行复杂多步工作流,性能接近 26B 模型。

    推荐理由:官方给出无编码器架构与 16GB VRAM 本地运行的定位,读者可据此判断端侧多模态模型的选型边界。

6月2日周二
5月29日周五
  1. @OpenRouter69

    阶跃星辰发布 Step 3.7 Flash,主打 agent 效率,采用 198B 稀疏 MoE、约 11B 激活、256K 上下文和 3 级推理,以 Apache 2.0 开放权重。该模型在 ClawEval-1.1 得 67.1、SimpleVQA Search 得 79.2 均列第一,SWE-PRO 得 56.3,并支持 Claude Code、MCP 等工具调用,可在 Mac Studio M4 Max、DGX Spark 等设备本地运行。

    引用StepFun (@StepFun_ai)@StepFun_ai

    ⚡️ Step 3.7 Flash is here: The new frontier is agent efficiency. #1 ClawEval-1.1 (67.1), #1 SimpleVQA Search (79.2), #2 SWE-PRO (56.3), 95.3 on V* Python. Open weights under Apache 2.0. Built for agentic, coding, search, and multimodal workflows — balancing speed, cost, and reliable execution. - 400 TPS. 198B sparse MoE, ~11B active. 256K context, 3 reasoning levels. - Understands UIs, charts, docs, images — then writes code or calls tools to act on what it sees. - Web + visual search reaches further: more sources, deeper follow-up. - Reliable tool use — less drift, fewer broken toolcalls. 98%+ on τ²-bench across all difficulty levels. - Works with Claude Code, KiloCode, Hermes Agent, OpenClaw, and protocols like MCP. - Runs locally on Mac Studio M4 Max, DGX Spark, AMD AI Max+ 395. GitHub: github.com/stepfun-ai/Step-3… HuggingFace: huggingface.co/stepfun-ai/St… GGUF: huggingface.co/stepfun-ai/St… ModelScope: modelscope.cn/models/stepfun… API: platform.stepfun.ai Blog: static.stepfun.com/blog/step…

    推荐理由:从开放权重和速度成本平衡切入 agent 场景,读者可对照其编程与搜索评测及本地部署支持。

5月27日周三