跳到正文

端侧 AI

跑在手机、电脑与边缘设备上的 AI:小模型、本地推理与端侧芯片的进展。

最新精选

第 21–28 条 · 共 28 条
5月26日周二
  1. @kimmonismus70

    苹果据报在下一代 Siri 改造中使用定制 1.2T 参数 Google 模型,作为部分功能背后的底层大脑(Reuters)。文中对比称 Gemini 3.5 Flash 估计约 300 billion 参数,苹果模型规模明显更大,而简单查询预期在本地运行。作者由此提出规模在该场景是否真正划算、响应速度能否满足日常查询的疑问。

    推荐理由:报道称苹果在 Siri 改造中采用定制 1.2T 参数 Google 模型,读者可了解其规模与端侧推理之间的取舍。

5月22日周五
  1. @berryxia68

    Stable Audio 3 发布,可在 Mac 本地运行音乐生成,在 M5 Pro 上达到 59x realtime。其 Sm 模式更快、Medium 模式质量更高,LoRA 微调不到 1 小时完成。官方提供 MLX 优化版,可用一行命令安装。

    引用dadabots (@dadabots)@dadabots

    🥳 Announcing Stable Audio 3 🍕 🏆 fastest music models ever 💻 runs on MacBookPro M-series 🧪 break it plz 🧠 LoRA finetune in < 1h 📷 Sm = faster, Medium = qualityer ⚡ 59x realtime on M5 Pro One-liner fast install: curl -LsSf dadabots.com/_/sa3-mac | bash Video

    推荐理由:Stable Audio 3 给出在 Mac 本地运行音乐生成的安装方式与性能数据,可据此判断本地音乐生成工作流的可行性。

5月15日周五
  1. @vista866

    面壁智能发布 1.3B 参数的视觉模型 MiniCPM-V 4.6,面向消费级和移动硬件,已在 Hugging Face、GitHub 和 ModelScope 上线。该模型采用 LLaVA-UHD v4 技术,官方称将视觉编码成本降低 55%。官方还称其在多模态和 Artificial Analysis 基准上超过 Gemma4-E2B-it 和 Qwen3.5-0.8B,TTFT 为 75.7ms、比 Qwen3.5-0.8B 快 2.2 倍。原文作者表示在 Hugging Face 看到该模型论文,准备抽空测试。

    引用OpenBMB (@OpenBMB)@OpenBMB

    1/5 MiniCPM-V 4.6 (1.3B) is now live 🚀🚀 High-res visual processing, optimized for consumer-grade and mobile hardware. We’ve leveraged the latest LLaVA-UHD v4 technique to cut vision encoding costs by 55%, enabling native edge deployment with extreme efficiency. 🔥 Beats Gemma4-E2B-it and Qwen3.5-0.8B across key multimodal and Artificial Analysis benchmarks — scoring higher than Qwen3.5-0.8B using just 2.5% of its token budget. ⚡ TTFT (75.7ms) 2.2x Faster than Qwen3.5-0.8B even with 3136² high-res images. 🏗️ ~1.5x Token Throughput compared with Qwen3.5-0.8B on a single RTX 4090. Try the model here: 🤗 Hugging Face: huggingface.co/openbmb/MiniC… 💻 GitHub: github.com/OpenBMB/MiniCPM-V 🔭 Modelscope: modelscope.cn/models/OpenBMB… 🌐 Web Demo: huggingface.co/spaces/openbm… 📱 App Demo: github.com/OpenBMB/MiniCPM-V… Video

    推荐理由:官方给出 1.3B 小模型处理高分辨率图像的编码成本与吞吐数据,可供端侧多模态选型参考。

5月14日周四
  1. @berryxia72

    Unsloth 创始人 Daniel Han 发布 Qwen3.6 实验版 MTP GGUF,27B 模型单 GPU 生成速度达 140 tokens/s,35B-A3B 版本达 220 tokens/s。

    引用Daniel Han (@danielhanchen)@danielhanchen

    We released experimental MTP Qwen3.6 Unsloth GGUFs! Qwen3.6 27B MTP now runs at 140 tokens/s. Qwen3.6 35B-A3B MTP gets 220 tokens/s generation on a single GPU. Qwen3.6 27B and 35B-A3B have >1.4x speed-up over the original GGUFs without any change in accuracy. Guide + GGUFs + Benchmarks: unsloth.ai/docs/models/qwen3… In terms of average speedup, we see a 1.4x for dense models at draft tokens = 2 and for the MoE around 1.15 to 1.2x. We do not recommend more than 2 draft tokens because the acceptance rate drops precipitously from 83% to 50% with 4 draft tokens, and the forward passes for MTP become less beneficial. Use `--spec-type mtp --spec-draft-n-max 2` Thanks to Aman for github.com/ggml-org/llama.cp…!

    推荐理由:原文给出单 GPU 实测速度、加速比与 draft tokens 甜点,可据此判断本地 30B 级模型的部署空间。

4月30日周四
  1. 微信公众号(Mp2RSS 合集)77

    MiniCPM-o 4.5 技术报告发布:全双工全模态 API 开放,RTX5070 即可实时运行

    面壁智能联合 OpenBMB、清华大学 THUNLP 与 THUMAI 实验室发布 MiniCPM-o 4.5 技术报告,首次公开全双工全模态框架 Omni-Flow,并同步开放全模态全双工 API、在线 Demo、端侧安装包 Comni 与 Demo 仓库。

    推荐理由:技术报告首次公开 Omni-Flow 的毫秒级时间轴对齐机制,读者可据此理解端到端全双工全模态的实现路径。

4月29日周三
  1. @TencentHunyuan66

    腾讯混元开源 Hy-MT1.5-1.8B-1.25bit 翻译模型,该模型仅 440MB,可在手机完全离线运行,支持 33 种语言。1.8B 参数在标准基准上匹配商业翻译 API 和 235B 规模模型,量化到 1.25-bit 后内存从 3.3GB(FP16)降至 440MB,比之前 1.67-bit 方案小 25%、快约 10%,且无精度损失。

    推荐理由:1.8B 翻译模型量化到 1.25bit 后仅 440MB,可在手机离线运行,为端侧模型压缩提供参考。

4月23日周四
12月3日周三
  1. Mistral AI77

    Mistral 发布 Mistral 3 系列模型,含 Mistral Large 3 与 Ministral 3,均以 Apache 2.0 开源

    Mistral 发布新一代模型系列 Mistral 3,包括 14B/8B/3B 的 Ministral 3 小模型和 sparse MoE 架构的 Mistral Large 3(41B 激活、675B 总参数),全部以 Apache 2.0 许可开源,提供 base、instruct 和 reasoning 变体。

    推荐理由:官方公布完整模型规格、开源许可和部署路径,读者可据此评估在自建或端侧场景的可用性。