跳到正文

端侧 AI

跑在手机、电脑与边缘设备上的 AI:小模型、本地推理与端侧芯片的进展。

当前仅显示精选新闻

最新精选

第 1–20 条 · 共 47 条
10月4日周日
  1. X.PIN70

    华为称其昇腾 AI 芯片在中国市场份额已超过 Nvidia,但未说明领先幅度。轮值董事长徐直军表示瓶颈在大陆可用制程而非芯片设计,因此将大量芯片互联为 SuperPoD;国内产能无法满足需求,暂无全面出海计划。Bernstein 预测今年华为份额约 50%、Nvidia 约 8%;DeepSeek 据报计划在内蒙古一处数据中心部署至少 160,000 片昇腾 950DT。

    推荐理由:综合华为高层表态与第三方预测,呈现中国 AI 芯片市场份额变化及其产能与制程约束,读者可据此理解格局。

10月3日周六
  1. AYi69

    Meta 宣布开源 Muse Gadgets,提供开源 ESP32 固件和 Linux SDK,让任何人自制可与 Muse 配合的硬件。同时发布官方 USB-C 拓展器 Muse Home Link,让 Muse 控制电视、音箱等智能家居,首批 5000 个免费赠送给订阅用户。

    引用Alexandr Wang@alexandr_wang

    🚨 MUSE ECOSYSTEM ALERT 🚨 today we are announcing Muse Gadgets! this is an open-source ESP32 firmware and Linux SDK for anyone to make hardware that works with Muse we are also releasing our own gadget—Muse Home Link—to enable your muse to work with your smart devices (TV, speakers, etc.)

    推荐理由:原文把开源固件和 SDK 的玩法拆成大白话,读者可以据此评估低成本自制 AI 硬件入口的可行性。

9月29日周二
  1. Google Cloud: Databases65

    Google Cloud 分析创业公司为何需要在前沿 API 之外搭配 Gemma 4 开源模型

    Google Cloud 发文主张创业公司采用“复合 AI 栈”,用开源的 Gemma 4 处理边缘执行、高吞吐分流、任务微调和垂直场景,把 Gemini 留给复杂推理。

    推荐理由:文章用三个创业案例和四类工作负载说明开源模型与前沿 API 搭配的架构取舍,适合正在做模型选型的团队参考。

9月23日周三
  1. Google Developers Blog65

    Antigravity SDK 支持本地模型,首发接入 Gemma 4 26B A4B 与 LiteRT

    Google 宣布 Antigravity SDK 支持本地工作流,首发支持通过 Google AI Edge 的 LiteRT 运行 Gemma 4 26B A4B,可完全离线提供智能体能力,建议机器配备 24GB 以上 VRAM 或统一内存。

    推荐理由:原文给出本地运行智能体的具体配置方法和混合编排演示数据,开发者可以直接照此把智能体工作流搬到本地 GPU 上。

9月22日周二
9月10日周四
9月5日周六
9月4日周五
9月1日周二
  1. IT Home78

    英伟达宣布向联发科投资 35 亿美元,在 AI、PC 芯片、汽车三大领域达成合作

    英伟达与联发科 8 月 31 日宣布加深长期合作,英伟达投资 35 亿美元联发科可转换债券,双方在 AI 基础设施、本地 AI 计算和汽车三大领域展开合作。联发科将采用 NVIDIA NVLink Fusion 平台,为超大规模企业、云服务提供商和前沿模型开发者提供预验证路径,开发定制 XPU 并引入 NVIDIA NVLink 连接的机架级 AI 工厂。

    推荐理由:英伟达以35亿美元可转债加深与联发科合作,读者可据此了解其在AI基础设施与PC芯片上的合作范围。

8月26日周三
8月23日周日
8月21日周五
  1. Hugging Face Blog65

    Liquid AI 发布 LFM2.5-DSpark 草稿模型,推理吞吐最高提升 3.2x

    Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 三个模型发布 DSpark 草稿模型 checkpoint,通过投机解码在不改变输出质量的前提下加速推理,GPU 吞吐最高提升 3.18x,端侧最高 2.87x。

    推荐理由:官方为 LFM2.5 三款模型发布 DSpark 草稿模型,给出从 H100 到 MacBook 的实测加速数据和开源接入方式。

8月18日周二
8月17日周一
  1. Mistral AI74

    Mistral AI 发布 24B 参数 Mistral Small 3,Apache 2.0 开源

    Mistral AI 发布 24B 参数的 Mistral Small 3,以 Apache 2.0 许可同时放出预训练和指令微调 checkpoint。官方称其指令版与 Llama 3.3 70B instruct 相当,同硬件下速度超过 3 倍,MMLU 准确率超 81%,延迟 150 tokens/s。

    推荐理由:官方给出了 24B 模型的对标结果与本地部署门槛,读者可据此判断它在开源替代中的位置。

8月11日周二
  1. 量子位 · 微信公众号78

    Meta 开源 30B 本地 Agent 模型 Muse Glimmer,24GB 显存可运行

    Meta MSL 开源本地 Agent 模型 Muse Glimmer,总参数约 296 亿(含约 18 亿参数视觉编码器),上下文超 13 万 Token,支持文本和图像输入,量化到 17GB 后可装进 24GB 消费级显存。

    推荐理由:Meta 开源 30B 级本地 Agent 模型,量化后 24GB 消费级显存可跑,读者可据此判断本地 Agent 的部署门槛变化。

8月10日周一
  1. Hugging Face Blog81

    Meta 发布开源多模态模型 Muse Glimmer-30B,主打本地智能体场景

    Meta 发布从 Muse 蒸馏而来的 30B 多模态模型 Muse Glimmer,采用 Apache 2.0 许可,面向本地隐私场景的智能体用途。模型由 2B ViT 视觉编码器和 28B 文本解码器组成,支持图像、视频、多模态工具调用和目标检测,并附带基于 DFlash 的可选投机解码。

    推荐理由:原文给出架构组成、基准对比和各推理框架的 day-0 用法,读者可以据此评估本地部署的可行路径。

  2. LMSYS Blog60

    SGLang 为 Meta Muse Glimmer 提供 Day-0 支持,面向本地智能体工作流的多模态模型

    SGLang 与 Meta Superintelligence Labs 合作,为 Muse Glimmer 提供 Day-0 支持。Muse Glimmer 是 30B 参数多模态稠密模型,拥有 128k+ token 上下文窗口,架构含 27.9B 文本解码器、1.9B ViT 和多模态 projector。

    推荐理由:原文给出多平台实测吞吐与量化方案,读者可据此评估在本地硬件跑智能体工作流的可行性。

8月4日周二