推荐理由:综合华为高层表态与第三方预测,呈现中国 AI 芯片市场份额变化及其产能与制程约束,读者可据此理解格局。
端侧 AI
全部主题跑在手机、电脑与边缘设备上的 AI:小模型、本地推理与端侧芯片的进展。
当前仅显示精选新闻最新精选
第 1–20 条 · 共 47 条
X.PIN@thexpin精选AI 评分7070
AYi@AYi_AInotes精选AI 评分6969
引用Alexandr Wang@alexandr_wang🚨 MUSE ECOSYSTEM ALERT 🚨 today we are announcing Muse Gadgets! this is an open-source ESP32 firmware and Linux SDK for anyone to make hardware that works with Muse we are also releasing our own gadget—Muse Home Link—to enable your muse to work with your smart devices (TV, speakers, etc.)
推荐理由:原文把开源固件和 SDK 的玩法拆成大白话,读者可以据此评估低成本自制 AI 硬件入口的可行性。
Google Cloud: Databases精选AI 评分6565 Google Cloud 分析创业公司为何需要在前沿 API 之外搭配 Gemma 4 开源模型
Google Cloud 发文主张创业公司采用“复合 AI 栈”,用开源的 Gemma 4 处理边缘执行、高吞吐分流、任务微调和垂直场景,把 Gemini 留给复杂推理。
推荐理由:文章用三个创业案例和四类工作负载说明开源模型与前沿 API 搭配的架构取舍,适合正在做模型选型的团队参考。
Google Developers Blog精选AI 评分6565 Antigravity SDK 支持本地模型,首发接入 Gemma 4 26B A4B 与 LiteRT
Google 宣布 Antigravity SDK 支持本地工作流,首发支持通过 Google AI Edge 的 LiteRT 运行 Gemma 4 26B A4B,可完全离线提供智能体能力,建议机器配备 24GB 以上 VRAM 或统一内存。
推荐理由:原文给出本地运行智能体的具体配置方法和混合编排演示数据,开发者可以直接照此把智能体工作流搬到本地 GPU 上。
Hugging Face Blog精选AI 评分7474 transformers 支持直接加载 llama.cpp GGUF 量化模型
Hugging Face 宣布 transformers 支持通过 from_pretrained 加载 GGUF 量化模型,复用 ggml 的 Metal 内核,初始聚焦 Apple Silicon 上的 Qwen3.5 架构。
推荐理由:原文给出加载方式、性能对比数据和方法论,读者可据此判断在 Mac 上用 transformers 跑 GGUF 的可行路径。
@OpenBMB@OpenBMB精选AI 评分6969 
推荐理由:面壁智能同步放出权重、训练代码与 Agent SFT/RL 数据,便于端侧复现和二次开发。
@cb_doge@cb_doge精选AI 评分7070 
推荐理由:Cybercab 面向公众开放的时间比原计划提前三小时,可作为观察自动驾驶载客落地节奏的一个节点。
NVIDIA Blog精选AI 评分6262 NVIDIA 在 IFA 2026 推出本地 AI 工具与 RTX Spark PC
NVIDIA 在 IFA 2026 宣布与 Microsoft 及合作伙伴推出面向本地 AI 的推理优化和智能体工具,并预告 10 月上市的新款 RTX Spark Windows PC。
推荐理由:原文列出多款智能体应用的一键本地配置路径与推理吞吐提升数据,读者可据此估量本地部署门槛的变化。
@AravSrinivas@AravSrinivas精选AI 评分6666 Perplexity 为 Mac 应用的全部用户推出混合计算功能,让 Computer 调度可在 Mac 本地运行的模型。该能力主要面向涉及敏感与私密文件的智能体步骤,例如血液检查、报税和诉讼材料。

推荐理由:官方说明了本地模型与云端混合调度的分工,读者可据此判断敏感文件在智能体流程中的处理边界。
IT Home精选AI 评分7878 英伟达宣布向联发科投资 35 亿美元,在 AI、PC 芯片、汽车三大领域达成合作
英伟达与联发科 8 月 31 日宣布加深长期合作,英伟达投资 35 亿美元联发科可转换债券,双方在 AI 基础设施、本地 AI 计算和汽车三大领域展开合作。联发科将采用 NVIDIA NVLink Fusion 平台,为超大规模企业、云服务提供商和前沿模型开发者提供预验证路径,开发定制 XPU 并引入 NVIDIA NVLink 连接的机架级 AI 工厂。
推荐理由:英伟达以35亿美元可转债加深与联发科合作,读者可据此了解其在AI基础设施与PC芯片上的合作范围。
@kimmonismus@kimmonismus精选AI 评分7272 Qwen3.8-Flash-Next 与 GLM-5.3-Flash 两款开放权重模型发布,均为 MoE 架构,每 token 分别激活 6B 和 18B 参数。


推荐理由:推文列出两款开放权重模型的参数规模与多项基准结果,可供读者对比其与前沿闭源模型的差距。
MarkTechPost精选AI 评分7777 FreeToken:单张工作站 GPU 运行 753B GLM-5.2 的边缘 MoE 推理引擎
UC Berkeley 与 UT Austin 研究团队提出边缘原生 MoE 推理引擎 FreeToken,把个人机器当作统一弹性推理平台,可在单张工作站 GPU 上运行 753B 的 GLM-5.2。
推荐理由:文中给出多档消费级与工作站 GPU 的实测吞吐和缓存命中率,可作本地 Agent 推理的选型参考。
Hugging Face Blog精选AI 评分6565 Liquid AI 发布 LFM2.5-DSpark 草稿模型,推理吞吐最高提升 3.2x
Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 三个模型发布 DSpark 草稿模型 checkpoint,通过投机解码在不改变输出质量的前提下加速推理,GPU 吞吐最高提升 3.18x,端侧最高 2.87x。
推荐理由:官方为 LFM2.5 三款模型发布 DSpark 草稿模型,给出从 H100 到 MacBook 的实测加速数据和开源接入方式。
@AYi_AInotes@AYi_AInotes精选AI 评分7676 
推荐理由:借 Intelligence Index 榜单对比,说明 27B 开源本地模型如何靠更长思维链弥补参数量差距。
Mistral AI精选AI 评分6161 Mistral 发布 Codestral Mamba,7B 参数代码模型采用 Mamba 架构
Mistral 发布 Codestral Mamba,这是一个基于 Mamba 架构的 7B 指令代码模型,权重已在 HuggingFace 开放,采用 Apache 2.0 许可。
推荐理由:Mamba 架构带来线性时间推理与长序列建模,官方还测试了 256k token 的上下文检索,为代码助手的本地部署提供 Transformer 之外的选择。
Mistral AI精选AI 评分7474 Mistral AI 发布 24B 参数 Mistral Small 3,Apache 2.0 开源
Mistral AI 发布 24B 参数的 Mistral Small 3,以 Apache 2.0 许可同时放出预训练和指令微调 checkpoint。官方称其指令版与 Llama 3.3 70B instruct 相当,同硬件下速度超过 3 倍,MMLU 准确率超 81%,延迟 150 tokens/s。
推荐理由:官方给出了 24B 模型的对标结果与本地部署门槛,读者可据此判断它在开源替代中的位置。
量子位 · 微信公众号精选AI 评分7878 Meta 开源 30B 本地 Agent 模型 Muse Glimmer,24GB 显存可运行
Meta MSL 开源本地 Agent 模型 Muse Glimmer,总参数约 296 亿(含约 18 亿参数视觉编码器),上下文超 13 万 Token,支持文本和图像输入,量化到 17GB 后可装进 24GB 消费级显存。
推荐理由:Meta 开源 30B 级本地 Agent 模型,量化后 24GB 消费级显存可跑,读者可据此判断本地 Agent 的部署门槛变化。
Hugging Face Blog精选AI 评分8181 Meta 发布开源多模态模型 Muse Glimmer-30B,主打本地智能体场景
Meta 发布从 Muse 蒸馏而来的 30B 多模态模型 Muse Glimmer,采用 Apache 2.0 许可,面向本地隐私场景的智能体用途。模型由 2B ViT 视觉编码器和 28B 文本解码器组成,支持图像、视频、多模态工具调用和目标检测,并附带基于 DFlash 的可选投机解码。
推荐理由:原文给出架构组成、基准对比和各推理框架的 day-0 用法,读者可以据此评估本地部署的可行路径。
LMSYS Blog精选AI 评分6060 SGLang 为 Meta Muse Glimmer 提供 Day-0 支持,面向本地智能体工作流的多模态模型
SGLang 与 Meta Superintelligence Labs 合作,为 Muse Glimmer 提供 Day-0 支持。Muse Glimmer 是 30B 参数多模态稠密模型,拥有 128k+ token 上下文窗口,架构含 27.9B 文本解码器、1.9B ViT 和多模态 projector。
推荐理由:原文给出多平台实测吞吐与量化方案,读者可据此评估在本地硬件跑智能体工作流的可行性。
Hugging Face Blog精选AI 评分6464 Liquid AI 发布 LFM2.5-2.6B 端侧智能体模型
Liquid AI 发布 LFM2.5-2.6B,一款可完全在设备端运行的智能体模型,支持工具调用与多步工作流,预训练约 34T tokens,中期训练将上下文窗口扩展至 128K。
推荐理由:官方给出与约 4 倍参数量模型的逐项基准对比和 CPU 解码速度,可供判断端侧智能体的可用边界。