FreeToken:单张工作站 GPU 运行 753B GLM-5.2 的边缘 MoE 推理引擎
UC Berkeley 与 UT Austin 研究团队提出边缘原生 MoE 推理引擎 FreeToken,把个人机器当作统一弹性推理平台,可在单张工作站 GPU 上运行 753B 的 GLM-5.2。
推荐理由:文中给出多档消费级与工作站 GPU 的实测吞吐和缓存命中率,可作本地 Agent 推理的选型参考。
把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。
当前仅显示精选新闻UC Berkeley 与 UT Austin 研究团队提出边缘原生 MoE 推理引擎 FreeToken,把个人机器当作统一弹性推理平台,可在单张工作站 GPU 上运行 753B 的 GLM-5.2。
推荐理由:文中给出多档消费级与工作站 GPU 的实测吞吐和缓存命中率,可作本地 Agent 推理的选型参考。


推荐理由:内存涨价正传导到整机报价,读者可据此理解 AI 服务器资本开支与数据中心交付节奏的关联。
Anthropic 发布 AI-Native SDLC playbook,把软件开发流程拆成 Plan、Design、Build、Test、Deploy、Maintain 六个阶段,逐阶段给出具体做法、治理考量与度量指标。
推荐理由:Anthropic 公开其内部把 Claude 嵌入研发六个阶段的做法,含各阶段产物与治理门槛,便于团队对照改造自身流程。
OpenRouter is joining Stripe. We started OpenRouter with a simple mission: intelligence should be multi-model. Today, we are the largest AI marketplace & gateway, processing 10T+ tokens daily on 400+ models. Joining @Stripe gives us the opportunity to accelerate that mission. https://t.co/21T5zZWfDM
推荐理由:作者把 Stripe 的支付清算经验与模型路由做类比,读者可据此理解路由层为何被视为基础设施。
Hugging Face 介绍 Papers with Code 混合搜索架构:PostgreSQL 全文检索加 pgvector 语义检索,经 RRF 融合,用 Qwen/Qwen3-Embedding-0.6B 生成 256 维向量,已覆盖超 110,000 篇 arXiv 论文。
推荐理由:作者复盘了自己上线论文混合搜索的架构与教训,读者可以借鉴冷启动回退、embedding 契约和 Matryoshka 维度权衡这些可迁移做法。
Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 三个模型发布 DSpark 草稿模型 checkpoint,通过投机解码在不改变输出质量的前提下加速推理,GPU 吞吐最高提升 3.18x,端侧最高 2.87x。
推荐理由:官方为 LFM2.5 三款模型发布 DSpark 草稿模型,给出从 H100 到 MacBook 的实测加速数据和开源接入方式。
Stripe 同意收购 AI 模型路由平台 OpenRouter,把模型选择与路由并入其 AI 用量与按 token 计费业务。OpenRouter 支持 80 多家供应商的 400 多个模型,通过单一 API 转发请求,并按任务复杂度、价格、速度与可靠性选择模型及其供应商端点。
推荐理由:收购把模型路由接入支付与计费体系,读者可据此观察多模型环境下成本与结算方式的变化。
DFlash 2 让 Qwen3.8-27B 在一台 M5 Max MacBook Pro 上跑到 70 tok/s,最高为自回归解码的 4.6 倍,且输出与原始模型完全一致。
推荐理由:DFlash 2 把本地 27B 模型解码从 20 至 30 tok/s 推到 70 tok/s,交互流畅度有了可比较的参照。
推荐理由:开源发布的智能体运行框架给出本地与托管两种部署路径,并列出同一模型与开放模型下的单次运行成本对比。
推荐理由:作者给出同一基准下的成本对比和多模型路由配置,便于判断自托管 agent harness 的实际取舍。
英伟达将出资最高1050亿美元支持美国俄亥俄州的数据中心建设。该消息由 The New York Times 报道。
推荐理由:英伟达以最高1050亿美元支持俄亥俄州数据中心建设,折射出AI算力基建的资本投入量级。
英伟达与KKR、阿波罗等投资机构签约,由机构出资5000亿美元建设数据中心,英伟达提供部分租金与残值担保,以锁定长期芯片订单。首个项目位于美国俄亥俄州朴茨茅斯的PORTS-Pike园区,租户为OpenAI,供电规模4.25吉瓦,采用英伟达DSX全栈AI工厂平台。
推荐理由:原文拆解英伟达为OpenAI数据中心提供担保的商业逻辑,读者可借此看清算力融资如何锁定长期芯片订单。
LMSYS 与生态伙伴发布 Miles v0.1,一个基于 slime 设计的全栈生产级后训练系统,目标是让前沿规模 RL 训练更易用。
推荐理由:官方完整走读 Miles 的 RL 训练环路与关键数字,读者可据此评估它是否适合承担自己的前沿规模后训练任务。


推荐理由:OpenAI 在俄亥俄州的数据中心协议给出了项目规模,以及面向学生提供 Codex 额度的具体安排。
OpenAI 达成协议在俄亥俄州锁定约 8 GW AI 算力,SB Energy 将以 20 年租约建设、拥有并运营 PORTS-Pike 数据中心,园区将全部承载 NVIDIA 算力。
推荐理由:从 8 GW 容量、20 年租约到 NVIDIA 15 亿美元投资,可以看出 OpenAI 自建算力的具体规模与合作结构。
英伟达宣布与SB Energy合作,在美国俄亥俄州PORTS-Pike园区锁定土地、电力和厂房资源,建设由OpenAI租用、全面采用英伟达DSX AI工厂平台的AI工厂,首期部署最多提供4.25吉瓦容量。
推荐理由:英伟达把芯片供应链的锁定打法复制到土地与电力,读者可看到算力扩张的瓶颈正转向基建资源。
黄仁勋 8 月 17 日通过英伟达官方博客表示,OpenAI 已承诺在 2030 年前大规模部署英伟达 AI 基础设施,现有和计划中的部署合计约 12GW 算力,对应约 6,000 亿美元业务机会。
推荐理由:黄仁勋披露 OpenAI 到 2030 年的算力部署承诺与对应收入量级,可看到英伟达锁定 AI 工厂土地电力资源的思路。
推荐理由:这条把英伟达用信用支持换独家算力落地的交易结构讲清楚了,也点出需求走弱时的反向风险。
英伟达与 SB Energy 合作,在俄亥俄州 PORTS-Pike 科技园区锁定 LPS 产能用于承载英伟达算力,OpenAI 将作为租户入驻。初期部署预计提供 4.25 吉瓦 AI 工厂容量,英伟达为其中约 4 吉瓦的 LPS 基础设施提供 20 年期担保,担保随数据中心在 2028 至 2030 年分阶段投用生效。
推荐理由:文中给出英伟达为 PORTS-Pike 站点担保的具体范围与分期时间,读者可据此理解 AI 基建融资的结构。
xAI 宣布 Grok 系列基础模型的 API 进入公开测试,开发者可在 console.x.ai 注册后调用,首发的预览模型 grok-beta 支持 128,000 token 上下文、函数调用和系统提示词。
推荐理由:xAI 开放 Grok API 公测并给出兼容 OpenAI 的迁移路径,开发者可据此评估接入成本。