DeepSeek 发布 DeepSeek-V4.1-Flash,支持 1M 上下文与 FP4 KV 缓存
DeepSeek 发布多模态 MoE 模型 DeepSeek-V4.1-Flash,具备 1M token 上下文窗口,全局 KV 缓存占用约 890 字节每 token,约为 DeepSeek-V4-Flash 的 1/4。
推荐理由:DeepSeek-V4.1-Flash 把全局 KV 缓存压到 890 字节每 token,长上下文推理的部署成本变化构成主要看点。
把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。
当前仅显示精选新闻DeepSeek 发布多模态 MoE 模型 DeepSeek-V4.1-Flash,具备 1M token 上下文窗口,全局 KV 缓存占用约 890 字节每 token,约为 DeepSeek-V4-Flash 的 1/4。
推荐理由:DeepSeek-V4.1-Flash 把全局 KV 缓存压到 890 字节每 token,长上下文推理的部署成本变化构成主要看点。
OpenRouter 发布 Fusion 复合推理系统,调用模型可将提示词并行发给 1 至 8 个专家模型,由 judge 对比共识与分歧后生成结构化分析,再写出最终答案。
推荐理由:原文给出成本、延迟和适用场景的量化说明,读者可据此判断多模型研讨是否值得接入现有工作流。
Hugging Face 团队用 gr.Workflow 将 AUTOMATIC1111 的主要功能重建为 Workflow1111,画布包含 11 条媒体管线。
推荐理由:原文拆解了 11 条媒体管线和 73 个节点的具体构成,展示了 Gradio Workflow 混搭多模型并自动生成 REST 与 MCP 端点的做法。
SGLang 与 Miles 团队宣布为 DeepSeek-V4.1 提供 Day-0 支持,讲解其 SWA、mHC、Engram 记忆等架构及推理与 RL 训练优化。
推荐理由:原文详解 SGLang 与 Miles 对 DeepSeek-V4.1 的 Day-0 支持,给出 Engram offload、bounded replay 等实测数字和可复现配置。
Anthropic 在 Claude Blog 给出 Claude Platform 的成本优化指南,称通过提高提示词缓存命中率、清理升级前沿模型时的提示词反模式以及按任务校准 effort,可在不牺牲性能的前提下降低 API 成本。
推荐理由:原文给出缓存、指令清理与 effort 校准三条降本杠杆及对应命令,读者可对照自身调用成本自查。
OpenRouter 发布美国区域路由 us.openrouter.ai,与去年 10 月上线的 eu.openrouter.ai 配套,请求在区域内解密并只路由到区域内提供商,全程不出区。
推荐理由:原文区分了推理级与端到端区域路由的差异,并说明区域域名、404 行为和 Guardrails 配置,读者可直接评估合规用法。
inclusionAI 发布 Ling-3.0-flash-VL 原生多模态模型,总参数 124B,每 token 仅激活 5.5B,支持图像和视频输入,上下文窗口最高 256K tokens。
推荐理由:模型卡给出 124B 总参数、5.5B 激活的稀疏 MoE 设计与多模态基准表现,可据此判断其效率取向。
OpenRouter 发布 openrouter:shell 服务端工具、openrouter:bash 工具和 Files API,让平台上任意支持工具调用的模型都能在托管 Linux 容器中执行命令,目前以 beta 提供。
推荐理由:原文给出了定价、容器网络与文件管理等具体配置细节,可帮助读者评估在现有 Agent 工作流中如何复用这套服务端沙箱。
推荐理由:转述 Bloomberg 的报道呈现国产算力供应与部署选择的现状,读者可据此了解算力紧缺对模型运行的影响。
GitHub 发布 Project HydraFusion 研究预览,通过运行时多模型编排提供前沿级编码质量,所有 GitHub Copilot 计划用户可在 Copilot CLI 通过 /experimental 使用。
推荐理由:原文给出三种执行模式和三项基准的质量与成本数据,读者可以据此评估多模型编排对现有编码工作流的适用性。


推荐理由:报道给出 16 万颗芯片的规模与 950DT 的规格与排期,可据此观察国产算力承接推理负载的进度。
NVIDIA 在 IFA 2026 宣布与 Microsoft 及合作伙伴推出面向本地 AI 的推理优化和智能体工具,并预告 10 月上市的新款 RTX Spark Windows PC。
推荐理由:原文列出多款智能体应用的一键本地配置路径与推理吞吐提升数据,读者可据此估量本地部署门槛的变化。
推荐理由:推文用一张土地权属图拆解了 8 GW 项目中 DOE 土地与私人地块的边界,让读者看清联邦土地在数据中心建设中的实际角色。
SemiAnalysis 根据文件指出,这座 8 GW 数据中心园区至少横跨三块地块,各自的开发路径并不相同。
推荐理由:从土地权属与审批文件看,园区被拆成三条开发路径,读者可据此判断各阶段的落地节奏。
Anthropic 发布一份商业智能体构建指南,并开源参考实现 anthropics/commerce-agents,内含零售、旅游、电信和票务平台的购物智能体与商家智能体示例。
推荐理由:Anthropic 给出商业智能体的三层架构与可运行参考实现,读者可据此对照自身的技能划分与评测设计。
Cursor 发布自托管机器功能,云端智能体可以运行在团队自管的机器资源池上,智能体循环、推理与规划仍留在 Cursor 云端。工具执行则转移到自有环境中的机器:安装 Cursor CLI 并运行 agent worker start 建立通往 Cursor 云端的出站 HTTPS 长连接,Cursor 从不主动向用户网络发起连接。
推荐理由:自托管机器把工具执行环境交回团队自有基础设施,推理与编排仍留在 Cursor 云端,读者可据此判断适用边界。
Cursor 发布自托管机器功能,云端智能体的工具执行可迁移到团队自管的基础设施上,而智能体循环、推理和规划仍留在 Cursor 云端。
推荐理由:官方给出自托管机器的适用场景判断方法和扩缩容、休眠等机制细节,团队可以据此评估智能体是否迁入自有基础设施。
Google for Startups AI Agents Challenge 评选结束后,官方从高分提交中总结出四种工程模式:双向 MCP、事件驱动并发、同标准降级(Gemini 3.1 Pro 503 时回退 Gemini 3.6 Flash 并共用同一校验函数)、以及模型调用前的分层路由。
推荐理由:文章从真实参赛代码中提炼四个可复用的工程模式,覆盖工具暴露、并发、降级校验和分层路由,可直接迁移到自己的智能体项目。


🚀 Hy4 preview is here. 770B, 49B active, 1M context. Built for productivity. Open source frontier. Consistent affordable price. Use it. Tell us what breaks. More on Hy blog:https://t.co/rbl1IWRk3C HuggingFace:https://t.co/mE9wevH5XR Github:https://t.co/pyl9zckpoL https://t.co/4iW6gSuZKr
推荐理由:官方给出模型自主定位推理瓶颈并完成优化的具体数字,可供观察自我优化在推理侧的落地方式。
Hugging Face WebAI 团队发布 @huggingface/kernels 库,可从 Hub 加载和运行优化的 WebGPU 内核,首批提供 207 个内核,Apache-2.0 许可。
推荐理由:官方给出了与 ORT WebGPU 的对比数字和浏览器端众测入口,读者可据此评估浏览器本地推理的可用性。