Uber 公开内部 AI 软件工厂:超七成 PR 交给 Agent,每会话成本降 52%
Uber 内部超过七成的代码 PR 已由 AI Agent 完成,工程师构建了 3600 多个 Agent 技能,每天执行超过 3 万次。
推荐理由:原文拆解了 Uber 把七成 PR 交给 Agent 后仍能压低成本的具体做法,包括模型选型、上下文压缩与成本追踪体系。
把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。
当前仅显示精选新闻Uber 内部超过七成的代码 PR 已由 AI Agent 完成,工程师构建了 3600 多个 Agent 技能,每天执行超过 3 万次。
推荐理由:原文拆解了 Uber 把七成 PR 交给 Agent 后仍能压低成本的具体做法,包括模型选型、上下文压缩与成本追踪体系。
推荐理由:Uber 公开了用量涨近 10 倍而账单不涨的具体工程做法,其中子 Agent 分工与工具按需挂载等杠杆可直接参考。
Meta 代号 OT 的组织转型计划曾设想用 AI Agent 接管数千人的日常工作,部分团队削减 60% 人力,但第一轮裁员后内部代码变更同比增长 220% 而真正触达用户的变更仅增 36%,AI Agent 造成的重大技术和安全事故较上一年增加 40%,员工处理这些问题的时间增加多达 70%,扎克伯格在 5 月 19 日晚取消了原定 11 月的第二轮裁员。
推荐理由:Meta 内部用 Agent 替代员工的转型计划,给出了事故率上升四成、救火时间增加七成等具体量化后果,可供评估 Agent 落地边界。
SGLang 将 SSD-LLaMA 的核心思路引入 MoE 推理,把放不进 VRAM 和内存的路由专家权重放在 NVMe SSD 上,通过 Expert Pack 连续布局、O_DIRECT 直接 I/O、pinned 暂存和 GPU 缓存,只加载 router 选中的专家。
推荐理由:原文给出完整机制说明和单卡实测数据,读者可以据此评估 NVMe SSD 承载超大 MoE 模型的可行性。
Quick reminder: in 4 hours you will be able to download and run sota AI. If you have enough compute ofc. What a time to be alive. https://t.co/T6bs1VnVG1
推荐理由:GLM-5.3 上线后给出了各量化档位的显存与硬件门槛,可供本地部署选型参考。
阿里千问于 8 月 26 日晚开源 Qwen3.8-Flash-Next 权重,生产版 Qwen3.8-Flash 同步上线千问 AI 平台 API,官方称这套 Next 架构是 Qwen4 系列的雏形。
推荐理由:作者在 Qoder 中实测了这款每 token 仅激活 6B 的 MoE 模型,并拆解其稀疏注意力与外挂 N-gram 表的设计取舍。
阿里开源 Qwen3.8-Flash-Next 全部权重,这是 Qwen4 新架构的早期预览版,采用 125B 参数 MoE 配 6B 激活参数,并附加 51B 的 N-gram Embedding 参数。
推荐理由:原文给出了新架构的权重配置与 N-gram 嵌入设计细节,可据此了解消费级硬件部署百亿级 MoE 的路径。
Linear 宣布完成从 styled-components 到 StyleX 的迁移,历时逾 1000 个 PR。迁移动机包括 styled-components 进入维护模式、React 18 并发渲染下的性能回归,以及团队希望为 Agent 参与代码库建立更清晰的样式边界。
推荐理由:Linear 团队亲历者复盘超千个 PR 的迁移过程,给出可迁移的确定性工具加 Agent 加人工判断的方法和降险步骤。
智谱发布 GLM-5.3-Flash,即一周来在 OpenRouter 和 OpenCode 上匿名测试的 OX Alpha。该模型总参数 320B、每次激活 18B,是 GLM-5 系列首个原生多模态模型,支持图像、视频和文本输入,原生上下文 100 万,使用 30 万亿 Token 多模态数据预训练。
推荐理由:模型定价与国产卡推理规模是这篇实测里最值得看的两点,读者可据此判断日常任务的模型选择。
阿里 Qwen 团队发布开源权重多模态 MoE 模型 Qwen3.8-Flash-Next,主模型 125B,每 token 仅激活 6B 参数,被定位为 Qwen4 架构的早期预览。
推荐理由:读者可借 6B 激活参数与训练成本对照,判断开源多模态模型在编码和智能体任务上的取舍。
阿里发布 Qwen3.8-Flash,并在 Hugging Face 与 ModelScope 开放同一模型的 Qwen3.8-Flash-Next 权重,主模型 125B 参数、每 token 仅激活 6B,千问 AI 平台定价为每百万 token 输入 1 元、输出 3 元。
推荐理由:文章拆解了 Qwen3.8-Flash 在注意力、残差与嵌入上的四处架构改动,并把它放进每任务成本的行业对比框架里。
OpenAI 公布自研推理芯片 Jalapeño 的实测结果,在 GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T 上,峰值每瓦吞吐量达到对比系统的 1.5 至 1.9 倍,端到端延迟优于对手 1.7 至 3.6 倍。
推荐理由:OpenAI 公布自研推理芯片的实测对标数据,可看到模型公司自研算力对现有 GPU 与软件生态的实际冲击。
OpenAI 在 Hot Chips 2026 大会上公开自研推理芯片小辣椒,SemiAnalysis 受邀到其实验室用 InferenceX 实测,结论是这颗第一代芯片在多个开源模型上击败了能测到的英伟达、AMD 和谷歌芯片。
推荐理由:文章给出 SemiAnalysis 现场实测的能效与时延数据,并交代了单 token 预测等对比口径的限制。
推荐理由:SemiAnalysis 对 Jalapeño 设计与性能主张的梳理,可作为观察算力瓶颈从成本转向电力的一个切口。
OpenAI 于 8 月 25 日发布博文展示其自研 AI 推理芯片 Jalapeño,并用 SemiAnalysis 的 InferenceX 基准测试了 GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T 三款模型。
推荐理由:官方基准显示 Jalapeño 的推理能效比 GB300 高约 1.5 至 1.7 倍,可据此观察自研 ASIC 对算力成本结构的影响。
Holy: OpenAI says its first custom inference chip is already beating Nvidia GB200 and GB300 systems on speed and efficiency. Across GPT‑OSS 120B, DeepSeek R1 670B, and Kimi K2.5 1T, Jalapeño delivered 1.5–1.9× more AI work per watt at peak throughput and 1.7–3.6× lower end-to-end latency in OpenAI’s own InferenceX testing! For highly interactive workloads, OpenAI reports 2.1–4.1× higher performance. The chip is rated at 700 watts, but remained at or below 550 watts during the tested workloads. OpenAI plans to begin deploying Jalapeño by the end of 2026. Gen 2 is already deep in development, with Gen 3 taking shape. Probably thats why Tibo said that in 1-2 years 750token/s will be the default
推荐理由:原文给出 GPT-Astra 用 Codex 生成 kernel 的具体加速数据,读者可据此了解 AI 编写底层算子的表现。
SGLang 团队与 Qwen、NVIDIA、AMD 合作,为 Qwen 团队开源的多模态 MoE 模型 Qwen3.8-Flash-Next 提供 day-0 支持。
推荐理由:原文详解了 SGLang 对 Qwen3.8-Flash-Next 的 day-0 支持与架构实现细节,含量化检查点和实测吞吐数据,对部署选型有参考价值。
OpenRouter 发布模型选型教程,提出六步框架:定义任务、用实时使用数据和第三方基准筛选候选、对比各提供商价格与延迟、用自己的提示词测试、按每次完成任务的成本而非每 token 成本衡量,再决定或改用 openrouter/auto-beta 按请求路由。
推荐理由:OpenRouter 官方给出以成本每完成任务为核心的选型框架,并用自家 MCP 服务器让整个评测流程在编辑器内完成。
Hugging Face 在 Gradio 中内置 gr.Workflow,将 AI 应用管线描述为带类型的节点图,在同一画布上提供可运行节点、可视化中间结果、REST API 和一键部署到 Hugging Face Spaces。
推荐理由:官方介绍了 gr.Workflow 的节点图机制和多条可复制的示例工作流,读者可以据此评估它能否替代手工拼装 Python 管线。
Republicans now see AI data centers as an electoral liability. In a private memo to leading AI firms, the Senate Republican campaign arm says public anger over U.S. data centers is threatening the party’s chances of keeping an important Ohio seat. It says Democrats have made data centers a major part of their effort to defeat Sen. Jon Husted (R-OH), and that strategy appears to be working with public. "If voters' perceptions of data centers are not fixed quickly, the campaign against them will expand far beyond Ohio." Republicans fear data-center backlash in Ohio could spread into a nationwide AI infrastructure constraint.
推荐理由:作者汇总了美国地方层面针对数据中心的具体处置与禁令数量变化,可看到 AI 基建落地正面对社区与政治阻力。