最新精选
第 141–160 条 · 共 231 条SGLang 与 Meta Superintelligence Labs 合作,为 Muse Glimmer 提供 Day-0 支持。Muse Glimmer 是 30B 参数多模态稠密模型,拥有 128k+ token 上下文窗口,架构含 27.9B 文本解码器、1.9B ViT 和多模态 projector。
推荐理由:原文给出多平台实测吞吐与量化方案,读者可据此评估在本地硬件跑智能体工作流的可行性。
Jeff Dean 宣布明天是他在 Google 的最后一天,将与 Sanjay Ghemawat、Oriol Vinyals 和 Quoc Le 共同创立聚焦机器学习、科学和工程前沿研究的公益性公司 Discovery Loop,Google 将作为创始投资方和云计算合作伙伴继续合作。
推荐理由:Jeff Dean 在离职前夕的访谈中复盘了自己对 AI 进展速度的误判,并给出推理硬件与创业领域选择的具体判断依据。
OpenRouter 官方详解治理团队 AI 支出的 6 项控制:per-key 信用限额、guardrails、workspace 预算、presets、组织角色和 Activity 仪表盘,分别覆盖花多少、花在哪和谁在花。
推荐理由:官方详解 6 项团队支出控制的功能边界和叠加规则,读者可按团队规模选择最省成本的控制组合。
Liquid AI 发布 LFM2.5-2.6B,一款可完全在设备端运行的智能体模型,支持工具调用与多步工作流,预训练约 34T tokens,中期训练将上下文窗口扩展至 128K。
推荐理由:官方给出与约 4 倍参数量模型的逐项基准对比和 CPU 解码速度,可供判断端侧智能体的可用边界。
OpenAI 下调 GPT-5.6 系列价格:Terra 降价 20%,Luna 降价 80%,Luna 现为每百万 token 输入 $0.20、输出 $1.20,低于 Google Gemini 3.1 Flash-Lite,也降到 Claude Haiku 4.5 输入价的五分之一。
推荐理由:Luna 降价后输入价格低于 Gemini 3.1 Flash-Lite 与 Claude Haiku 4.5,读者可据此重新评估低价模型的选型。
Cursor 团队分享如何为云端智能体搭建开发环境,让智能体能在其单体仓库中运行和测试代码。做法包括用 Dockerfile 统一 Ubuntu VM 环境、构建 anydev CLI 简化智能体操作、通过 Cursor Cloud MCP 和 Cloud Doctor 实现环境自愈与持续优化。云端智能体编写 PR 的占比从去年 12 月的约十分之一升至今日的超过一半。
推荐理由:Cursor 团队分享了自家云端智能体环境的搭建细节,含 anydev CLI 和 Cloud Doctor 等可借鉴做法。
Microsoft 提出行业下一个焦点是 token 效率,主张通过联合优化模型、harness 和 RL 环境为具体产品调校模型,而非所有任务都用前沿通用模型。
推荐理由:Microsoft 官方阐述 token 效率策略,用多款 MAI Flash 模型的实际成本数据说明如何按任务匹配模型规模。
ByteByteGo 访谈 OpenAI 工程师,详解 Codex 与 ChatGPT Work 背后的智能体循环如何在 harness、API 和推理三层做效率优化。
推荐理由:沿一次请求穿过的三层链路,拆解 OpenAI 在 harness、API 与推理层的具体优化手法,可迁移到自建 Agent 系统。
微软最新财报显示 Azure 同比增长 43%、年收入首次突破 1000 亿美元,同期 Google Cloud 增速达 82%。作者认为 Google 自有模型并自研芯片,云业务营业利润率从 20.7% 升至 35.6%,而微软主要采购商用芯片,等于为每份增量负载支付他人利润。
推荐理由:对比三朵云的增速与利润率差异,读者可看清自研芯片与租用算力带来的成本结构分野。
微软 FY26 Q4 财报显示 Azure 增长 43%、全年 Azure 收入首次超过 $100b,商业 RPO 达到 $678b,同期 Google Cloud 增长 82%。
推荐理由:对比三家云厂商的增速与资本开支结构,说明微软转售前沿模型与谷歌自持芯片栈的经济差异。
月之暗面于 2026 年 7 月 27 日正式开源 Kimi K3,总参数量达 2.8 万亿。华为宣布昇腾实现 0day 极速适配,训练侧基于 MindSpeed MM 在 Atlas 800 A3、Atlas 900 A3 SuperPoD 上完成减层训练基础功能适配。
推荐理由:原文给出昇腾对 Kimi K3 的训练与推理适配细节,读者可了解国产算力与开源大模型的协同路径。
月之暗面于 7 月 27 日晚开放 Kimi K3 的模型权重、技术报告和关键 Infra 技术,Anthropic 联合创始人兼 CEO Dario Amodei 随后发文回应称,Anthropic 从未主张禁止开放权重模型。
推荐理由:材料把 K3 开源所需的千万级硬件门槛与开放权重政策争论并置,读者可据此判断开源模型的实际使用边界。
SGLang 和 Miles 发布对 Kimi K3 的 Day-0 支持,分别覆盖推理与 RL 训练。K3 为 2.8T 参数的 3 万亿参数级首个开源模型,采用 69 层 KDA 线性注意力与 24 层 MLA 的混合架构和 1M token 上下文窗口。
推荐理由:原文由 SGLang 团队自述 Day-0 支持的实现细节,给出内存管理、投机解码与并行策略的具体方案和实测数字,可迁移到异构注意力架构的部署。
Runway 推出面向专业开发者和企业团队的 AI 媒体平台 Runway Dev,现已可用,入口为 dev.runwayml.com。
推荐理由:原文列出了四大能力和企业级安全条款,开发者可以据此评估是否用单一平台替代多个媒体 API 的拼装方案。
Hugging Face 宣布 Diffusers 原生支持 Nunchaku Lite,通过 from_pretrained() 直接加载 Nunchaku(SVDQuant)W4A4 量化检查点,无需单独推理引擎或本地 CUDA 编译。
推荐理由:官方介绍 Diffusers 原生加载 Nunchaku Lite 4-bit 检查点,附基准数据与自行量化发布流程,可迁移到消费级 GPU 部署。
OpenAI 计划斥资 200 亿美元在佐治亚州萨凡纳附近建设一座超大规模数据中心,并已与佐治亚电力公司签约,在埃芬汉县园区争取到 3.2 吉瓦能源。预计 2028 年起数百兆瓦电力率先投用,建设持续到 2032 年,OpenAI 计算战略副总裁萨钦·卡蒂称满负荷总成本可能超过 300 亿美元。
推荐理由:OpenAI 把 2030 年前的算力支出预期从约 6000 亿美元上调至近 7500 亿美元,可据此观察其算力投入节奏。
Sierra 分享为内部 agent 搭建 MCP Gateway 的七条经验,包括抓住所有权减少协调、用 mcp-gateway.md 提升编码 agent 一次成功率、多阶段流程防止跨客户数据访问,以及优先用 gh CLI 等 agent 熟悉的工具。目前 89% 的 Sierra 员工通过它连接 45 个服务,近三分之二提交来自社区。
推荐理由:Sierra 工程师复盘 MCP Gateway 建设全程,给出协作机制、权限审计和工具取舍七条可迁移经验。
OpenRouter 上线 POST /api/v1/audio/transcriptions 音频转写端点,复用 Chat Completions 的同一 API key 和鉴权。
推荐理由:官方教程给出了完整的请求参数、限制和计费细节,读者可以直接照抄接入而不必自建 Whisper 服务。
OpenRouter 发布教程讲解提示词缓存与粘性路由如何降低 Agent 多轮成本。缓存读取为输入价格的 0.1x 到 0.5x,Anthropic 缓存写入为 1.25x(5 分钟 TTL)或 2.0x(1 小时 TTL),未被复用的单次写入比不缓存更贵。
推荐理由:原文给出各厂商缓存读写倍率、session_id 粘性路由用法和缓存未命中排查方法,读者可以直接照做降低 Agent 多轮成本。
Sierra 发布内部云 Agent 平台 Pinecone,让员工在浏览器、Slack、Linear 或手机上创建、共享和自动化云端智能体会话。每个会话约一秒内获得带代码仓库、构建缓存和开发服务的隔离环境,并提供多人协作、自动盯 PR、定时自动化、可复用 Skills 和多会话 Projects 等能力。
推荐理由:Sierra 官方复盘自研内部云 Agent 的架构与经验,读者可以从中了解企业如何沉淀员工工作智慧并组织智能体协作。