在 TPU 上加速视频扩散模型的时空注意力
Google 分享了在 TPU 上把视频扩散模型稀疏注意力从理论稀疏转化为端到端加速的案例研究。81 帧 720p 视频的序列长度达 50K 至 400K,从 720p 升到 1440p 序列长度翻两番,全注意力在单层延迟中占比可从 55.5% 升至 88.2%。
developers.googleblog.com · 网站与博客
Google 分享了在 TPU 上把视频扩散模型稀疏注意力从理论稀疏转化为端到端加速的案例研究。81 帧 720p 视频的序列长度达 50K 至 400K,从 720p 升到 1440p 序列长度翻两番,全注意力在单层延迟中占比可从 55.5% 升至 88.2%。
Google 团队在 MaxText/JAX 和 Google Cloud TPU 上从零复现了 Ai2 的 Olmo 3 7B,覆盖 stage-1 预训练(约5.93T token)和 stage-2 中期训练 anneal,held-out C4 loss 与 8 项下游任务均与 Ai2 参考持平。
Google Cloud API Gateway 进入 Public Preview,可充当远程 MCP 服务器,无需单独搭建 MCP 服务器即可把现有 REST 操作变成智能体可调用的 MCP 工具。
推荐理由:官方宣布 API Gateway 可直接充当远程 MCP 服务器,复用既有鉴权与配额,无需另建 MCP 服务器,适合评估 Agent 接入现有 API 的路径。
Google 宣布 Antigravity SDK 支持本地工作流,首发支持通过 Google AI Edge 的 LiteRT 运行 Gemma 4 26B A4B,可完全离线提供智能体能力,建议机器配备 24GB 以上 VRAM 或统一内存。
推荐理由:原文给出本地运行智能体的具体配置方法和混合编排演示数据,开发者可以直接照此把智能体工作流搬到本地 GPU 上。
Google AI 订阅用户现可直接获得 Colab 高级权益,包括优先使用更快的加速器和更强算力的机器。Google AI Ultra 订阅者还可解锁不间断后台执行和 Premium GPU 访问,长时间训练无需保持浏览器标签页开启。该权益将在未来几周内向 Colab 支持国家的 Google AI 订阅用户逐步推送,已有 Colab 订阅不受影响。
Google 宣布与 Speakeasy 合作,将 Speakeasy 的 OpenAPI 客户端生成套件以 AGPLv3 开源。此前 Google 用于生成 GenAI SDK(Interactions、Agents、Webhooks API)的闭源生成器在 2026 年 5 月被收购并突然关停,促使双方迁移到开源方案。
Gemini Enterprise Agent Platform 推出 Agent Anomaly Detection 私密预览,这是一个基于推理的智能体监督与审计层,通过分析 reasoning traces、工具调用和执行流程识别行为异常、可疑意图与策略违规。
Google Developers Blog 发布零信任 Agent 系列第二篇,将安全检查从构建时移到 Gemini Enterprise Agent Platform 的运行时。
Google 推出 autofinetune,将自主研究循环用于 LLM 后训练,基于 Tunix、Gemma 和 Cloud TPU,由 Antigravity CLI 与 Gemini Flash 3.7 编排。
针对 AI 编程智能体评测,Google 提出用行为评测替代 Terminal-Bench、DeepSWE 等端到端基准的复合分数,直接断言工具调用等中间执行步骤。
Google 发布 Agent Development Kit (ADK) for Kotlin 1.0 正式版,实现与 ADK Python 和 Java 的完全功能对齐,并提供面向 Android 的端侧扩展。
Google Cloud 的 Gemini Enterprise DevEx 计划本轮聚焦智能体治理,梳理出从配置受治理的智能体身份、注册 Agent Registry、绑定 Agent Gateway,到执行策略与内容安全、验证端到端执行的五步工作流。
Google for Startups AI Agents Challenge 评选结束后,官方从高分提交中总结出四种工程模式:双向 MCP、事件驱动并发、同标准降级(Gemini 3.1 Pro 503 时回退 Gemini 3.6 Flash 并共用同一校验函数)、以及模型调用前的分层路由。
推荐理由:文章从真实参赛代码中提炼四个可复用的工程模式,覆盖工具暴露、并发、降级校验和分层路由,可直接迁移到自己的智能体项目。
Google 开发者博客介绍深度学习在天体粒子物理中的应用:Pierre Auger 天文台用 1500 多个探测器站覆盖 3000 平方公里,IceCube 以约 1 立方公里南极冰探测中微子,这些观测设施的空间分布传感器记录波形数据,结构类似图像,适合用深度学习分析。文章聚焦深度学习如何提升仪器灵敏度、发现隐藏模式并搜寻信号异常。
Google Cloud 将原生 TPU 支持集成进 vLLM,用于在 Cloud TPU 上服务 Qwen3-Embedding 系列嵌入模型,支持 4K+ token 文本与 15K+ token 多模态输入的长上下文。团队针对 TPU 做了词表 padding、懒加载初始化与 StepPool 长上下文等优化,并以余弦相似度验证数值一致性,文本目标阈值 ≥0.999、多模态 ≥0.995。
Google 在 ADK 中推出原生实时(live)评测能力,可用模拟用户以音频形式与语音 Agent 对话并对口头回复打分。
Google Cloud API Gateway 新增模型路由功能,进入 Public Preview,开发者可在 OpenAPI 3.x 规范中把虚拟模型名映射到共享主机上的具体后端,动态将流量路由至 Gemini、Claude 或 OpenAI OSS-GPT,无需硬编码端点或自建开源代理。
工程师为在 Ironwood TPU 上部署 397B 参数的 Qwen 3.5 MoE 模型,构建了模块化 JAX/Pallas 优化栈,使 prefill 密集型负载的推理速度最高提升 4.7 倍。
Gemini Enterprise Agent Platform 的智能体与模型评估服务现已正式可用,为开发者提供统一引擎,在本地开发实验与线上生产流量中一致衡量智能体质量。
推荐理由:评估服务正式可用并给出 20 多项指标与接入入口,读者可据此判断智能体评测如何融入现有开发流程。
Google Cloud 与 Parallel Web Systems 合作,将 Parallel 的搜索基础设施作为网页接地(grounding)提供商原生集成到 Gemini Enterprise Agent Platform,让开发者用可验证的实时网页结果锚定 AI 智能体,提升复杂企业工作流的事实准确性。该合作还支持以编程方式提取、永久缓存并处理网页数据,并可与其他大语言模型配合使用。
Google 推出 JAX 原生后训练库 Tunix,用于消除训练多轮、工具调用型 LLM 推理智能体时的 TPU 闲置瓶颈。它通过高并发异步 rollout 与解耦的生产者-消费者流水线提升硬件吞吐,让训练器在智能体等待网络 I/O 或环境步骤时仍持续获得数据。Tunix 还提供即插即用抽象与持续的宏观层面 profiling,便于接入自定义开源环境并优化分布式工作流。
LiteRT 与轻量级 Gemma 开源模型组合,可在树莓派上部署安全、实时的边缘 AI。LiteRT 优化 CPU 与 GPU 性能,为 Gemma4 等模型带来快速 token 速度,支持机器人实时本地推理。开发者可用轻量级 LiteRT CLI 工具快速转换、量化并运行这些模型,对 Hailo AI 加速器的支持也即将推出。
Google 开源 TPU 微基准测试套件,可从 Network、Compute、HBM、Host Transfer 和 Attention 五个组件提供细粒度性能指标,用于验证真实硬件能力。借助这些基准建立 Roofline 模型,工程师能判断机器学习负载受限于计算、内存还是网络,并据此开展 kernel 调优、mesh 分片和重计算等针对性优化,提升大规模模型部署的硬件利用率。
实时 AI 智能体依赖长连接、有状态的双向流,使传统请求-响应式负载均衡无法反映服务器真实容量。开发者需在运行时内实现应用层会话追踪,准确统计活跃对话的并发负载,并将精确会话数与 CPU 利用率一并输入混合路由算法,从而有效分发有状态 AI 流量,避免单个后端成为瓶颈。
Google 开发者专家在 Google I/O 后利用 Antigravity 和 Gemini 构建了一款 AI 赛车教练,用于弥合领域差距。该工具的具体参数、性能数据及可用性尚未披露。
MCP 2026-07-28 规范用完全无状态核心取代旧有有状态约束,支持云原生横向扩展、serverless 部署和标准轮询负载均衡。该架构引入标准化 HTTP 头以便在无需深度包检测的情况下路由,并加入缓存控制与 Multi Round-Trip Requests(MRTR)来处理交互式和长时间运行任务。
Genkit Go 引入基于渐进式披露架构的 Agent Skills,开发者可将专用指令、脚本和参考资料打包成模块化 SKILL.md 技能包,初始仅向智能体系统提示词暴露 frontmatter 元数据。当任务匹配技能描述时,Genkit 中间件动态加载完整指令正文与相关资源,从而避免上下文窗口膨胀并降低 token 消耗。
Conductor 从 Gemini CLI 扩展升级为可移植插件,将对话式规格驱动开发(SDD)带入 Antigravity CLI 和 Claude 等生态。开发者无需依赖严格命令序列,可自然对话,由 AI 助手在后台动态管理 spec.md、plan.md 等持久化 markdown 产物。该更新消除了工作流摩擦,并让仓库成为跨 AI 工具、受版本控制的项目架构与状态唯一来源。
Ray 2.55 引入对 Google Cloud TPU 的官方一级支持,开发者可用熟悉的 Ray task 与 actor API 在 TPU 上运行分布式 Python 工作负载。
Ray 的高层库 Serve、Data 和 Train 可简化在 Google TPU 切片上运行 AI 工作负载。Ray Serve 通过简单的拓扑配置对大型多主机模型进行正确的成组调度,Ray Data 以原生 JAX batch 直接向加速器供数,消除数据加载瓶颈。JaxTrainer 则自动处理跨切片协调、checkpoint 与容错,简化 TPU 上的分布式训练。
Agent Plugins 1.0.0 是一项厂商中立的目录规范,由 Google、Amazon、Microsoft 等支持,可将 Agent Skills 与 MCP server 打包成单一可移植单元。
推荐理由:规范统一了 Agent Skills 与 MCP server 的打包方式,读者可据此判断跨 IDE 兼容的成本。
Google 开源了一个基于 Agent Development Kit 和 Gemini 的零信任客服退款智能体参考实现,展示单条提示词注入即可触发越权退款和环境变量泄露。
推荐理由:原文用可运行的开源示例拆解智能体三层零信任防护,读者可以照着在自己的 ADK 工作流里落地签名、沙箱和网关。
HeyGen 与 Google Cloud 合作,把其 18B 参数以上的数字人视频扩散模型 Avatar IV 移植到八芯片 Trillium(v6e)主机上,速度达到首个可用版本的 1.86 倍。
Google 发布开源 C++ 库 Credentio,用于处理 C2PA Content Credentials,先支持规范 2.2 和 2.4 版本。该库支持完全本地验证,无需将媒体文件传到云端,零带宽开销、即时返回结果并保持数据隐私;验证大文件时内存占用较小,可配置官方或自定义 C2PA 信任列表,深入解析清单、断言、数字签名和声明结构,并给出详细的验证报告。
Google 发文论证 Go 是 AI 辅助软件工程的理想语言:当 AI 智能体可秒级生成数百行代码,开发者重心从编写转向审查与维护,语言的可读性和工具链一致性变得更重要。Go 自带格式化、测试框架、依赖管理与安全工具,能让 AI 更快、更便宜、更可靠地处理代码,并减少上下文窗口污染与 token 成本。