Google Research 2024 年度回顾:从 Transformer 推理到量子纠错
Google Research 发布 2024 年度回顾,汇总了从算法理论到量子计算的多项研究进展。其中,研究团队通过图算法理解 Transformer 的推理能力,并将视频掩码自编码器扩展至 128 帧。此外,AMIE 向专科护理和真实世界验证推进,量子纠错也取得进展。
媒体报道、公司博客与研究文章
Google Research 发布 2024 年度回顾,汇总了从算法理论到量子计算的多项研究进展。其中,研究团队通过图算法理解 Transformer 的推理能力,并将视频掩码自编码器扩展至 128 帧。此外,AMIE 向专科护理和真实世界验证推进,量子纠错也取得进展。
Google Research 发布自然语言处理系列研究,涵盖 ToolGrad 工具使用数据集生成、Gemini Nano 在 Pixel 上的冻结多 Token 预测加速、Gemini Enterprise Agent Platform 的 Agentic RAG,以及 ReasoningBank 让智能体从经验中学习等多项工作。
Google Research 发布人机交互与可视化方向研究合集,涵盖 2026 年 8 月 25 日的 AgentHands——为 XR 中具有空间定位的智能体对话生成交互式手势,以及 3 月 25 日结合 XR Blocks 与 Gemini 加速 AI + XR 原型开发的 Vibe Coding XR。
Google Research 2017 年发布多项研究:Tacotron 2 实现从文本生成类人语音,NIMA 用于神经图像评估,TFGAN 是轻量级生成对抗网络库,DeepVariant 用深度神经网络实现高精度基因组测序。此外还改进了端到端语音识别模型,并推出面向虚拟/混合现实的新注视点渲染管线。
Google Research 回顾了 2007 年的多项动态:8 月 22 日推出 Sky in Google Earth,9 月 23 日发布 OpenHTMM,10 月 19 日举办 Google Education Summit。
Google Research 发布 2025 年度回顾,列举 Titans + MIRAS 帮助 AI 获得长期记忆、实时语音到语音翻译、面向任意提示词的生成式 UI 等成果。年内还推出 JAX-Privacy 大规模差分隐私机器学习、AI 区分天然林与其他树冠覆盖的开源模型与数据集,以及用于优化的新量子工具包。
Google Research 发布生成式 AI 系列研究进展,涵盖长视频生成自动化、用生成式 UI 帮教师创建学习互动内容,以及用 Retrieve-for-Train 缓解复杂 AI 搜索的推理瓶颈。研究还涉及 Earth AI 全球模型自动化预测、可穿戴传感器数据生物标志物筛选,以及扩散模型创造力与 LLM 参数化事实召回等课题。
Google Research 发布经济学与电子 commerce 领域研究合集,涵盖大语言模型的机制设计、地理空间推理基础模型、锦标赛作弊算法、Privacy Sandbox 归因报告 API 的摘要报告优化,以及基于 DP-SGD 的私有广告预测等方向。
Google Research 回顾了 2018 年的多项研究进展,涵盖 Pixel 3 的 Top Shot 与深度预测、Google AI Princeton 的算法与理论研究,以及量子神经网络探索。
Google Research 回顾 2023 年 AI 与计算领域进展,涵盖 VideoPoet 零样本视频生成大语言模型、StyleDrop 任意风格文生图、隐私保护差分训练与单语数据无监督语音到语音翻译等成果。同期还发布面向机器学习的机器学习进展、NeurIPS 2023 与 EMNLP 2023 参会动态,以及经典力学量子算法指数级加速。
Google Research 的 Algorithms & Theory 专栏汇总了多项研究:Diffusion Controller 用于统一并简化 AI 图像生成,TurboQuant 以极致压缩提升 AI 效率,S2Vec 学习城市表征,另有面向 machine unlearning 审计的新框架和 AI benchmark 评分者数量研究。
Google Research 公布 2009 年 12 月多项研究进展,包括 YouTube 自动字幕、Google Image Swirl 图像探索、语音搜索学习普通话,以及用量子算法做机器学习。同期还发布了 Q4 Research Awards,并宣布四位 Google 员工当选 ACM Fellows。
Google Research 的 Programs 页面汇总了其历年学术资助与人才培养项目,涵盖 2019 至 2023 年的 Google PhD Fellowship、Faculty Research Award、Research Scholar Program、Award for Inclusion Research 等公告。
Google Research 的机器人研究涵盖语言驱动机器人运动、技能合成与导航等方向,包括 SayTap、PaLM-E、RT-1 等项目。其中 PaLM-E 是具身多模态语言模型,RT-1 是面向真实世界大规模控制的 Robotics Transformer,Barkour 则用于评测四足机器人的动物级敏捷性。
Google Research 回顾了 2014 年的多项研究进展,包括构建图像自然语言描述、大规模高质量目标检测,以及自动理解数据。2014 年 12 月 1 日的 NIPS 2014 上,研究者还探讨了变分推断的进展,目标是实现大规模概率机器学习。
Google Research 发布量子计算研究进展汇总,涵盖从量子纠错到量子优势的多个方向。其中 2026 年 7 月 22 日发布的研究探索让量子计算机从自身错误中学习,2026 年 1 月 13 日提出动态表面码为量子纠错开辟新途径,2025 年 10 月 22 日则展示了可验证的量子优势。
Google 发布 Earth AI,通过基础模型与跨模态推理解锁地理空间洞察。该系列工作涵盖利用深度学习从太空测绘全球甲烷排放、自动化全球模型的行星预测引擎,以及将热韧性数据扩展至 50+ 全球城市。
Google Research 回顾了 2021 年 12 月前后的多项研究,包括用 GLaM 提升上下文学习效率、快速 WordPiece 分词系统,以及通过数据集蒸馏更高效训练机器学习模型。其他工作涵盖部分本地化联邦学习、可解释时间序列预测、视觉 Transformer 的 tokenize 学习,以及开源强化学习数据集生态 RLDS。
Google Research 汇总了其摄影方向的多项技术成果,涵盖 Pixel 手机的 HDR+ 包围曝光、Pixel 4/4a 的实时 HDR+ 与双曝光控制,以及 Pixel 6 人像模式的 Alpha 抠图。近期工作包括用机器学习做 HDR 照片编辑、基于视频的 DynIBaR 时空视图合成、NeRF 室内空间重建,以及用多尺度 Transformer 评估图像美学的 MUSIQ。
Google Research 汇总了其在安全、隐私与滥用防范方向的多项研究,涵盖联邦数据可证明隐私学习、机器遗忘审计框架、零信任聚合隐私分析等课题。其中 VaultGemma 被称为全球能力最强的差分隐私 LLM,JAX-Privacy 支持大规模差分隐私机器学习,另有面向 AI 聊天机器人使用洞察的差分隐私框架。
Google 2015 年 11 月将机器学习系统 TensorFlow 开源,供所有人使用。同年 9 月,Google 语音搜索变得更快更准确,10 月又用深度神经网络改进 YouTube 视频缩略图。此外,Google 在 NIPS 2015 上展示了其机器学习研究,并发布了深度神经网络入门指南。
Google Research 公布健康与生物科学领域多项进展,包括 9 月 3 日完成雄性果蝇完整大脑连接组图谱,8 月 26 日推出连续血糖监测基础模型 GlucoFM,以及 8 月 11 日推进 AMIE 向专家级音视频临床问诊发展。其他工作涵盖可穿戴传感器生物标志物筛选、智能手机影像估算心血管代谢风险、SymptomAI 对话式症状评估智能体等。
Google Research 回顾了 2022 年的多项研究,包括生成高保真且保护隐私的合成电子健康记录 EHR-Safe、用 Confident Adaptive Language Modeling(CALM)加速文本生成,以及面向真实世界规模化控制的 Robotics Transformer(RT-1)。此外还涉及差分隐私核算、DP-SGD 私有广告预测、设备端说话人标注和量子计算等方向。
Google Research 发布 2013 年研究内容汇总,涵盖全球森林变化首张详细地图、YouTube 视频多视角学习数据集,以及摩尔定律系列四篇文章。同期内容还包括自然语言处理、教育创新与 Exacycle 访问教职项目,Googler Moti Yung 于当年当选 2013 ACM Fellow。
Google Research 在 2026 年 2 月至 9 月间围绕开源模型与数据集发布多项成果,涵盖连接组学、气候与地球 AI、语音技术等方向。其中 9 月 3 日完成雄性果蝇完整大脑图谱绘制,3 月 6 日推出非洲语言语音资源 WAXAL 及野生动物识别工具 SpeciesNet。
Google Research 的 General Science 方向近期发布多项成果,涵盖基因组预测的迁移学习、完整雄性果蝇大脑连接组图谱,以及通过 Chain-of-Evidence 实现可验证自主研究的 Science One 框架。此外还包括用智能手机图像估算心血管代谢风险、日常症状评估对话式 AI 智能体 SymptomAI,以及 AI 生成合成神经元加速脑图谱绘制等研究。
Google Research 回顾了 2006 年发布的系列博文,其中 4 月 28 日宣布统计机器翻译(Statistical machine translation)上线,8 月 3 日发布 N-gram 数据集。博文还记录了当年关于二分查找与归并排序缺陷、自动化测试会议以及 CHI、CSCW 等学术会议的动态。
Google Research 汇总了其分布式系统与并行计算方向的多项研究,涵盖用退役手机搭建低碳计算平台、AI 优化云计算虚拟机调度、随机任务到达的负载均衡,以及 Parfait、差分隐私模型训练、Gboard 语言模型联邦分析等隐私计算工作。
Anthropic 发布 Claude 成本可见性与控制指南,介绍 IT 管理员在 Claude Enterprise 中可用的成本管控手段,包括访问门控、模型权限与默认值、硬性支出上限,以及按人员、团队和模型拆分的用量分析、数据导出和 Analytics API。
MCP 第五个规范版本 MCP 2026-07-28 发布,协议核心从有状态双向模型改为请求/响应无状态模型,并纳入 MCP Apps 与 Tasks 标准化扩展,授权对齐生产环境的 OAuth 2.0 与 OIDC。
推荐理由:MCP 2026-07-28 把协议核心改为无状态并引入扩展框架,读者可据此判断服务器部署与扩展方式的变化。
Claude 的 Compliance API 现已覆盖桌面、网页和移动端的 Cowork,以及 CLI 和桌面端的 Claude Code,面向 Claude Enterprise 客户开放 beta。
Claude Code 的自动模式现已改为默认设置,由分类器评估每个待执行动作并拦截可能有害的命令,取代逐条人工批准权限提示。Anthropic 称内部评估中分类器发现的危险操作多于开发者手动点击批准时,且在第三方红队测试下表现稳定;由于会话打断更少,Claude 在两次中断之间的连续工作时间是此前默认设置的 9 倍。
推荐理由:官方给出自动模式在 Nuro、Gusto、Garner Health 生产环境的落地细节,可了解分类器在速度与安全之间的取舍。
Anthropic 为 Claude Tag 更新上下文能力,Claude 现在会读取整个 Slack 频道的消息,并结合自身记忆与用户设定的常驻指令判断何时主动发言,官方称其在判断该不该主动响应上提升约 30%。
Anthropic 为 Claude Code 推出自托管环境公测,会话可在企业自有网络内的基础设施上运行,并访问内部服务、数据库和注册表。仓库检出、构建产物和密钥都留在自有基础设施,但提示词、回复和工具结果仍会发送到 Anthropic 做推理,会话记录也会被存储以便从任意入口继续。
Claude Code 官方博客解释了会话的 token 成本构成,输出 token 单价约为输入的 5 倍,缓存读取按输入价的 0.1 倍计价、写入最高为 2 倍。
推荐理由:官方拆解了 prompt 缓存与上下文如何影响会话成本,并给出可直接照做的会话管理方式。
JetBrains CTO Vladislav Tankov 披露,Claude Fable 5 在其私有仓库评测中 Python 通过率达 44.3%,比 Opus 4.8 的 28.2% 高出 16 个百分点,且解题步骤少约 22%。
Anthropic 数据团队撰文说明如何在 Slack 部署 Claude Tag 做自助数据分析,关键做法是把技能文件当作持续刷新的服务端内容,每次对话重新读取。
OpenAI 发文探讨 AI 正如何同时改变攻击方与防御方的网络安全格局,并介绍 OpenAI 自身正在强化的防御措施,以及安全团队当下可以采取的行动。
OpenAI 宣布加入 PORTS-Pike 项目,扩大社区投资并支持俄亥俄州南部数千个就业岗位。该项目是 OpenAI 社区投资布局的一部分。
黑莓已完成从手机厂商向汽车操作系统 QNX 和加密软件 Secusmart 的转型,今年第一季度自 2017 年以来首次在财年开局实现现金流转正。QNX 已占其营收约一半,应用于汽车、机器人、医疗设备、国防和航空航天领域;Secusmart 为 20 个国家的政府提供加密语音、短信和通讯服务。