跳到正文

Google / Gemini

Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。

当前仅显示精选新闻

最新精选

第 121–140 条 · 共 257 条
7月7日周二
  1. Tomer Tunguz78

    AI 公司 12 个月向前向部署工程投入 97.5 亿美元

    AI 公司在 12 个月内向前向部署工程(FDE)投入 97.5 亿美元,相当于 Accenture 年度服务成本的约五分之一。文中归纳出三种模式,Microsoft 与 Amazon 用既有编制组建团队,OpenAI 与 Anthropic 成立由外部私募支持的独立实体,Google Cloud 则投入 7.5 亿美元做合作伙伴基金。

    推荐理由:文中把 FDE 投入拆成三种结构模式,读者可借融资与人员数字判断这套模式为何被各实验室采用。

7月1日周三
6月30日周二
  1. Google Research60

    Google Research 发布 TabFM:面向表格数据的零样本基础模型

    Google Research 发布 TabFM,一个面向表格数据分类与回归的零样本基础模型,将表格预测重构为 in-context learning 问题,无需手动训练、超参数调优和特征工程。

    推荐理由:官方一手发布,把表格预测重构为上下文学习问题,读者可以了解其混合注意力架构、合成数据训练与基准结果。

  2. Gemini API 更新日志62

    Gemini API 发布 gemini-omni-flash-preview 公测并将 Nano Banana 2 Lite 转正

    Google 在 Gemini API 更新日志中发布 gemini-omni-flash-preview 公开预览版,面向高速视频生成和对话式视频编辑,可通过 Interactions API 从文本生成 720p 的 3-10 秒视频,或让静态图片动起来,并支持对话式编辑输出。

    推荐理由:官方更新日志同时给出模型入口和生成参数,开发者可以据此评估视频与图像能力的接入方式。

6月26日周五
6月25日周四
6月24日周三
  1. Gemini API 更新日志63

    Gemini API 为 Gemini 3.5 Flash 推出 Computer Use 工具公开预览

    Gemini API 为 Gemini 3.5 Flash 推出 Computer Use 工具公开预览,支持基于 intents 的简化操作。内置浏览器、移动端和桌面环境支持,并提供可配置安全策略和高级 prompt injection 检测。

    推荐理由:官方日志列出 Computer Use 工具的-preview 能力清单,读者可以对照现有 Gemini 自动化方案评估迁移成本。

6月22日周一
  1. Nathan Lambert: Interconnects82

    Nathan Lambert:GLM-5.2 是开源智能体模型的台阶式跃迁

    Nathan Lambert 撰文认为 Z.ai 于 6 月 13 日向 GLM Coding Plan 用户推出、6 月 16 日以 MIT 许可开源的 GLM-5.2,是首个在编码智能体场景中真正好用的开源权重模型,社区评测显示其在 Arena 智能体榜单上是唯一能与 OpenAI 和 Anthropic 最新模型抗衡的开源模型。

    推荐理由:作者以亲测和社区评测为依据,把 GLM-5.2 与 DeepSeek R1 时刻类比,并展开开源与闭源差距及监管风险的独特分析。

6月20日周六
6月18日周四
6月17日周三
  1. Google Blog: AI69

    Google 在 Nature 发表 AMIE 研究:医疗 AI 从诊断对话扩展到长期疾病管理

    Google 在 Nature 发表研究,展示医疗 AI 系统 AMIE 从一次性诊断对话扩展到使用药物目录和临床指南的长期疾病管理,该系统基于 Gemini 模型的长上下文能力,包含共情对话智能体和深度思考的管理推理智能体。

    推荐理由:盲测中 AMIE 的整体疾病管理推理与 21 名全科医生持平,计划精确度和指南一致性更高。

  2. Hugging Face Blog68

    Hugging Face 发布 Agentic Resource Discovery 规范与 Discover Tool

    Hugging Face 发布了由 Microsoft、Google、GoDaddy、Hugging Face 等贡献者参与开发的 Agentic Resource Discovery(ARD)草案规范,以及参考实现 Discover Tool,让智能体在运行时用自然语言搜索发现 MCP 工具、Skills 和 A2A 智能体,而不必预先安装。

    推荐理由:原文给出了 ARD 规范的落地形态与可调用的搜索入口,读者能据此理解智能体按需发现能力的路径。

6月13日周六
  1. InfoQ · 微信公众号83

    OpenAI 秘密递交 IPO 申请,估值超 8500 亿美元

    OpenAI 已向 SEC 秘密提交 S-1 文件,目前估值超过 8500 亿美元,正为最早今年第四季度上市做准备,但尚未确定上市时间与计划募资金额。Anthropic 一周前也宣布秘密提交 IPO 申请,SpaceX 已启动路演,并把这二者与 Google 列为其在 AI 领域的主要竞争对手。

    推荐理由:OpenAI、Anthropic 与 SpaceX 相继推进上市,可对照三家公司在资本市场的融资节奏与估值差异。

6月12日周五
  1. 硅星人Pro · 微信公众号85

    SpaceX 1.8万亿IPO,马斯克把火箭公司讲成一朵AI算力云

    SpaceX在纳斯达克挂牌,代码SPCX,发行价135美元,对应约1.8万亿美元估值,为史上最大一笔IPO。招股书披露,Anthropic每月支付12.5亿美元租用孟菲斯Colossus算力,Google每月支付9.2亿美元租约11万张英伟达GPU,合同均签到2029年。文章还拆解了轨道算力卫星计划,SemiAnalysis测算太空算力综合成本是地面的3.6到4.4倍。

    推荐理由:文章拆解招股书里的算力合同与轨道数据中心成本,读者可借此理解1.8万亿估值中想象的占比。

6月11日周四
  1. @berryxia66

    Google 发布实验性开源模型 DiffusionGemma,采用 diffusion 同时起草并精炼整块文本,而非逐词预测,宣称文本生成速度最高提升 4 倍。该模型以 Apache 2.0 许可开源,权重已在 Hugging Face 放出。转发者称其可在 18GB 消费级显卡上运行,速度达 1000+ token/s。

    引用Google (@Google)@Google

    Meet DiffusionGemma ⚡ Our latest experimental open model (Apache 2.0) that generates text up to 4x faster. Instead of predicting and typing just one word at a time like most language models, it drafts and refines entire blocks of text simultaneously. Here’s how it works 🧵 ↓

    推荐理由:Google 开源实验性文本生成模型,采用并行 diffusion 思路,读者可了解其与主流自回归生成在路线上的差异。

  2. Google DeepMind72

    Google DeepMind 发布开源实验模型 DiffusionGemma,文本生成速度最高提升 4 倍

    Google DeepMind 发布 Apache 2.0 开源的实验性文本扩散模型 DiffusionGemma,为 26B MoE 架构、推理时激活 3.8B 参数,在专用 GPU 上文本生成最高提速 4 倍,单张 NVIDIA H100 超过 1000 tokens/秒,量化后可放入 18GB 显存。

    推荐理由:官方给出了具体吞吐数字、显存占用和适用场景边界,读者可以据此判断扩散文本生成适合哪些本地工作流。