跳到正文

Google / Gemini

Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。

当前仅显示精选新闻

最新精选

第 61–80 条 · 共 250 条
8月28日周五
8月27日周四
  1. @rohanpaul_ai69

    Google 发布 Gemini 3.5 Transcribe,一款不再逐字记录、而是输出用户本意的语音转写模型,现已通过 API 开放。

    原始视频预览图;未保存可播放视频URL原始视频预览图;未保存可播放视频URL原始视频预览图;未保存可播放视频URL
    引用@sundarpichai@sundarpichai

    Say hello to Gemini 3.5 Transcribe! - Build apps that understand user speech / intent, even w/ multiple speakers! - Auto-detection of 85+ languages out of the box - Custom vocab adaptation for specialized jargon... SGTM:) API available now in @GoogleAIStudio and Gemini Enterprise, or try it in the Gemini app on macOS or Rambler on Android! More details: https://t.co/AduutCb3M7

    推荐理由:原文列出两个 API 端点各自的能力与时长限制,读者可据此判断语音转写在工作流中的可用边界。

  2. Gemini API 更新日志64

    Gemini Omni Flash 转正为 gemini-omni-1.1-flash,新增视频延伸与首尾帧插值

    Google 发布 gemini-omni-1.1-flash,即对话式视频生成与编辑模型 Gemini Omni Flash 的 GA 版本。新增视频延伸、首尾帧插值(最多 2 张图)以及 360p 到 4K 的分辨率参数,1080p 和 4K 通过超分辨率生成;预览端点 gemini-omni-flash-preview 将于 2026 年 9 月 30 日弃用。

    推荐理由:官方更新日志给出 GA 版本的新能力清单和预览端点停用时间,开发者可据此规划迁移。

8月26日周三
  1. 机器之心 · 微信公众号77

    阿里发布 Qwen3.8-Flash,同步开源 Qwen3.8-Flash-Next

    阿里发布 Qwen3.8-Flash,并在 Hugging Face 与 ModelScope 开放同一模型的 Qwen3.8-Flash-Next 权重,主模型 125B 参数、每 token 仅激活 6B,千问 AI 平台定价为每百万 token 输入 1 元、输出 3 元。

    推荐理由:文章拆解了 Qwen3.8-Flash 在注意力、残差与嵌入上的四处架构改动,并把它放进每任务成本的行业对比框架里。

8月25日周二
  1. ByteByteGo68

    研究者用同族小模型还原 Anthropic、OpenAI 与 Google 的加密推理块

    2026 年 8 月,MATS Research、ELLIS Institute Tübingen 与 Max Planck Institute for Intelligent Systems 的研究者测试了 Anthropic、OpenAI 和 Google 返回给客户端的加密推理块,发现把块重放进同族更便宜的模型,就能让隐藏推理以明文输出。

    推荐理由:研究揭示加密推理块可被同族小模型复述,公开 agent 日志里的密钥无法靠清洗明文保护。

8月22日周六
  1. @AYi_AInotes68

    Google 发布 Gemini 3.7 Flash,官方将其定位为迄今最智能的工作马模型,Google 高管发推称这是其史上增长最快的一次模型发布。

    引用@OfficialLoganK@OfficialLoganK

    Gemini 3.7 is our fastest growing model launch to date, amazing to see the reception!!!

    推荐理由:文章给出 Gemini 3.7 Flash 的代码评测与价格变化,并讨论低价模型对 Agent 算力成本结构的影响。

8月21日周五
  1. Claude Blog72

    Claude 平台 computer use、Skills API 和 Files API 正式可用

    Anthropic 宣布 computer use、Skills API 和 Files API 在 Claude Platform 正式可用,computer use 同时新增 browser use 工具,除截图外还读取页面结构,让智能体定位具体字段或按钮。

    推荐理由:正式版给出了多动作执行、浏览器工具和文件存储的具体变化,可据此判断现有智能体工作流的改造空间。

8月20日周四
  1. @GeminiApp74

    Gemini 应用宣布现在可以直接在对话中生成可用的交互式 3D 模拟和动态表格。官方提示以 “Show me…” 开头写提示词,并使用 Flash 模型以获得最佳效果。给出的示例包括 3D 展示 DNA 工作原理(可缩放、旋转、探索)、展示单摆的能量变化,以及用瀑布图展示现金消耗速度。

    原始视频预览图;未保存可播放视频URL

    推荐理由:官方给出可直接复用的提示词开头方式,读者可据此在对话里生成可交互的 3D 模拟与动态表格。

  2. @GeminiApp65

    Gemini 应用今日起面向全球符合条件的用户推送学生专区、学习笔记本、交互式可视化以及 Gemini Live 中的 Deep Research。符合条件的学生可免费领取一年期学生方案,该优惠持续至 2026 年 12 月 31 日,需遵守相关条款。详情见 https://t.co/C7DagVm4aB。

    推荐理由:Gemini 把学生专区、学习笔记本与 Deep Research 打包进应用并附一年免费方案,可观察教育场景的落地方式。

  3. @testingcatalog65

    Google AI Studio Build 现在支持导入 GitHub 仓库,并让仓库与应用保持同步。引用 @OfficialLoganK 的说明,Google AI Studio 新增 GitHub 双向同步(push / pull),并配有支持 force push、合并等操作的新 UI。

    引用@OfficialLoganK@OfficialLoganK

    Updates on GitHub support in @GoogleAIStudio: - we now support importing Github repos - we now support bi-directional GitHub sync (push / pull) - brand new UI support for force pushes, merges, etc Bi-directional push / pull took a while to land but excited it is here! https://t.co/0S4GeZZu90

    推荐理由:Google AI Studio 的 Build 功能补上 GitHub 仓库导入与双向同步,读者可以据此判断它能否接入现有代码流程。

8月17日周一
  1. xAI News67

    xAI 为 Google Workspace 发布 Grok 插件,覆盖 Sheets、Slides、Docs

    xAI 发布免费插件 Grok for Google Workspace,一次从 Google Workspace Marketplace 安装即可覆盖 Sheets、Slides 和 Docs,同时还提供 Microsoft 365 的 Word、Excel、PowerPoint 和 Outlook 版本。

    推荐理由:原文列出 Grok 在 Sheets、Slides、Docs 中各自能做的事与免费安装入口,可据此判断它对文档办公流程的影响。