跳到正文

Google / Gemini

Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。

当前仅显示精选新闻

最新精选

第 141–160 条 · 共 258 条
6月11日周四
6月10日周三
  1. @berryxia67

    Google 将 Gemini 3.5 Live Translate 推向公开预览,通过 Gemini API 提供低延迟语音到语音翻译,覆盖 70 多种语言和 2000 种语言对。作者指出它把小众语言对也纳入覆盖,可用于实时对话、客服、直播和跨国会议等场景,并提到目前尚不清楚它与阿里部分小语种模型的对比效果。

    引用Google for Developers (@googledevs)@googledevs

    Gemini 3.5 Live Translate is now in Public Preview via the Gemini API, delivering low-latency speech-to-speech translation across 70+ languages and 2,000 language pairs! 🌍 Challenge time: What is the most niche, unique, or complex language pair your application needs to translate? Tell us in the comments, and we’ll let you know if the model supports it! Full blog link: goo.gle/3QzaHwN Video

    推荐理由:Google 将 Gemini 3.5 实时语音翻译推向公开预览,可了解其对小众语言对的覆盖范围与 API 接入方式。

  2. @berryxia67

    Google 开发者账号宣布,Gemini 模型现已通过 Apple 的 Foundation Models 框架和 Xcode 中的原生支持,向数百万 Apple 开发者开放。

    引用Google for Developers (@googledevs)@googledevs

    Gemini models are now accessible to millions of Apple developers through Apple’s Foundation Models framework and natively within Xcode. You can now easily swap between local and cloud inference using a shared API surface to build next-generation agentic app experiences, increase development velocity, and offload heavy workloads to the cloud. Additionally, you can use agentic coding assistance from Gemini in Xcode to accelerate multi-step development tasks. Check out the full announcement to get started: goo.gle/3Q1YDnD Video

    推荐理由:该消息交代了 Gemini 接入 Xcode 与 Foundation Models 框架的具体入口,便于判断 Apple 开发者的模型选择格局。

6月9日周二
  1. @googleaidevs70

    Google AI for Developers 公布了当天即可上手的两条路径:在 Google AI Studio 的实时游乐场 ai.studio/live 测试模型能力,以及通过 Gemini Live API 使用 AgoraIO、LiveKit、Pipecat、swmansion、visionagents.ai 等第三方生态集成。帖子列出的是接入入口与合作方,未说明具体模型版本。

    推荐理由:原文列出 Google AI Studio 实时试玩入口与 Gemini Live API 的第三方集成伙伴,开发者可据此直接接入。

  2. Google DeepMind67

    Google DeepMind 发布 Gemma 4 12B:无编码器统一架构的多模态模型

    Google DeepMind 发布 Gemma 4 12B,采用无编码器统一架构,视觉与音频输入直接进入 LLM backbone,是该系列首个支持原生音频输入的中等规模模型。

    推荐理由:官方说明新模型以无编码器统一架构把性能接近 26B 的多模态能力压到 16GB 内存笔记本可跑,开发者可据此评估端侧部署选择。

  3. AI前线 · 微信公众号88

    OpenAI 秘密提交 IPO 申请,估值超 8500 亿美元

    OpenAI 已向美国证券交易委员会秘密提交 IPO 申请,公司当前估值超过 8500 亿美元,并一直在为最早今年第四季度上市做准备。公司称尚未确定上市时机与募资金额,此次提交让未来合适时能更快推进上市。就在一周前,Anthropic 也宣布秘密提交 IPO 申请,其估值达 9650 亿美元;SpaceX 已启动路演,三者的上市进程被视为检验市场对 AI 企业热情的风向标。

    推荐理由:OpenAI、Anthropic 与 SpaceX 接连推进上市,读者可了解三家在融资与估值上的竞争节奏。

6月8日周一
  1. Google DeepMind64

    Google DeepMind 发布塞拉利昂 Gemini Guided Learning 教学试验结果

    Google DeepMind 公布在塞拉利昂开展的预注册试验结果,使用 Guided Learning 的学生数学成绩较对照组提升 0.258 个标准差,约合 1.2 到 1.7 年的典型学习进度,八周内完成。

    推荐理由:预注册试验给出了量化学习增益和保护批判性思维的交互数据,为评估 AI 辅助教学提供了可对照的证据。

  2. 量子位 · 微信公众号76

    SpaceX IPO 路演 PPT 曝光:以 AI 算力为核心叙事,估值 1.77 万亿美元

    SpaceX 在 IPO 路演 PPT 中计划于纳斯达克上市,发行 5.556 亿股、每股 135 美元,预计 6 月 11 日定价,估值 1.77 万亿美元。PPT 把 SpaceX 重新定位为横跨太空、通信与 AI 算力的未来基础设施公司,募资用于扩建 AI 算力基础设施、升级发射设施与运载火箭等。文件还给出轨道 AI 算力路线图,并提到谷歌将每月付费 9.2 亿美元租用 xAI 的算力。

    推荐理由:SpaceX 在 IPO 路演中将 AI 算力写进核心叙事,读者可据此看到太空、通信与 AI 如何被打包成同一套估值逻辑。

6月6日周六
  1. IT Home77

    谷歌每月向 SpaceX 支付 9.2 亿美元租用 AI 算力,含约 11 万张英伟达 GPU

    谷歌与 SpaceX 达成云计算合作,计划自 2026 年 10 月起至 2029 年 6 月每月支付 9.2 亿美元租用数据中心算力。租赁内容涵盖至少 11 万张英伟达 GPU、CPU 等芯片对应的计算能力,主要面向训练和推理等 AI 高密度场景。华尔街日报认为,这既能缓解谷歌的算力供应紧张与扩容周期压力,也为 SpaceX 的 AI 业务新增一条收入来源,为其 IPO 提供叙事筹码。

    推荐理由:协议披露了按月支付的算力租赁规模与起止时间,读者可据此观察谷歌的算力缺口与 SpaceX 的 AI 收入布局。

  2. @googleaidevs71

    Google 发布 Gemma 4 QAT 检查点,可在消费级 GPU 和移动设备上本地运行且质量损失很小。其中 GGUF(Q4_0)检查点覆盖各尺寸与 drafter 模型以追求本地性能,定制移动方案通过混合精度把 Gemma 4 压缩到 1GB 以内,包含针对性 2-bit 解码层、优化 KV cache 和静态激活。

    推荐理由:文章列出 Gemma 4 QAT 的 GGUF 与移动端两种量化方案,可用于判断本地部署的体积与质量取舍。

  3. @GeminiApp66

    Gemini 官方应用宣布,Gemini Live 现在可以直接创建和编辑图像,并支持实时完成。用户打开 Gemini App、点击 Live 按钮并共享摄像头后,用语音告诉 Gemini 想看到的内容,可用于房间装饰测试、数学题辅助和制作表情包等场景。

    推荐理由:官方给出了提问方式和操作路径,读者可以据此了解 Gemini Live 实时图像生成与编辑的使用门槛。

6月5日周五
  1. Hugging Face Blog61

    NVIDIA 发布 Nemotron 3.5 Content Safety 多模态安全模型

    NVIDIA 发布 Nemotron 3.5 Content Safety,基于 Google Gemma 3 4B IT 微调,把多模态输入、自定义企业策略与可审计推理链统一到单次推理调用中,并保持 12 种语言显式训练和约 140 种语言的零样本泛化。

    推荐理由:相比 Nemotron 3,3.5 版把多模态审核、自定义策略与可审计推理链合并到一次调用中。

  2. @googleaidevs69

    Google 发布开放权重的实时音乐模型 Magenta RealTime 2(MRT2),支持 MIDI 与提示词控制,可在 MacBook 上本地运行且延迟低于 200ms。官方同时提供开放权重、开源推理引擎及一系列应用和插件,演示中还展示了用 MIDI 键盘、实时文本提示乃至手势来演奏。

    引用Google Magenta Project (@GoogleMagenta)@GoogleMagenta

    Introducing Magenta RealTime 2 (MRT2): the live music model you can play as an instrument. MRT2 offers MIDI and prompt controls, and runs natively on a MacBook with <200ms latency. Open weights. Open source inference engine. Suite of apps and plugins. Hear what it can do and try it out for yourself below 🧵 Video

    推荐理由:开放权重与开源推理引擎一并给出,读者可了解实时音乐模型在笔记本上的本地延迟表现。