Google I/O 2026 开发者大会回顾,Gemini 3.5 Flash 与 Antigravity 2.0 等集中发布
Google 在 I/O 2026 开发者大会上集中发布了 Gemini 3.5 Flash、Gemini Omni Flash、Antigravity 2.0、Gemini Spark 等模型与产品更新。
推荐理由:逐项梳理 Google I/O 2026 的模型与 Agent 更新,读者可据此了解 Google 这半年的产品布局。
文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。
当前仅显示精选新闻Google 在 I/O 2026 开发者大会上集中发布了 Gemini 3.5 Flash、Gemini Omni Flash、Antigravity 2.0、Gemini Spark 等模型与产品更新。
推荐理由:逐项梳理 Google I/O 2026 的模型与 Agent 更新,读者可据此了解 Google 这半年的产品布局。
推荐理由:官方公布了 Gemini Omni 面向全球订阅用户的开放范围,以及后续将支持的图像、音频输出格式。
推荐理由:官方给出 Gemini Omni 的多模态输入与视频生成能力,读者可据此判断视频生成工作流的入口变化。
推荐理由:原文给出 Gemini 3.5 Flash 的定价与上下文规格,并对比其在编码和工具调用上优于 Gemini 3.1 Pro。
Gemini Omni 今天登陆 Gemini 应用,面向付费订阅用户开放。该功能支持文本、图像和视频的任意组合输入,用户可在 Gemini 中附加相册里的视频并对其进行修改。
Gemini Omni is coming to the Gemini app for paid subscribers today. It lets you bring your ideas to life using any combination of text, images, and video inputs. Just open up Gemini, attach a video from your camera roll, and change it around. It’s that simple. #GoogleIO
推荐理由:Gemini Omni 面向付费订阅用户开放,给出文本、图像与视频混合输入的用法,读者可据此判断可用范围。
Introducing Gemini Omni 🔮........ Omni is our new model that can create anything from any input — starting with video (think Nano Banana but for video). Available in the Gemini App, Flow, and YouTube, with API support coming soon! Video
推荐理由:官方说明了 Gemini Omni 从任意输入生成内容的能力和首批视频场景,读者可据此了解当前可用渠道与范围。
推荐理由:Gemini app 把 AI 生成内容核验做成了对话式查询,读者可了解多模态内容溯源在应用内的落地方式。
推荐理由:Gemini 应用开放 Gemini Omni 视频创作,读者可从覆盖的订阅档位和入口判断自身是否可用。
推荐理由:原文给出 Gemini Omni 的输入方式与开放订阅档位,读者可据此判断视频创作门槛的变化。
谷歌在 2026 谷歌 I/O 开发者大会上宣布谷歌搜索迎来 25 年来最大改版,用 AI 全面重塑搜索入口与交互方式,由 Gemini 3.5 Flash 模型提供快速响应。
推荐理由:改版把 AI Mode、多模态输入与后台智能体一并纳入搜索入口,呈现搜索交互从关键词到完整需求的转向。
Google 的 Gemini Omni 支持用对话编辑视频,用户可在多轮提示中重新构想动作、改变视角或调整光线。每次指令都会基于上一条,让角色保持一致、物理表现成立,并让场景记住先前内容。
推荐理由:原文给出多轮对话编辑视频的交互方式,读者可以了解角色一致性和物理表现在连续指令下的处理。
Introducing Agora-1, a multi-agent world model. Multiple participants—human or AI—can now interact inside the same world simulation, all in real-time. Try our playable research preview today, with Agora-1 simulating a multiplayer GoldenEye deathmatch! Video
推荐理由:世界模型从单人视频生成扩展到多人实时共享模拟,读者可据此了解人机共处同一模拟世界的当前形态。
Google DeepMind 发布 Gemini Omni 系列首个模型 Gemini Omni Flash,可将图像、音频、视频和文本组合为输入生成高质量视频。
推荐理由:官方宣布 Omni 家族首个模型,列明对话式改视频、物理理解、多输入融合等能力与各端开放范围,可据此评估对视频创作流程的影响。
Google 宣布扩展内容透明与验证工具,SynthID 验证今日在 Search 上线,未来数周进入 Chrome,Gemini 应用的验证功能已被使用 5000 万次。
推荐理由:原文给出 SynthID 验证入口、C2PA 支持范围和合作方名单,读者可以对照自己的使用场景判断这些工具的实际覆盖。
Google DeepMind 发布 Gemini 3.5 模型系列,首个模型 3.5 Flash 当天全球可用,定位为面向智能体工作流与编码的旗舰级速度模型。
推荐理由:官方公布了 3.5 Flash 的基准成绩、发布渠道和 3.5 Pro 时间表,读者可以据此评估其智能体与编码能力变化。
1/5 MiniCPM-V 4.6 (1.3B) is now live 🚀🚀 High-res visual processing, optimized for consumer-grade and mobile hardware. We’ve leveraged the latest LLaVA-UHD v4 technique to cut vision encoding costs by 55%, enabling native edge deployment with extreme efficiency. 🔥 Beats Gemma4-E2B-it and Qwen3.5-0.8B across key multimodal and Artificial Analysis benchmarks — scoring higher than Qwen3.5-0.8B using just 2.5% of its token budget. ⚡ TTFT (75.7ms) 2.2x Faster than Qwen3.5-0.8B even with 3136² high-res images. 🏗️ ~1.5x Token Throughput compared with Qwen3.5-0.8B on a single RTX 4090. Try the model here: 🤗 Hugging Face: huggingface.co/openbmb/MiniC… 💻 GitHub: github.com/OpenBMB/MiniCPM-V 🔭 Modelscope: modelscope.cn/models/OpenBMB… 🌐 Web Demo: huggingface.co/spaces/openbm… 📱 App Demo: github.com/OpenBMB/MiniCPM-V… Video
推荐理由:官方给出 1.3B 小模型处理高分辨率图像的编码成本与吞吐数据,可供端侧多模态选型参考。
Thinking Machines Lab 发布交互模型研究预览,模型原生处理音频、视频和文本的实时交互,而非依赖外部 harness。TML-Interaction-Small 为 276B 参数 MoE(12B 激活),采用 200ms 微轮次多流设计和无编码器早期融合,并配合异步后台模型处理深度推理。
推荐理由:原文给出交互模型的技术路线、架构细节和基准对比,读者可据此评估原生交互与外挂式实时方案的能力差距。
Runway 发布 Characters,基于 GWM-1 将单张参考图转为可实时对话的视频角色,无需微调,支持写实人像、卡通和吉祥物等风格。模型每帧有效耗时 37 毫秒,用户停止说话到角色开口的服务端延迟 1.75 秒;通过扩散变换器与 VAE 解码器流水线并行、KV-cache 管理、CUDA Graphs 和 Triton 核优化实现 24fps 实时生成。
推荐理由:官方技术博客拆解了实时管线的关键数字和系统优化,读者可以据此理解单图驱动的对话视频智能体的实现路径。
𝗦𝗲𝗻𝘀𝗲𝗡𝗼𝘃𝗮 𝗨1 𝗟𝗶𝘁𝗲 𝗦𝗲𝗿𝗶𝗲𝘀 𝗶𝘀 𝗻𝗼𝘄 𝗼𝗽𝗲𝗻 𝘀𝗼𝘂𝗿𝗰𝗲! Built on the 𝗡𝗘𝗢-𝘂𝗻𝗶𝗳𝘆 𝗮𝗿𝗰𝗵𝗶𝘁𝗲𝗰𝘁𝘂𝗿𝗲, it natively unifies multimodal understanding and generation, delivering: •𝗦𝗢𝗧𝗔 𝗘𝗳𝗳𝗶𝗰𝗶𝗲𝗻𝗰𝘆 𝗔𝗺𝗼𝗻𝗴 𝗢𝗽𝗲𝗻-𝗦𝗼𝘂𝗿𝗰𝗲 𝗠𝗼𝗱𝗲𝗹𝘀: Compact models (8B & A3B) delivering commercial-grade performance and exceptional cost efficiency. Leading performance among open-source models across a wide range of understanding, reasoning, and generation benchmarks. •𝗡𝗮𝘁𝗶𝘃𝗲 𝗜𝗺𝗮𝗴𝗲–𝗧𝗲𝘅𝘁 𝗜𝗻𝘁𝗲𝗿𝗹𝗲𝗮𝘃𝗲𝗱 𝗚𝗲𝗻𝗲𝗿𝗮𝘁𝗶𝗼𝗻: Generate coherent interleaved text and images in a single flow using one model; ideal for practical applications like guides, where visuals turn complex information into intuitive insights. •𝗛𝗶𝗴𝗵-𝗗𝗲𝗻𝘀𝗶𝘁𝘆 𝗜𝗻𝗳𝗼𝗿𝗺𝗮𝘁𝗶𝗼𝗻 𝗥𝗲𝗻𝗱𝗲𝗿𝗶𝗻𝗴: Strong capabilities in dense visual communication, generating richly structured layouts for knowledge illustrations, posters, PPTs, comics and other information-rich formats. 𝗛𝘂𝗴𝗴𝗶𝗻𝗴 𝗙𝗮𝗰𝗲: huggingface.co/collections/s… 𝗚𝗶𝘁𝗛𝘂𝗯: github.com/OpenSenseNova/Sen… 𝗗𝗶𝘀𝗰𝗼𝗿𝗱: discord.gg/cxkwXWjp @huggingface @github
推荐理由:SenseNova U1 Lite 以 8B、A3B 紧凑规模开源权重,读者可据此衡量自托管图文版式生成的成本门槛。
Google DeepMind 宣布 AI co-clinician 研究计划,探索在医生临床监督下以"三方诊疗"模式辅助患者。
推荐理由:官方给出评测细节与局限,专家医师在140项评估整体仍优于该系统,有助于客观看待医疗AI的进展与边界。