Google 搜索推出 5 项 AI 学习工具:交互可视化、练习测验、Lens、笔记本与自定义文件
Google 宣布在 Search 的 AI Mode 和 AI Overviews 中推出 5 项学习工具。
推荐理由:原文列出了五项学习功能各自的入口、覆盖范围和上线节奏,读者可以据此了解 Google 搜索在 AI Mode 里的教育能力布局。
Google 宣布在 Search 的 AI Mode 和 AI Overviews 中推出 5 项学习工具。
推荐理由:原文列出了五项学习功能各自的入口、覆盖范围和上线节奏,读者可以据此了解 Google 搜索在 AI Mode 里的教育能力布局。
Google Research 提出 PhotoScan,一种从标准 2D 手机照片估算体脂率、A/G 比和 V/S 比等三维身体成分指标的深度学习框架,在 677 人 PhotoBIA 队列 5 折交叉验证中 BF% 平均 MAE 为 2.15,优于 BIA 的 2.91。
OpenRouter 发布视觉输入教程,讲解通过 Chat Completions API 向支持视觉的模型发送图片,请求体只需在 content 数组中加入 text 和 image_url 两部分,切换模型仅改 model 字段。
Google 发布开源 C++ 库 Credentio,用于处理 C2PA Content Credentials,先支持规范 2.2 和 2.4 版本。该库支持完全本地验证,无需将媒体文件传到云端,零带宽开销、即时返回结果并保持数据隐私;验证大文件时内存占用较小,可配置官方或自定义 C2PA 信任列表,深入解析清单、断言、数字签名和声明结构,并给出详细的验证报告。
微软研究院发布 MindTopo 基准,用于评估多模态大语言模型在连通性、封闭、顺序、分离和绳结五类拓扑关系上的推理与规划能力。测试显示,当前专有与开源模型在静态识别上表现明显优于交互式规划,且均远低于人类水平,失败多出现在规划阶段而非感知阶段。图像与视频生成工具仅在单帧内保留结构关系时有用,跨多步操作仍不可靠。
Suno 发布 Studio 2.0,现向 Premier 订阅者开放。新增时间线 MIDI 导入、录制与编辑,可用 MIDI 剪辑作为生成提示词,附带新的 wavetable 合成器;另推出 Chat bar(beta)协作创作、高级 stem 分离、音频效果与自定义插件、自动化曲线,并支持无损导出 32-bit/48kHz 多轨与 stems。插件创建目前不消耗 credits。
推荐理由:官方发布新增 MIDI、Chat bar、自动化等能力,音乐创作者可据此判断 Suno Studio 2.0 是否融入现有工作流。
Google DeepMind 发布多语言手语转文本(SL2T)模型,首次将手语 AI 用于消费产品,在 Pixel 11 的 Gboard 和 Live Transcribe 中支持 ASL 转英文,后续将扩展更多语言和设备。
推荐理由:官方介绍 SL2T 的技术路径、训练数据和实测限制,读者可以了解手语翻译从实验到消费产品的落地方式。
Google Research 发布 AMIE (Video),基于 Gemini 和 Project Astra 构建实时视频临床问诊系统,采用 Talker、Planner、Perception 三个并行智能体的异步架构。
推荐理由:原文给出异步多智能体架构与随机对照实验设计,读者可以据此了解视频问诊 AI 的能力边界和评估方法。
Microsoft Research 发布研究模型 CARE-X,统一支持胸部 X 光报告生成、疾病分类、定位和校准诊断预测,基于 SigLIP2-so400M 与 Phi-4-mini-instruct (3.8B),采用三阶段 SFT 加 DAPO 强化学习训练。
Meta 发布从 Muse 蒸馏而来的 30B 多模态模型 Muse Glimmer,采用 Apache 2.0 许可,面向本地隐私场景的智能体用途。模型由 2B ViT 视觉编码器和 28B 文本解码器组成,支持图像、视频、多模态工具调用和目标检测,并附带基于 DFlash 的可选投机解码。
推荐理由:原文给出架构组成、基准对比和各推理框架的 day-0 用法,读者可以据此评估本地部署的可行路径。
Google DeepMind 发表 Nature 论文并开源 WeatherNext 2 与 WeatherNext Cyclones 模型,单模型以 SOTA 精度预测气旋路径、强度和风结构,平均多出 24 小时提前量,相当于约十年气象学进步。
推荐理由:官方Nature论文和模型开源同时落地,读者可据此了解AI气象预报达到的精度水平并直接获取代码权重。
Mistral AI 发布开源多模态安全分类器 Shieldstral,权重 3B,采用 Apache 2.0 协议。模型将内容审核改写为推理时的问答任务,用户用自然语言给出政策,无需重训即可适配文本、图像和 prompt–response 对的审核。
推荐理由:原文解释了用问答式策略接口替代固定分类体系的设计思路,并给出训练数据构建方法,读者可以借鉴其小模型超越大模型的数据策略。
Runway 的 Characters 入选 SIGGRAPH 2026 的 Real-Time Live! 环节,团队在数千名图形学专家面前现场演示了从单张图片实时生成可对话角色。
Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型,可通过连续视频流追踪任务进度、编排多步任务,并支持多机器人协作,将运动执行交给下层 VLA 模型。
推荐理由:官方公布具身推理模型的能力指标与 API 入口,开发者可以据此评估它在实体机器人任务编排中的可用性。
Runway 推出 Runway Media Router,称其为首个面向生成式媒体模型的路由功能,已在 Runway Dev 上线,支持视频、图像和音频模型。用户设定成本、质量、延迟偏好及价格上限、允许和拒绝列表等约束后,只调用一个端点,路由器会筛选并评分选出最优模型,返回结果及所用模型的元数据;无模型满足约束时报明确错误,生产前可用 dry-run 验证选型且不产生费用。
Microsoft AI 发布 MAI-Image-2.5-Pro 和 MAI-Voice-2-Flash,两款模型均进入公开预览。
推荐理由:原文给出两款新模型的定价、性能数字和产品落地情况,可据此比较其质量速度成本取舍。
Google 在 DOE Genesis Mission Summit 2026 上宣布投入 4000 万美元 AI tokens 和云 credits,支持 Genesis Mission 的研究人员。
Google DeepMind 发布三款 Gemini 模型:3.6 Flash 在 Artificial Analysis Index 上输出 token 用量比 3.5 Flash 减少 17%。
推荐理由:官方博客给出三款 Flash 模型的 token 效率、价格和多项基准数据,可帮助开发者评估选型与 agent 成本。
OpenRouter 宣布可用单一 OpenAI 兼容 base URL 调用图像、视频、音频、嵌入和转录等全部模态,切换模态只需改模型字符串和内容类型。
Hugging Face 团队推出 Real World VoiceEQ 基准,评估语音交互的人类化质量,覆盖 40 多个专有和开源语音模型、15+ 维度和 60 多项指标,涉及 ASR、TTS、S2S 和语音理解。
Thinking Machines 的开源多模态模型 Inkling 上线 Hugging Face,总参数 975B(激活 41B),原生接收图像、文本和音频输入,支持 1M 上下文和 1M token 训练语料中的 45 万亿 token 多模态训练,同日推出 276B 总参数、12B 激活参数的 Inkling-Small。
推荐理由:官方详细拆解了 Inkling 的 MoE、相对注意力等架构设计,并给出从 2TB BF16 到 1-bit GGUF 的多档部署路径,方便按硬件选型。
Mistral AI 发布首个具身导航模型 Robostral Navigate,8B 参数,仅用单个普通 RGB 相机和自然语言指令即可让机器人在复杂环境中自主导航,在 R2R-CE validation unseen 达到 76.6% 成功率,领先最佳单相机方案 9.7 分、领先使用深度或多相机方案 4.5 分。
OpenRouter 在 MMMU-Pro Vision(1,730 题)上基准测试 OpenAI 和 Google 五款模型的图像 detail 设置,发现 gpt-5.5 用 low 比 auto 低 13.8 分(65.2% vs 79.0%)且每题更贵(5.1¢ vs 4.5¢),原因是模型为看清热压缩图像多花 1.6x 推理 token。
推荐理由:基于 MMMU-Pro Vision 实测五款模型,给出推理模型保持 auto 细节、改调 reasoning effort 省钱的可操作结论。
Hugging Face LeRobot 团队发布 v0.6.0,引入 VLA-JEPA、LingBot-VA、FastWAM 三个世界模型策略,新增 GR00T N1.7、MolmoAct2、EO-1 等 VLA,以及 Robometer、TOPReward 奖励模型和统一奖励 API。
推荐理由:官方完整发布说明覆盖世界模型策略、奖励模型、基准与部署 CLI,读者可据此评估是否升级自己的机器人训练工作流。
Google DeepMind 推出图像模型 Nano Banana 2 Lite(gemini-3.1-flash-lite-image),文生图延迟 4 秒。
推荐理由:官方公告给出了两款模型的定位、价格、延迟和已知限制,开发者可直接据此选型和接入。
Google DeepMind 宣布 computer use 成为 Gemini 3.5 Flash 的内置工具,此前该能力仅由独立的 Gemini 2.5 computer use 模型提供。
推荐理由:原文说明 computer use 从独立模型并入 Gemini 3.5 Flash,并给出 API 入口与企业级防护选项,便于开发者评估接入。
Mistral 发布 Mistral OCR 4,除提取文本外还返回边界框、块类型分类(标题、表格、公式、签名等)和逐页逐词的内联置信度分数,支持 170 种语言、10 个语言组。
推荐理由:官方说明了新模型的结构化输出能力、基准得分及其已知评分缺陷,并给出 API 与 Document AI 的选择规则,便于读者判断适用场景。
Google Research 发布矢量化数据集,将 Farmscapes 2020 的高分辨率栅格地图转为可操作的树篱、石墙与矮林清单,覆盖英国超 13 万平方公里。
Suno 更新 Stem Separation 功能,提供 Auto Split(最多拆出 12 个 stems)、Split from Mix 和仅限 Premier 的 Advanced Split 三种模式。Advanced Split 可从近 100 种乐器中精确提取;Suno 采用重新生成每个 stem 而非切割混音的做法。该功能适用于平台创作及上传的音乐,需付费订阅。
Google DeepMind 发布音频模型 Gemini 3.5 Live Translate,支持 70+ 语言近实时语音到语音翻译,自动检测语言并保留说话者的语调、节奏和音高,全程仅落后说话者几秒。
推荐理由:原文给出模型能力、开放渠道和 Meet 语言扩展细节,读者可据此评估它在会议和翻译场景的可用性。
Microsoft AI 发文阐述其在医疗领域的产品与研究方向,称旗下消费产品每天处理数千万条健康问题,对 50 万条 Copilot 对话的分析显示用户依赖 AI 做症状解读、检查结果解释和就医导航。
推荐理由:微软官方阐述其在医疗领域的价值落地,读者可以据此了解 MAI DxO、Mayo Clinic 合作与 Copilot Health 的进展全貌。
Dynamo 与 SGLang 通过设备感知加权路由实现异构 Encode-Prefill-Decode(EPD)分离,将 VLM 的视觉编码任务卸载到 CPU。在 Qwen3-VL-8B-Instruct 上,该方案相比纯 GPU EPD 在 QPS 1-2 负载下取得约 1.2x-1.3x 的 P99 TTFT 与请求吞吐提升,P99 TPOT 降低约 1.3x-30x。
Mistral 发布 Mistral Medium 3.5,一个 128B 稠密开源权重模型(modified MIT 许可),256k 上下文窗口,SWE-Bench Verified 得分 77.6%,τ³-Telecom 得分 91.4,自托管最少只需四块 GPU,API 定价每百万输入 token $1.5、输出 token $7.5。
推荐理由:官方同步发布模型与云端异步智能体,给出基准分数、定价和开源权重,可对照评估其编码与长程任务能力。
Google DeepMind 在 Project Genie 中推出基于 Street View 的世界生成能力,用户可通过 Maps 图钉选择美国地点并叠加 Ocean World、B&W film 等风格,生成起点绑定真实街景的交互式世界,底层由 Maps Imagery Grounding 驱动。
Runway 发布 Characters,基于 GWM-1 将单张参考图转为可实时对话的视频角色,无需微调,支持写实人像、卡通和吉祥物等风格。模型每帧有效耗时 37 毫秒,用户停止说话到角色开口的服务端延迟 1.75 秒;通过扩散变换器与 VAE 解码器流水线并行、KV-cache 管理、CUDA Graphs 和 Triton 核优化实现 24fps 实时生成。
推荐理由:官方技术博客拆解了实时管线的关键数字和系统优化,读者可以据此理解单图驱动的对话视频智能体的实现路径。
Sierra 开源 μ-Bench,包含来自 250 通真实客服电话的 4,270 条人工标注语音,覆盖英语、西班牙语、土耳其语、越南语和普通话,评测 Deepgram Nova-3、Google Chirp-3、Azure Speech、ElevenLabs Scribe v2 和 OpenAI GPT-4o Mini Transcribe。
Google DeepMind 发布 Gemini Robotics-ER 1.6,提升机器人在空间推理、多视角理解、任务规划和成功检测方面的能力,并新增仪表读数功能。
推荐理由:官方给出了与上一代的具体能力对比和仪表读数新用例,读者可据此评估其是否适配现有机器人方案。
Mistral AI 发布 4B 参数的文本转语音模型 Voxtral TTS,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言,API 定价 $0.016 per 1k characters。
推荐理由:官方给出了与 ElevenLabs 对比的人类评测数据和低延迟指标,读者可据此评估其在语音 Agent 场景的可用性。
Google Research 在 The Check Up 活动上展示了多项医疗 AI 进展,包括与 Fitbit 合作研究的 Personal Health Agent(PHA),发现其比单一任务应用更能支持长期健康。
Mistral 发布 Mistral Small 4,将 Magistral 的推理、Pixtral 的多模态与 Devstral 的智能体编码能力统一到单一开源模型,采用 Apache 2.0 许可证。
推荐理由:官方公布了架构参数、reasoning_effort 用法和与 GPT-OSS 120B 的效率对比,可据此评估其开源部署价值。