跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

当前仅显示精选新闻
235条精选相关主题图像生成AI 视频语音与音频

最新精选

第 41–60 条 · 共 235 条
9月4日周五
  1. Google Research64

    Google Research 联合 HHMI Janelia 发布完整雄性果蝇大脑连接组

    Google Research 与 HHMI Janelia、MRC 分子生物学实验室及剑桥大学等合作,在 Cell 发表雄性果蝇大脑和中央神经系统的完整连接组,包含超 166,000 个神经元和 1.25 亿个突触连接,是迄今按神经元数量计最大的脑图谱。

    推荐理由:由参与方介绍完整雄性果蝇连接组,读者可了解其规模、AI 重建方法及对后续脑映射研究的用途。

9月3日周四
  1. Google DeepMind72

    Google DeepMind 发布 WeatherNext 3 全球 AI 天气模型

    Google DeepMind 与 Google Research 发布 WeatherNext 3,称其为最先进准确的全球 AI 天气模型。模型直接学习实时卫星数据和气象站观测,逐小时产出最高 5 公里分辨率预报,精度约为 WeatherNext 2 的五倍;中期降水预报 CRPS 相对 IMERG 提升最高 60%。

    推荐理由:官方介绍了新模型的分辨率、逐小时更新和降水精度提升,并说明其在 Google 各产品中的落地方式,读者可评估对天气相关业务的应用价值。

9月2日周三
  1. @kimmonismus66

    Qwen3.8-Max 升级为 Qwen3.8-Max-0902,参数量 2.4T、上下文 1M tokens,已在 QwenCloud API 上线,定价为每 1M tokens 输入 $2、输出 $6,并针对 Coding 与 Cowork 做了后训练。作者称该版本在基准上已接近 Fable 5,并注意到如此明显的提升已不再伴随版本号变化,同时认为中国实验室与美国的差距正在缩小。

    引用@Alibaba_Qwen@Alibaba_Qwen

    🚀Qwen3.8-Max just got upgraded. Meet Qwen3.8-Max-0902! 2.4T parameters. 1M context tokens. Built for real world complexity. Further post trained on Coding & Cowork, Qwen3.8-Max-0902 now delivers stronger performance across complex enterprise tasks, scientific research, and long horizon workflows. 💰Pricing per 1M tokens: $2 input, $6 output. $0.17 explicit cache hit, $0.25 implicit cache hit. Now live via API on QwenCloud. Come try it! 🙌 API: https://t.co/dq3WgMk980

    推荐理由:材料给出 Qwen3.8-Max-0902 的参数、上下文与定价,作者由此讨论版本迭代节奏和中美实验室差距的缩小。

  2. @GoogleDeepMind67

    Gemini 的智能体视频理解开始在 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上通过 Google AI Studio 的 API 推送,并即将登陆 Gemini App。该能力不再扫描整个文件,而是跨视频字幕、音频和画面做推理,动态调整帧率以定位所需片段,长视频内容(从 10 分钟指南到数小时录像)的效率提升最明显。官方图表显示,在 1H-VideoQA 与 LVBench 等长视频基准上,单次查询 token 从约 30 万至 40 万降至 5 万以内,准确率同步小幅上升。

    推荐理由:官方图表给出长视频场景 token 消耗大幅下降而准确率上升的对比,读者可据此判断长视频处理的成本空间。

  3. Google DeepMind68

    Google DeepMind 为 Gemini 推出 agentic video understanding 视频分析功能

    Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上推出 agentic video understanding,动态检索视频片段以替代固定帧率处理,token 消耗最多降 88%,成本最多降 66%,准确率最多提升 7%。

    推荐理由:官方给出 token、成本与准确率的具体降幅和开启方式,长视频处理场景下可评估是否切换处理模式。

9月1日周二
  1. Runway News68

    Runway 发布 Interface World Model 首个模型 Solaris,实时生成可交互界面

    Runway 发布 Solaris,定位为 Interface World Model 系列的首个模型,基于 Gen-4.5 改造,逐帧实时生成应用和网站界面,无需代码等中间表示。用户研究显示 250 名参与者约 7500 次成对评判中,61% 偏好其遵循指令(对比编码界面的 24%),71% 认为交互更自然;文本渲染、长会话一致性和无障碍集成仍是待解难题,现已开放早期访问申请。

    推荐理由:官方详细说明了实时生成的原理、与 Claude Opus 5 的对比数据和遗留短板,读者可以据此判断这类界面生成模型的实际边界。

  2. Gemini API 更新日志64

    Gemini API 为 Flash 系列模型推出智能体式视频理解

    Google 在 Gemini API 中为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 推出智能体式视频理解,覆盖 Interactions 和 GenerateContent 两个 API。模型可动态导航视频时间线,按需请求转录文本、帧或音轨,长视频内容相比静态处理的 token 用量最多减少 88%。

    推荐理由:官方更新日志给出按需取用视频素材的机制和 88% token 节省数字,便于评估长视频处理的成本变化。

8月28日周五
  1. AGI Hunt · 微信公众号79

    阿里千问开源 Qwen3.8-Flash-Next,6B 激活在 9 项基准中 8 项超过 Opus 4.6 Max

    阿里千问于 8 月 26 日晚开源 Qwen3.8-Flash-Next 权重,生产版 Qwen3.8-Flash 同步上线千问 AI 平台 API,官方称这套 Next 架构是 Qwen4 系列的雏形。

    推荐理由:作者在 Qoder 中实测了这款每 token 仅激活 6B 的 MoE 模型,并拆解其稀疏注意力与外挂 N-gram 表的设计取舍。

8月27日周四
  1. @SiliconFlowAI66

    Zai 开源发布 GLM-5.3-Flash,并已在 SiliconFlow 上线,SiliconFlow 提供 Day-0 支持。该模型为 320B 总参数、18B 激活参数,原生多模态,采用 MIT 许可。官方称其强于 GLM-5.2 且便宜 90%,在编码与 Agent 任务上接近 Opus 4.8,成本低 95% 以上。

    推荐理由:GLM-5.3-Flash 以 320B 总参、18B 激活的开源配置上线 SiliconFlow,读者可据此对比它与前代在成本上的变化。

  2. 数字生命卡兹克 · 微信公众号77

    智谱发布 GLM-5.3-Flash,320B MoE 原生多模态模型

    智谱发布 GLM-5.3-Flash,即一周来在 OpenRouter 和 OpenCode 上匿名测试的 OX Alpha。该模型总参数 320B、每次激活 18B,是 GLM-5 系列首个原生多模态模型,支持图像、视频和文本输入,原生上下文 100 万,使用 30 万亿 Token 多模态数据预训练。

    推荐理由:模型定价与国产卡推理规模是这篇实测里最值得看的两点,读者可据此判断日常任务的模型选择。

  3. @omarsar070

    @Zai_org 发布 GLM-5.3-Flash,一个 320B-A18B 的原生多模态模型,支持 1M token 上下文窗口,采用 MIT 许可,权重、API 与编码方案等入口同步开放。该模型此前以 Ox Alpha 为名预览,完全运行在中国 AI 芯片上。Elvis Saravia 称自己在 /eli5 视觉讲解场景中使用它效果好,并推荐在 Pi 或 Hermes Agent 的新 agent playground 中试用。

    原始视频预览图;未保存可播放视频URL
    引用@Zai_org@Zai_org

    Introducing GLM-5.3-Flash - Leading capabilities at a highly competitive price - Natively multimodal with a 1M-token context window - A 320B-A18B model released under the MIT License - Previously previewed as Ox Alpha, running entirely on Chinese AI chips Blog: https://t.co/tzOmB7gdZP Available now across all official platforms: Weights: https://t.co/9LRMahY9Wa API: https://t.co/VcaQnzYmS9 Coding Plan: https://t.co/Nk8Y98HNhU ZCode: https://t.co/Peepqv4XSx Chat: https://t.co/WCqWT0qCQb AutoClaw: https://t.co/aGEG5HqTTb

    推荐理由:引用内容公布了 GLM-5.3-Flash 的参数量、上下文窗口与开源许可,读者可据此判断其定位与获取方式。

  4. 量子位 · 微信公众号81

    智谱发布并开源 GLM-5.3 Flash,为 GLM-5 系列首个原生多模态模型

    智谱发布并开源 GLM-5.3 Flash,这是 GLM-5 系列首个原生多模态模型,总参数 320B、激活参数 18B,能力超过体量 753B 的 GLM-5.2。该模型在 AA 榜单拿到 57 分,与 Claude Opus 4.8 持平,限时折扣价为后者的 1/40,并已接入 ZCode 和开放 API。模型权重已在 Hugging Face 开源,承接线上真实请求的算力来自国产芯片。

    推荐理由:实测呈现了这个 320B 模型在多模态与编码任务上的表现,并交代了低价与国产芯片部署两层背景。

  5. Gemini API 更新日志64

    Gemini Omni Flash 转正为 gemini-omni-1.1-flash,新增视频延伸与首尾帧插值

    Google 发布 gemini-omni-1.1-flash,即对话式视频生成与编辑模型 Gemini Omni Flash 的 GA 版本。新增视频延伸、首尾帧插值(最多 2 张图)以及 360p 到 4K 的分辨率参数,1080p 和 4K 通过超分辨率生成;预览端点 gemini-omni-flash-preview 将于 2026 年 9 月 30 日弃用。

    推荐理由:官方更新日志给出 GA 版本的新能力清单和预览端点停用时间,开发者可据此规划迁移。

8月26日周三