跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

当前仅显示精选新闻
238条精选相关主题图像生成AI 视频语音与音频

最新精选

第 161–180 条 · 共 238 条
6月3日周三
  1. @berryxia71

    微软 AI 在 Build 上发布七个全新 MAI 模型,官方称并非简单迭代,而是从零开始、干净数据血统、零蒸馏训练的一整个家族,涵盖推理、编码、图像、转录与语音并各有 Flash 版本。

    引用Microsoft AI (@MicrosoftAI)@MicrosoftAI

    Seven new models launching at Build: let’s go! Reasoning. Code. Image. Transcribe. Voice. Built from scratch on a clean data lineage, designed for efficiency, working seamlessly as a family of models Thread 🧵 #MSBuild

    推荐理由:文中梳理了七个 MAI 模型的任务分工与基准数字,可据此了解微软从零训练、任务专精的模型家族路线。

  2. @MiniMax_AI74

    MiniMax 发布多模态模型 MiniMax-M3,在 Vals Index 与 Vals Multimodal Index 上成为新的开源权重 SOTA。据其引用的 ValsAI 内容,这是 MiniMax 首款多模态模型,整体排名第 6。

    引用Vals AI (@ValsAI)@ValsAI

    MiniMax just released MiniMax-M3, their first multimodal model. It is the new open-weight SOTA on the Vals Index and the Vals Multimodal Index, and #6 overall.

    推荐理由:MiniMax 的多模态模型在 Vals 两个榜单取得开源权重最佳成绩,读者可对照它与整体榜单前列的排名差距。

6月2日周二
  1. Microsoft AI News60

    Microsoft AI 阐述医疗领域布局:与 Mayo Clinic 合作开发医疗前沿模型并开放 Copilot Health 预览

    Microsoft AI 发文阐述其在医疗领域的产品与研究方向,称旗下消费产品每天处理数千万条健康问题,对 50 万条 Copilot 对话的分析显示用户依赖 AI 做症状解读、检查结果解释和就医导航。

    推荐理由:微软官方阐述其在医疗领域的价值落地,读者可以据此了解 MAI DxO、Mayo Clinic 合作与 Copilot Health 的进展全貌。

  2. @MiniMax_AI68

    MiniMax 发布开源权重模型 M3,称其为首个同时具备编码、Agent 与多模态三项前沿能力的模型。M3 在 SWE-Bench Pro 得 59.0%、Terminal Bench 2.1 得 66.0%、MCP Atlas 得 74.2%,并通过 MiniMax Sparse Attention 将上下文扩展到 1M,从 Step Zero 起原生多模态。API 与 Token Plan 已在 platform.minimax.io 开放,MiniMax Code 在 code.minimax.io,权重与技术报告约 10 天后发布。

    引用MiniMax (official) (@MiniMax_AI)@MiniMax_AI

    Introducing MiniMax M3: The First Open-Weights Model to Combine Three Frontier Capabilities - Coding & Agentic Frontier: 59.0% SWE-Bench Pro, 66.0% Terminal Bench 2.1, 34.8% SWE-fficiency, 28.8% KernelBench Hard, 74.2% MCP Atlas - MiniMax Sparse Attention scales context to 1M - Natively Multimodal from Step Zero API: platform.minimax.io Token Plan: platform.minimax.io/subscrib… 🚀New! MiniMax Code: code.minimax.io Weights & Tech Report in ~10 Days

    推荐理由:原文列出 M3 的编码与 Agent 基准成绩及 1M 上下文能力,可对照开源模型的当前水位。

  3. @MiniMax_AI69

    MiniMax M3 已在 Vercel AI Gateway 上线,这是 MiniMax 首个长上下文模型,支持 1M token 上下文和多模态输入。上线首周提供 50% 折扣,模型标识为 minimax/minimax-m3。

    引用Vercel Developers (@vercel_dev)@vercel_dev

    MiniMax M3 is available on AI Gateway. MiniMax's first long-context model, with support for multimodal inputs. 50% off for the next week. 𝚖𝚘𝚍𝚎𝚕: '𝚖𝚒𝚗𝚒𝚖𝚊𝚡/𝚖𝚒𝚗𝚒𝚖𝚊𝚡-𝚖𝟹' vercel.com/changelog/minimax…

    推荐理由:MiniMax M3 通过 Vercel AI Gateway 开放调用,1M token 上下文与多模态输入是其主要能力变化。

  4. @alibaba_cloud74

    阿里云发布 Qwen3.7-Plus,一个把视觉与语言统一到同一个智能体基础模型中的多模态智能体模型。官方称其支持 GUI 与 CLI 统一操作、全模态输入的编码与生产力助理,以及感知、推理、grounding 和检索增强问答的视觉智能体能力,并可跨不同智能体框架泛化。该模型现通过阿里云 Model Studio API 提供,同时给出 Qwen Studio 与博客入口。

    推荐理由:官方列出多模态智能体的能力清单与 API 入口,读者可据此判断它在自身工作流中的可用性。

  5. @MiniMax_AI73

    MiniMax 的模型 M3 在上线首日接入 Cloudflare AI Gateway。Cloudflare 转发称 M3 是首个推进编码前沿的开源模型,支持 1M 上下文和原生多模态理解,首周对上下文不超过 512K 的请求提供 50% 折扣,可通过 AI Gateway 试用。

    引用Cloudflare Developers (@CloudflareDev)@CloudflareDev

    M3 from @MiniMax_AI is now available on Cloudflare AI Gateway: - First open model to push SOTA coding frontier - 1M context and native multimodal understanding - 50% off during the first week for requests ≤ 512K context Try it out through AI Gateway today! developers.cloudflare.com/ai…

    推荐理由:M3 上线当天即可通过 Cloudflare AI Gateway 调用,读者可据此了解这款开源编码模型的能力与首周折扣。

  6. @kimmonismus65

    千问(Qwen)发布多模态智能体模型 Qwen3.7-Plus,将视觉与语言统一到同一智能体底座。官方列出四项能力:GUI 与 CLI 统一操作、全模态输入的编码智能体与生产力助手、具备感知推理定位与搜索增强问答的视觉智能体,以及跨智能体框架泛化,现已通过阿里云 Model Studio 开放 API(Blog:qwen.ai/blog?id=qwen3.7-plus)。转发者 @kimmonismus 认可其多模态表现,但质疑官方为何将自家模型与 GPT-5.4、Opus 4.6 对比。

    引用Qwen (@Alibaba_Qwen)@Alibaba_Qwen

    👏👏 Introducing Qwen3.7-Plus — a multimodal agent model that unifies vision and language into one versatile agent foundation. ✅ Multimodal interactive hybrid agent: unified GUI & CLI operation across visual and text tasks ✅ Versatile coding agent & productivity assistant with full-modality input ✅ Visual Agent: perception, reasoning, grounding, and search-augmented QA ✅ Cross-harness generalization across diverse agent frameworks One model. Sees, thinks, codes, acts.🙌🙌 Now available via API on Alibaba Cloud Model Studio. Try it — let us know what you build.😎 🔗🔗⬇️⬇️ Blog:qwen.ai/blog?id=qwen3.7-plus Qwen Studio:chat.qwen.ai/?models=qwen3.7… API:modelstudio.console.alibabac…

    推荐理由:官方把 Qwen3.7-Plus 与 GPT-5.4、Opus 4.6 并列对比,读者可据此观察多模态智能体模型的竞争位置。

  7. @berryxia67

    Gemini Omni 上线数字头像功能,用户在 Gemini App 或网页的设置菜单点 Avatar,拍几张照片并录几句语音即可生成外貌与声音都像本人的数字分身。生成后在工具栏选中该 Avatar,就能把自己放进视频,普通用户几分钟可完成。所有用 Gemini Omni 生成的视频都会自动嵌入不可见 SynthID 数字水印,可在 Gemini App 中验证其是否为 AI 生成。

    引用Google Gemini (@GeminiApp)@GeminiApp

    Easily add yourself to your video creations in Gemini. Here’s how to create your own digital avatar that looks and sounds like you with Gemini Omni. 🧵

    推荐理由:原文给出三步生成数字分身并嵌入视频的流程,并说明 SynthID 水印可用于验证 AI 生成来源。

  8. @kilocode67

    MiniMax 发布 M3 模型,官方称其为首个同时整合编程、Agent 与多模态三项前沿能力的开放权重模型。官方报告其在 SWE-Bench Pro 取得 59.0%、Terminal Bench 2.1 取得 66.0%、SWE-fficiency 取得 34.8%、KernelBench Hard 取得 28.8%、MCP Atlas 取得 74.2%,并通过 MiniMax Sparse Attention 将上下文扩展到 1M。模型从第一步起原生多模态,权重与技术报告预计约 10 天后发布,API 与 MiniMax Code 入口已开放。

    引用MiniMax (official) (@MiniMax_AI)@MiniMax_AI

    Introducing MiniMax M3: The First Open-Weights Model to Combine Three Frontier Capabilities - Coding & Agentic Frontier: 59.0% SWE-Bench Pro, 66.0% Terminal Bench 2.1, 34.8% SWE-fficiency, 28.8% KernelBench Hard, 74.2% MCP Atlas - MiniMax Sparse Attention scales context to 1M - Natively Multimodal from Step Zero API: platform.minimax.io Token Plan: platform.minimax.io/subscrib… 🚀New! MiniMax Code: code.minimax.io Weights & Tech Report in ~10 Days

    推荐理由:官方给出 M3 的编程与 Agent 基准数据及 1M 上下文能力,可据此观察开源权重模型的前沿能力边界。

6月1日周一
  1. @kimmonismus74

    MiniMax 发布 M3 开放权重模型,在 SWE-Bench Pro 上得分 59%,略高于 GPT-5.5 的 58.6%,高于 Gemini 3.1 Pro 的 54.2%,编码上仍落后 Opus 4.7。该模型支持 1M token 上下文并原生多模态,在 BrowseComp 上以 83.5% 领先 Opus 4.7,每 token 成本约为 GPT-5.5 的 1/12。权重和完整技术报告预计约 10 天后发布。

    引用MiniMax (official) (@MiniMax_AI)@MiniMax_AI

    Introducing MiniMax M3: The First Open-Weights Model to Combine Three Frontier Capabilities - Coding & Agentic Frontier: 59.0% SWE-Bench Pro, 66.0% Terminal Bench 2.1, 34.8% SWE-fficiency, 28.8% KernelBench Hard, 74.2% MCP Atlas - MiniMax Sparse Attention scales context to 1M - Natively Multimodal from Step Zero API: platform.minimax.io Token Plan: platform.minimax.io/subscrib… 🚀New! MiniMax Code: code.minimax.io Weights & Tech Report in ~10 Days

    推荐理由:原文给出了 M3 与 GPT-5.5、Opus 4.7 的基准对比和成本差距,读者可据此判断开放权重模型的能力位次。

  2. @PBDTokenRouter68

    MiniMax M3 现已在 PBD TokenRouter 上线,该开源权重模型同时具备编码与智能体能力。其在 SWE-Bench Pro 取得 59.0%、Terminal Bench 2.1 取得 66.0%、MCP Atlas 取得 74.2%,并借 MiniMax Sparse Attention 支持最高 1M token 上下文,且原生支持多模态。PBD 自 M2.7 起与 MiniMax 团队合作,用户可用同一密钥替换模型 ID 调用。

    推荐理由:原文列出 M3 的三项基准分数与 1M token 上下文,读者可据此比较其与同类开源模型的定位。

  3. @kimmonismus70

    Cosmos 3 在多个公开榜单登顶,成为 Artificial Analysis 文本生成图像和图像生成视频的开源模型第一名。它在 Physics-IQ 的物理准确性上超过 Sora 2,在 PAI-Bench 整体领先 Veo 3.1,并在 RoboArena 位列机器人策略第一。作者称其以开放权重在物理表现上超过闭源前沿视频模型。

    推荐理由:原文列出 Cosmos 3 在文本生成图像、图像生成视频等多个榜单的开源排名,可据此比较开源模型与闭源前沿模型的差距。

  4. @kimmonismus78

    NVIDIA 在 GTC Taipei 开源物理 AI 模型 Cosmos 3,作者称其为首个完全开放的 omnimodel,可理解现实世界、预测后续变化并生成机器人动作。该模型开放权重、代码与数据集,NVIDIA 同步发布 Super(32B)与 Nano(8B)两个版本。

    引用NVIDIA AI (@NVIDIAAI)@NVIDIAAI

    Introducing Cosmos 3: Our latest frontier model for Physical AI Cosmos 3 is the world’s first fully open omnimodel with native vision reasoning, world and action generation. Today we’re releasing Super (32B) and Nano (8B) variants. Video

    推荐理由:英伟达开源 Cosmos 3 的权重、代码与数据集,读者可了解物理 AI 全开放模型的两种规模与开放范围。

  5. @MiniMax_AI66

    MiniMax 发布 M3 模型。官方主推提到视频控制、游戏等场景,以及开源权重、超大上下文和强编码能力。引用评测 @MinLiBuilds 称 M3 有 1M context、原生多模态与 Agentic 三项特性,并用截图在多 agent 工作流下于 2 小时做出可运行的双人对决小游戏。

    引用实践哥MinLi (@MinLiBuilds)@MinLiBuilds

    跟祖传的 20K context 说 bye bye 了。 MiniMax M3 发布了,三个亮点: 1M context、原生多模态、Agentic。 我这次做了一次完整评测,使用CC workflow 、 @ZenMuxAI和MiniMax M3: 给一张截图,做一个“凡人修仙剑阵对决手势游戏”。 要求是:支持双人对决 、使用 workflow 拆解任务、加入石头剪刀布机制。 2 小时后,游戏真的跑起来了。 这一代LLM的版本答案我知道了: 1M 上下文 + 多模态+ agent 模式。 1M context 是推理深度的基础,多 agent 负责拆任务和执行。 Video

    推荐理由:官方给出 M3 的开源权重与大上下文等信息,引用评测展示了多模态加 Agent 工作流的实际产出。

  6. @flowith65

    flowith 宣布现已支持 MiniMax M3,并称其具备 1M 上下文、出色的编码能力和原生多模态。作者表示可以在 flowith 中并排运行并对比不同模型。其引用的 MiniMax 发布信息称,M3 是首个同时结合三项前沿能力的开放权重模型,代码与智能体评测包括 SWE-Bench Pro 59.0%、Terminal Bench 2.1 66.0%、MCP Atlas 74.2%,权重与技术报告约 10 天后发布。

    引用MiniMax (official) (@MiniMax_AI)@MiniMax_AI

    Introducing MiniMax M3: The First Open-Weights Model to Combine Three Frontier Capabilities - Coding & Agentic Frontier: 59.0% SWE-Bench Pro, 66.0% Terminal Bench 2.1, 34.8% SWE-fficiency, 28.8% KernelBench Hard, 74.2% MCP Atlas - MiniMax Sparse Attention scales context to 1M - Natively Multimodal from Step Zero API: platform.minimax.io Token Plan: platform.minimax.io/subscrib… 🚀New! MiniMax Code: code.minimax.io Weights & Tech Report in ~10 Days

    推荐理由:flowith 上线 MiniMax M3 支持,读者可了解该模型在 1M 上下文与原生多模态上的接入进展。

  7. @MiniMax_AI66

    MiniMax M3 已在 Novita AI 上线,作为 Day-0 API 合作方开放,首周享 50% 折扣。Novita 称 M3 是首个同时具备前沿编码与智能体能力、最高 1M tokens 上下文和原生多模态的开源权重模型,其中上下文由 MiniMax Sparse Attention 实现,基准成绩为 59.0% SWE-Bench Pro、66.0% Terminal Bench 2.1、74.2% MCP Atlas。

    引用Novita AI (@novita_labs)@novita_labs

    🚀 We’re launching MiniMax M3 from @MiniMax_AI on Novita AI as a Day-0 API launch partner. The first open-weights model to combine: • Frontier coding and agent capabilities 59.0% SWE-Bench Pro, 66.0% Terminal Bench 2.1, 74.2% MCP Atlas • Up to 1M tokens of context Enabled by MiniMax Sparse Attention • Native multimodality from day one Built for both text and visual understanding Excited to make MiniMax M3 available to developers on Day 0. Video

    推荐理由:M3 在 Novita 上线并附上 SWE-Bench Pro 等基准,可据此了解其编码与智能体能力定位。

  8. @op741870

    MiniMax 发布大版本模型升级 MiniMax M3,标配 1M 超长上下文,采用新的 MSA(MoE with Segment-wise Attention)稀疏注意力架构,并从训练起融合文本、图片、视频和桌面操作的原生多模态能力。

    引用MiniMax (official) (@MiniMax_AI)@MiniMax_AI

    Introducing MiniMax M3: The First Open-Weights Model to Combine Three Frontier Capabilities - Coding & Agentic Frontier: 59.0% SWE-Bench Pro, 66.0% Terminal Bench 2.1, 34.8% SWE-fficiency, 28.8% KernelBench Hard, 74.2% MCP Atlas - MiniMax Sparse Attention scales context to 1M - Natively Multimodal from Step Zero API: platform.minimax.io Token Plan: platform.minimax.io/subscrib… 🚀New! MiniMax Code: code.minimax.io Weights & Tech Report in ~10 Days

    推荐理由:MiniMax M3 标配 1M 上下文并采用新的稀疏注意力架构,读者可据此了解长上下文模型的算力成本变化。

  9. Hugging Face Blog80

    NVIDIA 发布 Cosmos 3:首个面向物理 AI 推理与动作的开源全模态模型

    NVIDIA 在 Hugging Face 上发布 Cosmos 3,这是一个面向物理 AI 的开源全模态模型。它基于 Mixture-of-Transformers 架构,将世界生成、物理推理与动作生成整合到单一模型中。

    推荐理由:NVIDIA 将世界生成、物理推理与动作生成整合到一个模型中,并给出开源模型与 Diffusers 接入方式。

  10. @MiniMax_AI69

    MiniMax 发布 M3,引用内容描述其为开放权重的前沿级模型,具备 1M 上下文窗口和图像、视频原生多模态能力。MiniMax 官方账号表示 M3 可与 visionagents_ai 结合用于实时语音与视频。

    引用Vision Agents (@visionagents_ai)@visionagents_ai

    Congrats to the @MiniMax_AI team on the release of M3! 👉 A frontier-class open-weight model 👉 1M context window 👉 Native multimodality (image & video)

    推荐理由:MiniMax M3 以开放权重、1M 上下文和原生多模态发布,读者可据此了解实时语音与视频的集成方向。