跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

当前仅显示精选新闻
246条精选相关主题图像生成AI 视频语音与音频

最新精选

第 141–160 条 · 共 246 条
6月22日周一
6月17日周三
6月15日周一
  1. 赛博禅心 · 微信公众号76

    MiniMax 开源 428B 参数 M3 模型权重,同步发布 MSA 技术论文

    MiniMax 开源了 MiniMax M3 模型权重,并同步发布 MSA(MiniMax Sparse Attention)技术论文。M3 是 MiniMax 的原生多模态旗舰模型,总参数 428B,激活参数 23B,文中称其是第一个从 Step 0 开始做多模态混合训练的开源模型。

    推荐理由:M3 从 Step 0 起做多模态混合训练并开源权重,同时公开 MSA 稀疏注意力论文,可了解其长上下文成本设计思路。

  2. inclusionAI Hugging Face models65

    inclusionAI 发布 Ming-omni-tts-16.8B-A3B 统一音频生成模型

    inclusionAI 发布 Ming-omni-tts-16.8B-A3B 统一音频生成模型,可在单通道内联合合成语音、环境声与音乐。模型基于自研 12.5Hz 连续 tokenizer 与 Patch-by-Patch 压缩,将 LLM 推理帧率降至 3.1Hz,并内置 100+ 音色与零样本语音设计。

    推荐理由:该模型在单通道内联合生成语音、环境声与音乐,并用方言与情感控制基准对比 CosyVoice3 与 Qwen3-TTS。

6月10日周三
  1. @berryxia69

    Anthropic 发布 Claude Fable 5,这是一款 Mythos 级模型,已被做成安全版本面向通用场景开放,能力超过其此前任何公开模型。基准评测近乎全线 SOTA,在软件工程、知识工作、科研和视觉等硬任务上领先,长任务越复杂领先越多。

    引用Claude (@claudeai)@claudeai

    Introducing Claude Fable 5: a Mythos-class model that we’ve made safe for general use. Its capabilities exceed those of any model we’ve ever made generally available. Video

    推荐理由:原文列出该模型基准几乎全线 SOTA,并说明敏感领域会自动回退到 Opus 4.8 的机制。

  2. @dotey79

    Anthropic 发布 Claude Fable 5 和 Claude Mythos 5 两个模型,二者共用同一底座,Fable 5 加装安全分类器面向所有用户开放,Mythos 5 去掉部分安全限制只给 Project Glasswing 网络安全合作伙伴使用。

    引用Claude (@claudeai)@claudeai

    Introducing Claude Fable 5: a Mythos-class model that we’ve made safe for general use. Its capabilities exceed those of any model we’ve ever made generally available. Video

    推荐理由:同底座的两个模型分走通用与受限两条路线,安全降级机制与定价变化构成理解这次发布的关键。

  3. @kimmonismus80

    Claude 5 Fable 上线,作者称即便在德国也已可用。所引 @claudeai 内容称 Fable 5 在几乎所有测试基准上达到 SOTA,在软件工程、知识工作、科学研究和视觉方面表现突出,任务越长越复杂,其相对其他模型的领先幅度越大。

    引用Claude (@claudeai)@claudeai

    Fable 5 is state-of-the-art on nearly all tested benchmarks, with exceptional performance in software engineering, knowledge work, scientific research, and vision. The longer and more complex the task, the larger Fable 5’s lead over our other models.

    推荐理由:原文转述 Claude 官方发布的基准声明,读者可据此了解 Fable 5 在长任务上相对其他模型的领先幅度。

6月9日周二
  1. Google DeepMind67

    Google DeepMind 发布 Gemma 4 12B:无编码器统一架构的多模态模型

    Google DeepMind 发布 Gemma 4 12B,采用无编码器统一架构,视觉与音频输入直接进入 LLM backbone,是该系列首个支持原生音频输入的中等规模模型。

    推荐理由:官方说明新模型以无编码器统一架构把性能接近 26B 的多模态能力压到 16GB 内存笔记本可跑,开发者可据此评估端侧部署选择。

  2. Hugging Face Blog66

    智能体如何串联两个 Hugging Face Space 搭建 3D 巴黎画廊

    一个编码智能体通过读取 Hugging Face Spaces 的 agents.md,串联图像生成 Space ideogram-ai/ideogram4 与单图 3D 重建 Space VAST-AI/TripoSplat,自动搭建出展示巴黎地标 3D Gaussian splat 的静态网站。

    推荐理由:原文记录了用 agents.md 让编码智能体串联图像与 3D 重建两个 Space 的完整流程,方法可直接复用。

6月6日周六
  1. @GeminiApp66

    Gemini 官方应用宣布,Gemini Live 现在可以直接创建和编辑图像,并支持实时完成。用户打开 Gemini App、点击 Live 按钮并共享摄像头后,用语音告诉 Gemini 想看到的内容,可用于房间装饰测试、数学题辅助和制作表情包等场景。

    推荐理由:官方给出了提问方式和操作路径,读者可以据此了解 Gemini Live 实时图像生成与编辑的使用门槛。

6月5日周五
  1. Hugging Face Blog61

    NVIDIA 发布 Nemotron 3.5 Content Safety 多模态安全模型

    NVIDIA 发布 Nemotron 3.5 Content Safety,基于 Google Gemma 3 4B IT 微调,把多模态输入、自定义企业策略与可审计推理链统一到单次推理调用中,并保持 12 种语言显式训练和约 140 种语言的零样本泛化。

    推荐理由:相比 Nemotron 3,3.5 版把多模态审核、自定义策略与可审计推理链合并到一次调用中。

6月4日周四
  1. @RyanLeeMiniMax66

    MiniMax 发布开放权重模型 MiniMax M3,官方称其是首个同时结合编码与智能体、100 万上下文、原生多模态三项前沿能力的开放权重模型。官方给出 59.0% SWE-Bench Pro、66.0% Terminal Bench 2.1 等成绩,通过 MiniMax Sparse Attention 将上下文扩展至 1M,并从 Step Zero 起原生多模态。作者补充 M3 目前位列 ArtificialAnalysis 第 8,因需并行开源 MSA 算子,权重将于下周晚些时候向所有人发布。

    引用MiniMax (official) (@MiniMax_AI)@MiniMax_AI

    Introducing MiniMax M3: The First Open-Weights Model to Combine Three Frontier Capabilities - Coding & Agentic Frontier: 59.0% SWE-Bench Pro, 66.0% Terminal Bench 2.1, 34.8% SWE-fficiency, 28.8% KernelBench Hard, 74.2% MCP Atlas - MiniMax Sparse Attention scales context to 1M - Natively Multimodal from Step Zero API: platform.minimax.io Token Plan: platform.minimax.io/subscrib… 🚀New! MiniMax Code: code.minimax.io Weights & Tech Report in ~10 Days

    推荐理由:官方给出三项前沿能力与基准成绩,并说明权重和 MSA 算子的开源时间,读者可据此判断开放节奏与可用范围。

  2. @arena80

    MiniMax M3 登入 Arena,在 Code Arena 前端编码榜排名第 7,得分 1531,与 GLM-5.1 接近。其定价为每 M token 输入 0.60 美元、输出 2.40 美元,Arena 称其在所属价位推动了性价比前沿。MiniMax 官方介绍称 M3 是首个同时具备三项前沿能力的开源权重模型,SWE-Bench Pro 59.0%、Terminal Bench 2.1 66.0%、MCP Atlas 74.2%,通过 Sparse Attention 将上下文扩展至 1M,原生多模态,权重与技术报告约 10 天后发布。

    引用MiniMax (official) (@MiniMax_AI)@MiniMax_AI

    Introducing MiniMax M3: The First Open-Weights Model to Combine Three Frontier Capabilities - Coding & Agentic Frontier: 59.0% SWE-Bench Pro, 66.0% Terminal Bench 2.1, 34.8% SWE-fficiency, 28.8% KernelBench Hard, 74.2% MCP Atlas - MiniMax Sparse Attention scales context to 1M - Natively Multimodal from Step Zero API: platform.minimax.io Token Plan: platform.minimax.io/subscrib… 🚀New! MiniMax Code: code.minimax.io Weights & Tech Report in ~10 Days

    推荐理由:MiniMax M3 在 Arena 前端编码榜位列第 7,与 GLM-5.1 接近,读者可据此比较同级价位模型的能力与定价。

  3. @berryxia73

    Google 昨晚发布 Gemma 4 12B 多模态模型,采用 Apache 2.0 许可,至少需要 16G 内存即可运行。该模型为统一的无编码器多模态模型,主打把高性能智能直接带到笔记本上,衔接端侧效率与高级推理。作者认为应与 Qwen 的模型对比其效果。

    引用Google Gemma (@googlegemma)@googlegemma

    Meet Gemma 4 12B! A unified, encoder-free multimodal model designed to bring high-performance intelligence directly to your laptop, and released under an Apache 2.0 license. Bridging the gap between edge efficiency and advanced reasoning. Here is what’s new with Gemma 4 12B: 👇

    推荐理由:Gemma 4 12B 采用 Apache 2.0 许可并主打端侧多模态,可据此判断 16G 内存本地运行的可行性。

  4. AI寒武纪 · 微信公众号80

    谷歌DeepMind开源Gemma 4 12B,16GB内存笔记本可本地跑多模态

    谷歌DeepMind发布并开源Gemma 4 12B,这是一个统一、无编码器的多模态模型,只需16GB显存或统一内存即可在消费级笔记本上运行。它在标准评测基准上的成绩接近26B MoE模型,总内存占用不到后者一半,采用Apache 2.0协议,预训练与指令微调权重可从Hugging Face和Kaggle下载。

    推荐理由:原文介绍了无编码器多模态架构如何降低延迟和内存占用,并列出16GB笔记本可用的本地运行入口。

  5. @runware65

    MiniMax 发布开源权重模型 M3,称其同时结合编码与智能体、1M 上下文和原生多模态三项能力。官方给出 SWE-Bench Pro 59.0%、Terminal Bench 2.1 66.0%、MCP Atlas 74.2% 等成绩,并称 MiniMax Sparse Attention 将上下文扩展至 1M。Runware 表示已可通过其 API 调用该模型,权重与技术报告约 10 天后发布。

    引用MiniMax (official) (@MiniMax_AI)@MiniMax_AI

    Introducing MiniMax M3: The First Open-Weights Model to Combine Three Frontier Capabilities - Coding & Agentic Frontier: 59.0% SWE-Bench Pro, 66.0% Terminal Bench 2.1, 34.8% SWE-fficiency, 28.8% KernelBench Hard, 74.2% MCP Atlas - MiniMax Sparse Attention scales context to 1M - Natively Multimodal from Step Zero API: platform.minimax.io Token Plan: platform.minimax.io/subscrib… 🚀New! MiniMax Code: code.minimax.io Weights & Tech Report in ~10 Days

    推荐理由:引用的发布信息列出 M3 在编码、智能体与 1M 上下文上的基准成绩,可供判断这款开源权重模型的能力组合。

  6. @kimmonismus81

    Google 发布 Gemma 4 12B 开源模型,采用 Apache 2.0 许可,可在 16GB 显存笔记本上本地运行,支持智能体推理、视觉与音频,作者称其质量接近 Google 的 26B 模型。

    引用Google (@Google)@Google

    Today we’re introducing Gemma 4 12B — our latest open model that brings advanced agentic reasoning, vision and audio directly to your laptop. It delivers performance nearing our larger Gemma models with a much smaller total memory footprint, while being small enough to run locally with just 16GB of VRAM. It’s open and accessible for everyone to use under a permissive Apache 2.0 license. This is all made possible by our new, unified architecture that removes separate multimodal encoders. Here’s how we did it 🧵

    推荐理由:它把视觉与音频编码器并入主干,让 12B 模型能在 16GB 显存本地运行,读者可据此判断端侧多模态的门槛变化。

  7. @AYi_AInotes73

    Google 发布 Gemma 4 12B,一款基于 Apache 2.0 许可的免编码器统一多模态模型,把传统 ViT 视觉编码器的 150M-550M 参数压到 35M 轻量嵌入器。

    引用Google Gemma (@googlegemma)@googlegemma

    Meet Gemma 4 12B! A unified, encoder-free multimodal model designed to bring high-performance intelligence directly to your laptop, and released under an Apache 2.0 license. Bridging the gap between edge efficiency and advanced reasoning. Here is what’s new with Gemma 4 12B: 👇

    推荐理由:借 Gemma 4 12B 取消视觉编码器的设计,讨论统一多模态模型可能如何替代现有拼装式流水线。

  8. @googleaidevs75

    Google 发布 Gemma 4 12B,一款不含多模态编码器的统一模型,可直接在笔记本上运行。该模型定位在移动端 E4B 与更大的 26B MoE 模型之间,视觉和音频输入直接进入 LLM 主干,原生支持音频,采用 Apache 2.0 许可。官方称在 16GB VRAM 下可本地运行复杂多步工作流,性能接近 26B 模型。

    推荐理由:官方给出无编码器架构与 16GB VRAM 本地运行的定位,读者可据此判断端侧多模态模型的选型边界。