跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

129条精选相关主题图像生成AI 视频语音与音频

最新精选

第 101–120 条 · 共 129 条
5月20日周三
  1. @kimmonismus82

    Gemini Omni 发布,官方介绍这是一款可从任意输入生成内容的新模型,首批聚焦视频,已在 Gemini App、Flow 和 YouTube 上线,API 支持即将推出。转发的作者 @kimmonismus 称这是真正的惊艳时刻,认为它是迈向 AGI 的世界模型,能从任何输入生成任何内容。

    引用Logan Kilpatrick (@OfficialLoganK)@OfficialLoganK

    Introducing Gemini Omni 🔮........ Omni is our new model that can create anything from any input — starting with video (think Nano Banana but for video). Available in the Gemini App, Flow, and YouTube, with API support coming soon! Video

    推荐理由:官方说明了 Gemini Omni 从任意输入生成内容的能力和首批视频场景,读者可据此了解当前可用渠道与范围。

  2. @GeminiApp66

    Gemini app 新增 SynthID 验证,覆盖图像、视频和音频,用户可直接提问内容是否由 AI 生成。该应用同时加入 C2PA Content Credentials 验证,用于判断内容是否为相机拍摄的未修改原图,或已被哪些工具修改。两项功能今日起在 Gemini app 逐步推送。

    推荐理由:Gemini app 把 AI 生成内容核验做成了对话式查询,读者可了解多模态内容溯源在应用内的落地方式。

  3. @Google78

    Google 在 GeminiApp 上线 Gemini Omni,支持任意组合文本与视觉输入生成电影感视频,即日起面向全球 Google AI Plus、Pro 和 Ultra 订阅用户开放。它提供对话式的视频创建与编辑方式,用户用简单提示词即可实现电影级变焦或更换背景,无需昂贵设备或技术术语。

    推荐理由:原文给出 Gemini Omni 的输入方式与开放订阅档位,读者可据此判断视频创作门槛的变化。

5月19日周二
  1. @berryxia66

    Odyssey 发布 Agora-1,一个多智能体世界模型,人类与 AI 可同时进入同一模拟世界并实时互动、互相影响。官方推出可游玩的研究预览,用 Agora-1 模拟多人 GoldenEye 死亡竞赛,模型实时生成画面和声音,整个世界持续更新。

    引用Odyssey (@odysseyml)@odysseyml

    Introducing Agora-1, a multi-agent world model. Multiple participants—human or AI—can now interact inside the same world simulation, all in real-time. Try our playable research preview today, with Agora-1 simulating a multiplayer GoldenEye deathmatch! Video

    推荐理由:世界模型从单人视频生成扩展到多人实时共享模拟,读者可据此了解人机共处同一模拟世界的当前形态。

5月18日周一
5月17日周日
5月16日周六
5月15日周五
  1. @vista866

    面壁智能发布 1.3B 参数的视觉模型 MiniCPM-V 4.6,面向消费级和移动硬件,已在 Hugging Face、GitHub 和 ModelScope 上线。该模型采用 LLaVA-UHD v4 技术,官方称将视觉编码成本降低 55%。官方还称其在多模态和 Artificial Analysis 基准上超过 Gemma4-E2B-it 和 Qwen3.5-0.8B,TTFT 为 75.7ms、比 Qwen3.5-0.8B 快 2.2 倍。原文作者表示在 Hugging Face 看到该模型论文,准备抽空测试。

    引用OpenBMB (@OpenBMB)@OpenBMB

    1/5 MiniCPM-V 4.6 (1.3B) is now live 🚀🚀 High-res visual processing, optimized for consumer-grade and mobile hardware. We’ve leveraged the latest LLaVA-UHD v4 technique to cut vision encoding costs by 55%, enabling native edge deployment with extreme efficiency. 🔥 Beats Gemma4-E2B-it and Qwen3.5-0.8B across key multimodal and Artificial Analysis benchmarks — scoring higher than Qwen3.5-0.8B using just 2.5% of its token budget. ⚡ TTFT (75.7ms) 2.2x Faster than Qwen3.5-0.8B even with 3136² high-res images. 🏗️ ~1.5x Token Throughput compared with Qwen3.5-0.8B on a single RTX 4090. Try the model here: 🤗 Hugging Face: huggingface.co/openbmb/MiniC… 💻 GitHub: github.com/OpenBMB/MiniCPM-V 🔭 Modelscope: modelscope.cn/models/OpenBMB… 🌐 Web Demo: huggingface.co/spaces/openbm… 📱 App Demo: github.com/OpenBMB/MiniCPM-V… Video

    推荐理由:官方给出 1.3B 小模型处理高分辨率图像的编码成本与吞吐数据,可供端侧多模态选型参考。

5月4日周一
  1. Runway News66

    Runway 发布 Characters,单张图片生成 24fps 实时对话视频智能体

    Runway 发布 Characters,基于 GWM-1 将单张参考图转为可实时对话的视频角色,无需微调,支持写实人像、卡通和吉祥物等风格。模型每帧有效耗时 37 毫秒,用户停止说话到角色开口的服务端延迟 1.75 秒;通过扩散变换器与 VAE 解码器流水线并行、KV-cache 管理、CUDA Graphs 和 Triton 核优化实现 24fps 实时生成。

    推荐理由:官方技术博客拆解了实时管线的关键数字和系统优化,读者可以据此理解单图驱动的对话视频智能体的实现路径。

5月1日周五
  1. @CalmPromptsHQ69

    SenseTime 将 SenseNova U1 Lite 系列开源,该系列基于 NEO-unify 架构,原生统一多模态理解与生成,提供 8B 和 A3B 两个紧凑版本。官方称其在开源模型中效率领先,并用单一模型单流生成交错的文本与图像,面向指南、知识插图、海报、PPT、漫画等信息密集版式。模型权重已在 Hugging Face 和 GitHub 发布,并可自托管。

    引用SenseTime (@SenseTime_AI)@SenseTime_AI

    𝗦𝗲𝗻𝘀𝗲𝗡𝗼𝘃𝗮 𝗨1 𝗟𝗶𝘁𝗲 𝗦𝗲𝗿𝗶𝗲𝘀 𝗶𝘀 𝗻𝗼𝘄 𝗼𝗽𝗲𝗻 𝘀𝗼𝘂𝗿𝗰𝗲! Built on the 𝗡𝗘𝗢-𝘂𝗻𝗶𝗳𝘆 𝗮𝗿𝗰𝗵𝗶𝘁𝗲𝗰𝘁𝘂𝗿𝗲, it natively unifies multimodal understanding and generation, delivering: •𝗦𝗢𝗧𝗔 𝗘𝗳𝗳𝗶𝗰𝗶𝗲𝗻𝗰𝘆 𝗔𝗺𝗼𝗻𝗴 𝗢𝗽𝗲𝗻-𝗦𝗼𝘂𝗿𝗰𝗲 𝗠𝗼𝗱𝗲𝗹𝘀: Compact models (8B & A3B) delivering commercial-grade performance and exceptional cost efficiency. Leading performance among open-source models across a wide range of understanding, reasoning, and generation benchmarks. •𝗡𝗮𝘁𝗶𝘃𝗲 𝗜𝗺𝗮𝗴𝗲–𝗧𝗲𝘅𝘁 𝗜𝗻𝘁𝗲𝗿𝗹𝗲𝗮𝘃𝗲𝗱 𝗚𝗲𝗻𝗲𝗿𝗮𝘁𝗶𝗼𝗻: Generate coherent interleaved text and images in a single flow using one model; ideal for practical applications like guides, where visuals turn complex information into intuitive insights. •𝗛𝗶𝗴𝗵-𝗗𝗲𝗻𝘀𝗶𝘁𝘆 𝗜𝗻𝗳𝗼𝗿𝗺𝗮𝘁𝗶𝗼𝗻 𝗥𝗲𝗻𝗱𝗲𝗿𝗶𝗻𝗴: Strong capabilities in dense visual communication, generating richly structured layouts for knowledge illustrations, posters, PPTs, comics and other information-rich formats. 𝗛𝘂𝗴𝗴𝗶𝗻𝗴 𝗙𝗮𝗰𝗲: huggingface.co/collections/s… 𝗚𝗶𝘁𝗛𝘂𝗯: github.com/OpenSenseNova/Sen… 𝗗𝗶𝘀𝗰𝗼𝗿𝗱: discord.gg/cxkwXWjp  @huggingface @github

    推荐理由:SenseNova U1 Lite 以 8B、A3B 紧凑规模开源权重,读者可据此衡量自托管图文版式生成的成本门槛。

4月30日周四
  1. 微信公众号(Mp2RSS 合集)77

    MiniCPM-o 4.5 技术报告发布:全双工全模态 API 开放,RTX5070 即可实时运行

    面壁智能联合 OpenBMB、清华大学 THUNLP 与 THUMAI 实验室发布 MiniCPM-o 4.5 技术报告,首次公开全双工全模态框架 Omni-Flow,并同步开放全模态全双工 API、在线 Demo、端侧安装包 Comni 与 Demo 仓库。

    推荐理由:技术报告首次公开 Omni-Flow 的毫秒级时间轴对齐机制,读者可据此理解端到端全双工全模态的实现路径。

4月28日周二
4月13日周一
3月24日周二
  1. Mistral AI66

    Mistral AI 发布首个语音合成模型 Voxtral TTS

    Mistral AI 发布 4B 参数的文本转语音模型 Voxtral TTS,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言,API 定价 $0.016 per 1k characters。

    推荐理由:官方给出了与 ElevenLabs 对比的人类评测数据和低延迟指标,读者可据此评估其在语音 Agent 场景的可用性。

3月17日周二
3月12日周四
  1. Microsoft AI News60

    Microsoft 发布 Copilot Health 健康助手

    Microsoft 推出 Copilot Health,这是 Copilot 内的独立安全空间,可整合健康记录、可穿戴设备数据与健康历史并生成个性化健康洞察。

    推荐理由:官方宣布 Copilot Health 上线并给出数据整合规模、隐私隔离措施和分阶段开放方式,读者可以了解其功能边界与使用入口。