跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

当前仅显示精选新闻
241条精选相关主题图像生成AI 视频语音与音频

最新精选

第 221–240 条 · 共 241 条
5月4日周一
  1. Runway News66

    Runway 发布 Characters,单张图片生成 24fps 实时对话视频智能体

    Runway 发布 Characters,基于 GWM-1 将单张参考图转为可实时对话的视频角色,无需微调,支持写实人像、卡通和吉祥物等风格。模型每帧有效耗时 37 毫秒,用户停止说话到角色开口的服务端延迟 1.75 秒;通过扩散变换器与 VAE 解码器流水线并行、KV-cache 管理、CUDA Graphs 和 Triton 核优化实现 24fps 实时生成。

    推荐理由:官方技术博客拆解了实时管线的关键数字和系统优化,读者可以据此理解单图驱动的对话视频智能体的实现路径。

5月1日周五
  1. @CalmPromptsHQ69

    SenseTime 将 SenseNova U1 Lite 系列开源,该系列基于 NEO-unify 架构,原生统一多模态理解与生成,提供 8B 和 A3B 两个紧凑版本。官方称其在开源模型中效率领先,并用单一模型单流生成交错的文本与图像,面向指南、知识插图、海报、PPT、漫画等信息密集版式。模型权重已在 Hugging Face 和 GitHub 发布,并可自托管。

    引用SenseTime (@SenseTime_AI)@SenseTime_AI

    𝗦𝗲𝗻𝘀𝗲𝗡𝗼𝘃𝗮 𝗨1 𝗟𝗶𝘁𝗲 𝗦𝗲𝗿𝗶𝗲𝘀 𝗶𝘀 𝗻𝗼𝘄 𝗼𝗽𝗲𝗻 𝘀𝗼𝘂𝗿𝗰𝗲! Built on the 𝗡𝗘𝗢-𝘂𝗻𝗶𝗳𝘆 𝗮𝗿𝗰𝗵𝗶𝘁𝗲𝗰𝘁𝘂𝗿𝗲, it natively unifies multimodal understanding and generation, delivering: •𝗦𝗢𝗧𝗔 𝗘𝗳𝗳𝗶𝗰𝗶𝗲𝗻𝗰𝘆 𝗔𝗺𝗼𝗻𝗴 𝗢𝗽𝗲𝗻-𝗦𝗼𝘂𝗿𝗰𝗲 𝗠𝗼𝗱𝗲𝗹𝘀: Compact models (8B & A3B) delivering commercial-grade performance and exceptional cost efficiency. Leading performance among open-source models across a wide range of understanding, reasoning, and generation benchmarks. •𝗡𝗮𝘁𝗶𝘃𝗲 𝗜𝗺𝗮𝗴𝗲–𝗧𝗲𝘅𝘁 𝗜𝗻𝘁𝗲𝗿𝗹𝗲𝗮𝘃𝗲𝗱 𝗚𝗲𝗻𝗲𝗿𝗮𝘁𝗶𝗼𝗻: Generate coherent interleaved text and images in a single flow using one model; ideal for practical applications like guides, where visuals turn complex information into intuitive insights. •𝗛𝗶𝗴𝗵-𝗗𝗲𝗻𝘀𝗶𝘁𝘆 𝗜𝗻𝗳𝗼𝗿𝗺𝗮𝘁𝗶𝗼𝗻 𝗥𝗲𝗻𝗱𝗲𝗿𝗶𝗻𝗴: Strong capabilities in dense visual communication, generating richly structured layouts for knowledge illustrations, posters, PPTs, comics and other information-rich formats. 𝗛𝘂𝗴𝗴𝗶𝗻𝗴 𝗙𝗮𝗰𝗲: huggingface.co/collections/s… 𝗚𝗶𝘁𝗛𝘂𝗯: github.com/OpenSenseNova/Sen… 𝗗𝗶𝘀𝗰𝗼𝗿𝗱: discord.gg/cxkwXWjp  @huggingface @github

    推荐理由:SenseNova U1 Lite 以 8B、A3B 紧凑规模开源权重,读者可据此衡量自托管图文版式生成的成本门槛。

4月30日周四
  1. AI前线 · 微信公众号77

    MiniCPM-o 4.5 技术报告发布:全双工全模态 API 开放,RTX5070 即可实时运行

    面壁智能联合 OpenBMB、清华大学 THUNLP 与 THUMAI 实验室发布 MiniCPM-o 4.5 技术报告,首次公开全双工全模态框架 Omni-Flow,并同步开放全模态全双工 API、在线 Demo、端侧安装包 Comni 与 Demo 仓库。

    推荐理由:技术报告首次公开 Omni-Flow 的毫秒级时间轴对齐机制,读者可据此理解端到端全双工全模态的实现路径。

4月28日周二
4月13日周一
3月24日周二
  1. Mistral AI66

    Mistral AI 发布首个语音合成模型 Voxtral TTS

    Mistral AI 发布 4B 参数的文本转语音模型 Voxtral TTS,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言,API 定价 $0.016 per 1k characters。

    推荐理由:官方给出了与 ElevenLabs 对比的人类评测数据和低延迟指标,读者可据此评估其在语音 Agent 场景的可用性。

3月17日周二
3月12日周四
  1. Google Research67

    Google AMIE 完成 BIDMC 真实门诊前瞻性可行性研究

    Google Research 与 Beth Israel Deaconess Medical Center 合作完成 AMIE 对话式诊断 AI 的前瞻性单中心可行性研究,100 名成人在初级保健就诊前与 AMIE 对话采集病史,全程由医生实时监督,未发生一次安全中止。

    推荐理由:这是 AMIE 首次在真实门诊流程中开展的前瞻性可行性研究,给出安全性、诊断质量和医患体验的具体数据。

2月26日周四
  1. Gemini API 更新日志68

    Gemini API 发布 Nano Banana 2(Gemini 3.1 Flash Image Preview),Gemini 3 Pro Preview 将于 3 月 9 日停用

    Google Gemini API 发布 Nano Banana 2,即 Gemini 3.1 Flash Image Preview,定位为面向速度和高并发场景的高效模型。同时官方宣布 gemini-3-pro-preview 将于 2026 年 3 月 9 日停用。

    推荐理由:官方更新日志同时给出新模型定位和旧模型下线日期,读者可以据此安排 Gemini API 的模型切换。

12月17日周三
  1. Gemini API 更新日志76

    Google 发布 Gemini 3 Flash Preview(gemini-3-flash-preview)

    Google 在 Gemini API 更新日志中宣布推出 Gemini 3 Flash Preview(gemini-3-flash-preview),定位为以更低成本提供对标更大模型的快速前沿性能。新模型升级了视觉与空间推理以及智能体编码能力,并附带多模态函数响应、带图像的代码执行等新功能文档。

    推荐理由:官方日志给出新模型的定位、成本与新增功能入口,便于评估其在现有 Gemini API 工作流中的替换价值。

12月3日周三
  1. Mistral AI77

    Mistral 发布 Mistral 3 系列模型,含 Mistral Large 3 与 Ministral 3,均以 Apache 2.0 开源

    Mistral 发布新一代模型系列 Mistral 3,包括 14B/8B/3B 的 Ministral 3 小模型和 sparse MoE 架构的 Mistral Large 3(41B 激活、675B 总参数),全部以 Apache 2.0 许可开源,提供 base、instruct 和 reasoning 变体。

    推荐理由:官方公布完整模型规格、开源许可和部署路径,读者可据此评估在自建或端侧场景的可用性。

11月17日周一
  1. ElevenLabs Blog61

    ElevenLabs 推出 Image & Video(Beta),整合图像视频生成与语音制作

    ElevenLabs 发布 Image & Video(Beta),在单一平台内整合图像与视频生成能力。可使用 Veo、Sora、Kling、Wan、Seedance 等模型生成视频,用 Nanobanana、Flux Kontext、GPT Image、Seedream 生成图像,并支持放大和用 ElevenLabs 语音添加 lipsync。

    推荐理由:官方发布介绍了平台内聚合多家视频与图像模型并接续语音制作的完整流程,读者可以据此评估能否把现有分散的创作环节合并到一处。

7月17日周四
  1. Mistral AI61

    Mistral AI 为 Le Chat 推出 Deep Research、语音、Projects 等多项新功能

    Mistral AI 为 Le Chat 推出一批新功能,包括 Deep Research 预览模式、基于 Voxtral 的语音模式、由 Magistral 驱动的多语言推理、Projects 项目整理功能,以及与 Black Forest Labs 合作的高级图像编辑。

    推荐理由:Mistral 官方一次性列出五项新功能及其支撑模型,读者可以对照了解 Le Chat 在研究和多模态方向的能力变化。

7月15日周二
5月7日周三
3月17日周一
  1. Mistral AI65

    Mistral 发布 Mistral Small 3.1:24B 多模态开源模型,128k 上下文

    Mistral AI 发布 Mistral Small 3.1,相比 Mistral Small 3 提升文本性能,新增多模态理解,上下文窗口扩展至 128k tokens,推理速度达 150 tokens/秒,官方称超越 Gemma 3 和 GPT-4o Mini 等同级模型。

    推荐理由:官方给出了与 Gemma 3 和 GPT-4o Mini 的对比数据、部署门槛和开放下载渠道,可据此评估端侧与低成本部署选择。

3月7日周五