跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

129条精选相关主题图像生成AI 视频语音与音频

最新精选

第 121–129 条 · 共 129 条
3月12日周四
  1. Google Research67

    Google AMIE 完成 BIDMC 真实门诊前瞻性可行性研究

    Google Research 与 Beth Israel Deaconess Medical Center 合作完成 AMIE 对话式诊断 AI 的前瞻性单中心可行性研究,100 名成人在初级保健就诊前与 AMIE 对话采集病史,全程由医生实时监督,未发生一次安全中止。

    推荐理由:这是 AMIE 首次在真实门诊流程中开展的前瞻性可行性研究,给出安全性、诊断质量和医患体验的具体数据。

12月17日周三
12月3日周三
  1. Mistral AI77

    Mistral 发布 Mistral 3 系列模型,含 Mistral Large 3 与 Ministral 3,均以 Apache 2.0 开源

    Mistral 发布新一代模型系列 Mistral 3,包括 14B/8B/3B 的 Ministral 3 小模型和 sparse MoE 架构的 Mistral Large 3(41B 激活、675B 总参数),全部以 Apache 2.0 许可开源,提供 base、instruct 和 reasoning 变体。

    推荐理由:官方公布完整模型规格、开源许可和部署路径,读者可据此评估在自建或端侧场景的可用性。

7月17日周四
  1. Mistral AI61

    Mistral AI 为 Le Chat 推出 Deep Research、语音、Projects 等多项新功能

    Mistral AI 为 Le Chat 推出一批新功能,包括 Deep Research 预览模式、基于 Voxtral 的语音模式、由 Magistral 驱动的多语言推理、Projects 项目整理功能,以及与 Black Forest Labs 合作的高级图像编辑。

    推荐理由:Mistral 官方一次性列出五项新功能及其支撑模型,读者可以对照了解 Le Chat 在研究和多模态方向的能力变化。

7月15日周二
5月7日周三
3月17日周一
  1. Mistral AI65

    Mistral 发布 Mistral Small 3.1:24B 多模态开源模型,128k 上下文

    Mistral AI 发布 Mistral Small 3.1,相比 Mistral Small 3 提升文本性能,新增多模态理解,上下文窗口扩展至 128k tokens,推理速度达 150 tokens/秒,官方称超越 Gemma 3 和 GPT-4o Mini 等同级模型。

    推荐理由:官方给出了与 Gemma 3 和 GPT-4o Mini 的对比数据、部署门槛和开放下载渠道,可据此评估端侧与低成本部署选择。

3月7日周五
3月21日周四
  1. Suno Blog84

    Suno 发布 v3 模型,可生成广播级两分钟完整歌曲

    Suno 发布 v3 模型,称其首个能生成广播级音乐的模型,已在 https://app.suno.ai 向所有用户开放。v3 可在几秒内生成完整两分钟歌曲,改进包括更好的音质、更多风格流派、更少幻觉和更自然的结尾。模型不识别艺术家引用,并采用不可闻水印技术检测 Suno 生成的歌曲,v4 已在开发中。

    推荐理由:Suno 官方说明 v3 在音质、风格与提示词遵循上的具体改进,读者可据此对比自己此前的生成体验。