跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

当前仅显示精选新闻
246条精选相关主题图像生成AI 视频语音与音频

最新精选

第 121–140 条 · 共 246 条
7月24日周五
7月23日周四
7月21日周二
7月20日周一
  1. ByteDance Seed Research65

    字节 Seed 发布音频创作模型 Seed Audio 1.0,统一生成人声、音效和环境声

    字节 Seed 发布音频创作模型 Seed Audio 1.0,在统一框架下联合建模人声、音效和环境声,端到端生成完整声音场景。模型支持 100ms 间隔的时间控制、零样本音色生成、单次约 2 分钟的延展生成,覆盖 20+ 语种;评测显示多数场景音频可用率达 90% 以上,多语种自然度 MOS 大部分超过 4 分。模型已在火山方舟体验中心上线。

    推荐理由:官方介绍统一框架下联合建模多种音频要素的思路,并给出时间控制精度、语种覆盖和评测数字,可用于了解音频创作模型的能力边界。

7月17日周五
  1. AI寒武纪 · 微信公众号83

    Kimi K3 正式发布:前端能力超越 Fable 5 的开源模型

    Kimi K3 正式发布,上下文窗口 1M、总参数 2.8T,官方在基准测试中于 14 项里的 11 项击败 GPT-5.6 Sol,全部 14 项击败 Opus 4.8,并在 Frontend Code Arena 以 1679 分位列第一,超越 Claude Fable 5。

    推荐理由:官方跑分与第三方评测同时给出对比数据,读者可据此判断 K3 在前端能力和成本上相对同级模型的位置。

7月16日周四
  1. AI寒武纪 · 微信公众号77

    Kimi K3 发布,2.8万亿参数,综合智能排名第三

    Kimi K3 发布并已在网页端上线,参数量达2.8万亿,是目前公开的开源模型中规模最大的一个。它基于Kimi Delta Attention(KDA)混合线性注意力机制,并引入Attention Residuals结构,原生支持视觉理解,上下文窗口达100万token。

    推荐理由:原文列出Kimi K3的参数规模、KDA与AttnRes架构改动及多项榜单跑分,可据此判断当前开源模型的能力位置。

7月15日周三
  1. Hugging Face Blog81

    Hugging Face 发布 Thinking Machines 多模态开源模型 Inkling 使用指南并推出 Inkling-Small

    Thinking Machines 的开源多模态模型 Inkling 上线 Hugging Face,总参数 975B(激活 41B),原生接收图像、文本和音频输入,支持 1M 上下文和 1M token 训练语料中的 45 万亿 token 多模态训练,同日推出 276B 总参数、12B 激活参数的 Inkling-Small。

    推荐理由:官方详细拆解了 Inkling 的 MoE、相对注意力等架构设计,并给出从 2TB BF16 到 1-bit GGUF 的多档部署路径,方便按硬件选型。

7月8日周三
  1. ByteDance Seed Research62

    字节跳动 Seed 发布 Seedream 5.0 Pro 图像创作模型

    字节跳动 Seed 发布多模态图像创作模型 Seedream 5.0 Pro,主打复杂信息可视化、交互式精准编辑、真实影像质感与原生多语种生成四大能力。模型已上线火山方舟体验中心,并将陆续在豆包、即梦上线,项目主页见 https://seed.bytedance.com/seedream5_0_pro。

    推荐理由:官方介绍给出四大能力方向和具体生成案例,读者可以判断它在专业设计场景中的可用性。

7月7日周二
  1. OpenRouter Announcements71

    OpenRouter 实测图像 detail 参数:推理模型用 low 更贵更差

    OpenRouter 在 MMMU-Pro Vision(1,730 题)上基准测试 OpenAI 和 Google 五款模型的图像 detail 设置,发现 gpt-5.5 用 low 比 auto 低 13.8 分(65.2% vs 79.0%)且每题更贵(5.1¢ vs 4.5¢),原因是模型为看清热压缩图像多花 1.6x 推理 token。

    推荐理由:基于 MMMU-Pro Vision 实测五款模型,给出推理模型保持 auto 细节、改调 reasoning effort 省钱的可操作结论。

  2. Hugging Face Blog61

    LeRobot v0.6.0 发布:世界模型策略、奖励模型 API 与六大仿真基准

    Hugging Face LeRobot 团队发布 v0.6.0,引入 VLA-JEPA、LingBot-VA、FastWAM 三个世界模型策略,新增 GR00T N1.7、MolmoAct2、EO-1 等 VLA,以及 Robometer、TOPReward 奖励模型和统一奖励 API。

    推荐理由:官方完整发布说明覆盖世界模型策略、奖励模型、基准与部署 CLI,读者可据此评估是否升级自己的机器人训练工作流。

7月1日周三
6月25日周四
6月24日周三
  1. 硅星人Pro · 微信公众号80

    火山引擎 Force 大会发布豆包 2.1 Pro、Seedance 2.0 4K 等 5 款模型

    火山引擎在 6 月 23 日 Force 大会上发布豆包大模型 2.1 Pro、Seedance 2.0 4K 等 5 款新模型。Seedance 2.5 将于 7 月初上线,支持 30 秒单段原生视频直出和最多 50 个全模态素材联合生成。

    推荐理由:文章给出豆包 2.1 Pro 与 Seedance 系列的发布细节,可看到一个云厂商把强模型当作云入口的整体打法。

6月23日周二
  1. Mistral AI69

    Mistral 发布 Mistral OCR 4:支持边界框、块分类和置信度分数

    Mistral 发布 Mistral OCR 4,除提取文本外还返回边界框、块类型分类(标题、表格、公式、签名等)和逐页逐词的内联置信度分数,支持 170 种语言、10 个语言组。

    推荐理由:官方说明了新模型的结构化输出能力、基准得分及其已知评分缺陷,并给出 API 与 Document AI 的选择规则,便于读者判断适用场景。

  2. inclusionAI Hugging Face models62

    inclusionAI 发布 SingGuard-8b 策略自适应多模态安全护栏模型

    inclusionAI 发布 SingGuard 多模态安全护栏模型家族,支持文本、图像、图文及多语言、query 侧与 response 侧的安全评估。模型把生效的安全策略作为运行时输入而非固定训练分类,部署方无需重训即可按默认类别或自定义自然语言规则判定内容,并以 safe/unsafe 加匹配风险类别的 <answer> 标签输出结果。

    推荐理由:原文给出策略作为运行时输入的设计与多模态、多语言覆盖范围,读者可据此判断免重训适配审核规则的可行性。