跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

当前仅显示精选新闻
238条精选相关主题图像生成AI 视频语音与音频

最新精选

第 81–100 条 · 共 238 条
8月21日周五
  1. @omarsar067

    DeepSeek-V4-Flash-Vision-Exp 已在 DeepSeek API 平台上线,该实验性多模态模型在文本能力上与 DeepSeek-V4-Flash 持平,在多模态智能体基准上大幅超越 V4-Flash 并接近 Opus-4.8。DeepSeek Harness 0.1.1 同日发布,内置对新模型的直接支持,调用模型名为 deepseek-v4-flash-vision-exp。作者另提示关注支持文本、图像和视频输入的 Ox Alpha 1M token 上下文,称其在编码和智能体任务上表现突出。

    引用@deepseek_ai@deepseek_ai

    DeepSeek-V4-Flash-Vision-Exp is now live on the DeepSeek API Platform! 🚀 🔹 This experimental multimodal model matches DeepSeek-V4-Flash on text capabilities—including agents, reasoning, and world knowledge. 🔹 On multimodal agent benchmarks, V4-Flash-Vision-Exp makes a major leap over V4-Flash, bringing multimodal agent performance close to Opus-4.8. Try it with model='deepseek-v4-flash-vision-exp'. DeepSeek Harness 0.1.1 was released today with out-of-the-box support for the new model. 1/n

    推荐理由:官方基准对比显示该实验模型在多模态智能体任务上接近 Opus-4.8,读者可据此了解多模态智能体的当前水平。

  2. @AYi_AInotes72

    DeepSeek 在 API 平台上线实验性多模态模型 deepseek-v4-flash-vision-exp,官方称其文本能力与 DeepSeek-V4-Flash 对齐,多模态 Agent 性能接近 Opus-4.8,在 Agents Last Exam 和 ZeroBench 上局部超过。

    原始视频预览图;未保存可播放视频URL
    引用@deepseek_ai@deepseek_ai

    DeepSeek-V4-Flash-Vision-Exp is now live on the DeepSeek API Platform! 🚀 🔹 This experimental multimodal model matches DeepSeek-V4-Flash on text capabilities—including agents, reasoning, and world knowledge. 🔹 On multimodal agent benchmarks, V4-Flash-Vision-Exp makes a major leap over V4-Flash, bringing multimodal agent performance close to Opus-4.8. Try it with model='deepseek-v4-flash-vision-exp'. DeepSeek Harness 0.1.1 was released today with out-of-the-box support for the new model. 1/n

    推荐理由:逐条列出这个实验性多模态模型的单图 token 上限、分级定价与免费 Files API 额度,可供评估视觉 Agent 的成本与接入方式。

  3. @kimmonismus67

    DeepSeek 在 API 平台上线实验性多模态模型 DeepSeek-V4-Flash-Vision-Exp,文本能力与 DeepSeek-V4-Flash 持平,多模态智能体基准表现接近 Opus-4.8。官方称该模型在多模态智能体基准上较 V4-Flash 大幅提升,可通过 model=deepseek-v4-flash-vision-exp 调用,DeepSeek Harness 0.1.1 同日发布并原生支持该模型。转发该消息的作者提到,取得这一成绩的是 Flash 系列中的小模型。

    引用@deepseek_ai@deepseek_ai

    DeepSeek-V4-Flash-Vision-Exp is now live on the DeepSeek API Platform! 🚀 🔹 This experimental multimodal model matches DeepSeek-V4-Flash on text capabilities—including agents, reasoning, and world knowledge. 🔹 On multimodal agent benchmarks, V4-Flash-Vision-Exp makes a major leap over V4-Flash, bringing multimodal agent performance close to Opus-4.8. Try it with model='deepseek-v4-flash-vision-exp'. DeepSeek Harness 0.1.1 was released today with out-of-the-box support for the new model. 1/n

    推荐理由:基准对比显示 Flash 小模型在多模态智能体评测上已接近 Opus-4.8,可供判断轻量模型的能力边界。

  4. @testingcatalog71

    DeepSeek-V4-Flash-Vision-Exp 多模态模型已在 DeepSeek API 平台上线,官方称其性能接近 Opus 4.8,文本能力与 DeepSeek-V4-Flash 持平。该模型支持 Chat Completions、Messages 和 Responses,可混合输入文本与图像,图像可通过 base64、外部 URL 或 Files API 提供,按 V4-Flash 价格计费,每张图片最多 384 tokens。随附基准表显示其在 Terminal Bench 2.1 得分 83.9、ApexBench 得分 36.5。

    引用@deepseek_ai@deepseek_ai

    Multimodal API support 🔌 🔹 Set model='deepseek-v4-flash-vision-exp' 🔹 Images are tokenized for billing: up to 384 tokens each, at V4-Flash pricing 🔹 Supports Chat Completions, Messages & Responses 🔹 Supports mixed text + image input; images can be provided via base64, external URLs, or the Files API. Docs: https://t.co/USZ5gZ3wWB 3/n

    推荐理由:材料给出新模型与 Opus 4.8 及自家文本版本的基准对比和计费细节,便于判断实际可用性。

8月20日周四
  1. @GeminiApp74

    Gemini 应用宣布现在可以直接在对话中生成可用的交互式 3D 模拟和动态表格。官方提示以 “Show me…” 开头写提示词,并使用 Flash 模型以获得最佳效果。给出的示例包括 3D 展示 DNA 工作原理(可缩放、旋转、探索)、展示单摆的能量变化,以及用瀑布图展示现金消耗速度。

    原始视频预览图;未保存可播放视频URL

    推荐理由:官方给出可直接复用的提示词开头方式,读者可据此在对话里生成可交互的 3D 模拟与动态表格。

8月18日周二
8月17日周一
  1. xAI News74

    xAI 完成 60 亿美元 C 轮融资

    xAI 完成 60 亿美元 C 轮融资,投资方包括 A16Z、Blackrock、Fidelity Management & Research Company、Sequoia Capital、QIA 等,NVIDIA 和 AMD 作为战略投资方参与。

    推荐理由:原文列出本轮投资方名单与资金用途,并给出 Colossus 与 Grok 的进展节奏,可对照其扩张计划。

  2. xAI News74

    xAI 发布 Grok-2 与 Grok-2 mini 测试版

    xAI 发布 Grok-2 与 Grok-2 mini 的早期预览版,称它们在聊天、编码和推理上较 Grok-1.5 有显著提升。早期版本以 sus-column-r 名义在 LMSYS 榜单测试,xAI 称其整体 Elo 超过 Claude 3.5 Sonnet 和 GPT-4-Turbo。

    推荐理由:原文给出 Grok-2 与 Grok-2 mini 的完整基准表和竞技场排名,可与 Claude、GPT-4o 等模型直接对照。

  3. xAI News63

    xAI 发布代号 Aurora 的 Grok 图像生成模型,并上线 Grok Imagine API

    xAI 发布代号 Aurora 的图像生成模型,随 Grok Imagine API 一同上线,覆盖图像生成、图像编辑以及视频生成与视频编辑。Aurora 是自回归 MoE 网络,通过预测交错文本与图像数据中的下一个 token 训练,使用数十亿互联网样本,原生支持多模态输入并可直接编辑用户提供的图片。新能力已在 𝕏 平台面向部分国家开放,并将在约一周内推送给全部用户。

    推荐理由:官方给出 Aurora 的架构思路与多模态输入能力,可据此判断 Grok 图像生成在文本渲染与图像编辑上的定位。

  4. xAI News65

    xAI 向所有 X 用户免费开放新版 Grok-2,并推出 grok-2-1212 API 模型

    xAI 宣布开始向 X 平台所有用户免费推送新版 Grok-2,该版本速度提升三倍,在准确率、指令遵循和多语言能力上有所改进,Premium 与 Premium+ 用户仍享有更高使用额度。

    推荐理由:官方给出新版 Grok-2 的速度、能力改进与 API 定价,可对照此前 Grok-2 的开放范围与使用成本。

  5. xAI News62

    xAI 为 Imagine Video 1.5 新增参考图、语音参考与原生 1080p

    xAI 为 Imagine Video 1.5 加入图像与语音参考、纯文本生成视频和原生 1080p,其中图像与语音参考即日起在美国面向 SuperGrok Heavy 和 SuperGrok Plus 开放,并在接下来几天覆盖全部档位。

    推荐理由:xAI 为 Imagine Video 1.5 补上图像与语音参考,最多七张参考图可分别锁定人脸、产品或场景。

  6. Mistral AI67

    Mistral 发布 Mistral Small v24.09,并推出免费层与全线降价

    Mistral 发布 22B 参数的 Mistral Small v24.09,同时上线 la Plateforme 免费层并对全系模型降价。Mistral Small 与 Codestral 的输入输出价格均降 80%,Mistral Nemo 降 50%,Mistral Large 降 33%,更新后 Mistral Large 2 被称最具成本效益的前沿模型。

    推荐理由:原文列出各模型具体降价幅度与免费层入口,读者可据此评估调用成本与自部署条件。

  7. Mistral AI66

    Mistral 为 le Chat 加入联网搜索、Canvas 与 Pixtral Large 多模态能力

    Mistral AI 为 le Chat 上线多项 beta 功能,包括带引用的联网搜索、Canvas 协作编辑、Pixtral Large 支持的文档与图像理解,以及由 Black Forest Labs Flux Pro 提供支持的图像生成。用户还可把复用的提示词固化为可分享的 Agent。这些功能目前免费开放,并将在未来几周逐步推送。

    推荐理由:官方列出 le Chat 与 ChatGPT、Perplexity、Claude 的功能对照,并说明这些能力当前以免费 beta 提供。

  8. Mistral AI77

    Mistral AI 发布 Pixtral 12B 多模态模型

    Mistral AI 发布 Pixtral 12B 原生多模态模型,基于 Mistral Nemo 12B,采用 Apache 2.0 许可,支持可变图像尺寸与宽高比,并可在 128k token 上下文内处理任意数量图片。

    推荐理由:Pixtral 12B 以 Apache 2.0 开源并支持 128k 多图输入,MMMU 得分 52.5%,读者可据此比较小尺寸多模态模型的取舍。