跳到正文
@karminski3· @karminski3 · X·· 2026-08-22AI 评分52
AI 导读

DeepSeek-V4-Flash-Vision-Exp 是 DeepSeek 新发布的 v4-flash 能力级多模态模型,支持图像但不支持音频输入,官网和 API 默认也不支持视频输入。作者给出的做法是把视频抽帧后再送入模型,并写代码验证模型虽支持 gif 输入却只识别第一帧,所以把视频转成 gif 行不通。实测中 8fps 全帧方案每帧消耗 327 tokens。

正文

给大家写了个 deepseek-v4-flash-vision-exp 输入视频教程

deepseek 最近真的是高产, 刚刚又发了 deepseek-v4-flash-vision-exp, 首个多模态【大】模型. 而且是 v4-flash 能力级别的. 但是! 虽然不是瞎子了, 但是还是听力有问题, 不支持音频输入. 所以默认 deepseek 官网和API都不支持视频输入, 于是给大家写了个小教程, 如何使用这个模型处理视频.

简单来讲, 方法就是直接把视频抽帧. 而且需要注意, 虽然模型支持gif输入, 但是它只识别 gif 的第一帧(我写代码验证了). 所以把视频转换为gif是行不通的.

抽帧的最佳实践也给大家:

#deepseekv4flashvisionexp #deepseek多模态 #deepseek多模态模型

来源:@karminski3 · x.com