跳到正文

AI 视频

AI 视频生成与理解:文生视频模型、视频编辑工具与影视创作变革的追踪。

当前仅显示精选新闻

最新精选

第 21–40 条 · 共 64 条
8月27日周四
  1. Gemini API 更新日志64

    Gemini Omni Flash 转正为 gemini-omni-1.1-flash,新增视频延伸与首尾帧插值

    Google 发布 gemini-omni-1.1-flash,即对话式视频生成与编辑模型 Gemini Omni Flash 的 GA 版本。新增视频延伸、首尾帧插值(最多 2 张图)以及 360p 到 4K 的分辨率参数,1080p 和 4K 通过超分辨率生成;预览端点 gemini-omni-flash-preview 将于 2026 年 9 月 30 日弃用。

    推荐理由:官方更新日志给出 GA 版本的新能力清单和预览端点停用时间,开发者可据此规划迁移。

8月25日周二
  1. @alibaba_cloud68

    Wan 3.0 已在 OpenRouter 上线,支持从文本、图像或参考素材生成 2–30 秒视频,最高 1080p。OpenRouter 公布的上线定价为 480p、720p、1080p 每秒 $0.05、$0.10、$0.20,全分辨率限时 15% 折扣。阿里云同时给出 Model Studio 与 Qwen Cloud 两个 API 接入入口。

    引用@OpenRouter@OpenRouter

    Alibaba's Wan 3.0 from @Alibaba_Wan and @alibaba_cloud is now live on OpenRouter. Generate 2-30 second videos from text, images, or references at 480p, 720p, or 1080p. Launch pricing: $0.05/$0.10/$0.20 per second, with a limited-time 15% discount across every resolution. https://t.co/yzQNUKAo3o

    推荐理由:官方给出 2–30 秒、最高 1080p 的生成规格与 OpenRouter 接入入口,可据此评估视频生成的调用成本。

  2. @alibaba_cloud69

    Wan 3.0 已在 Runway 上线,可生成视频和音频,并支持输入多张图像、视频和音频作为参考,官方称这让每次生成获得更多控制。该模型还可通过 Model Studio 和 Qwen Cloud 获取 API 访问。

    引用@runwayml@runwayml

    WAN 3.0 is now on Runway. Generate state-of-the-art video and audio with multiple image, video and audio reference inputs. Try it now at the link below. https://t.co/VzTkPZR3cz

    推荐理由:Wan 3.0 上线 Runway 并给出 API 入口,读者可了解其多模态参考输入带来的生成控制方式。

  3. OpenRouter Announcements60

    OpenRouter 发布 Video Generation API 代码指南,一个端点调用 Seedance、Veo、Wan

    OpenRouter 发布视频生成 API 教程,通过 POST /api/v1/videos 提交任务、轮询状态、下载 MP4,同一集成可用 Seedance 2.0、Veo 3.1、Wan 2.7,切换模型只需改 model 标识符。

    推荐理由:OpenRouter 官方教程给出完整的异步视频生成集成代码,包括轮询、失败状态处理和换模型时需注意的参数差异,可直接迁移到自己的项目。

8月24日周一
8月18日周二
8月17日周一
  1. xAI News62

    xAI 为 Imagine Video 1.5 新增参考图、语音参考与原生 1080p

    xAI 为 Imagine Video 1.5 加入图像与语音参考、纯文本生成视频和原生 1080p,其中图像与语音参考即日起在美国面向 SuperGrok Heavy 和 SuperGrok Plus 开放,并在接下来几天覆盖全部档位。

    推荐理由:xAI 为 Imagine Video 1.5 补上图像与语音参考,最多七张参考图可分别锁定人脸、产品或场景。

8月4日周二
  1. Black Forest Labs Blog74

    Black Forest Labs 发布 FLUX 3 Video,支持文生视频与图生视频

    Black Forest Labs 的 FLUX 3 Video 初版正式通过 BFL API 和部分合作方开放。模型可生成最长 20 秒、带原生音频的视频,支持 HD(720p)与 Full HD(1080p),并提供文本生视频、图生视频与关键帧、视频续写(最多 4 秒素材)、单次生成多镜头、多语言对话与精确口型同步、Draft Mode 快速预览等能力。

    推荐理由:官方公布了模型能力和自评基准数据,并说明后续开源权重与图像版本的路线,可帮助读者评估其在视频生成工作流中的位置。

7月31日周五
  1. ByteDance Seed Research73

    字节 Seed 发布视频生成模型 Seedance 2.5

    ByteDance Seed 正式发布视频生成模型 Seedance 2.5,延续 Seedance 2.0 的多模态音视频联合生成架构,单次生成时长从 15 秒提升至 30 秒并支持多轮延长,可生成数分钟连贯内容。

    推荐理由:官方公布单次生成 30 秒、30 张图参考和时间戳编辑等具体能力变化与上线入口,读者可据此评估视频创作工作流。

7月24日周五
7月23日周四
7月17日周五
  1. Hugging Face Blog69

    NVIDIA NeMo Automodel 与 Diffusers 集成,可大规模微调视频和图像模型

    NVIDIA 和 Hugging Face 推出 NeMo Automodel 与 Diffusers 的集成,为 Hub 上任意 Diffusers 格式模型提供生产级分布式扩散训练,无需转换 checkpoint 或重写模型。

    推荐理由:NVIDIA 与 Hugging Face 把分布式扩散训练接入 Diffusers,无需转换 checkpoint 或重写模型,可直接微调现有开源扩散模型。

7月1日周三