跳到正文

AI 视频

AI 视频生成与理解:文生视频模型、视频编辑工具与影视创作变革的追踪。

当前仅显示精选新闻

最新精选

第 41–60 条 · 共 64 条
6月24日周三
  1. 硅星人Pro · 微信公众号80

    火山引擎 Force 大会发布豆包 2.1 Pro、Seedance 2.0 4K 等 5 款模型

    火山引擎在 6 月 23 日 Force 大会上发布豆包大模型 2.1 Pro、Seedance 2.0 4K 等 5 款新模型。Seedance 2.5 将于 7 月初上线,支持 30 秒单段原生视频直出和最多 50 个全模态素材联合生成。

    推荐理由:文章给出豆包 2.1 Pro 与 Seedance 系列的发布细节,可看到一个云厂商把强模型当作云入口的整体打法。

6月17日周三
6月9日周二
  1. @berryxia67

    Kimi Code 开源编码智能体迎来重大升级,支持一行命令 CLI 安装、零配置快速启动,并可拖入视频作为编码上下文,实现参考视频转 LUT、长视频转短视频、屏幕录像转代码。插件系统可拉取股票价格、财报和学术论文,同时支持 ACP 协议接入 JetBrains 和 Zed,并提供自定义 hooks 扩展工作流,可搭配 Kimi K2.6 使用。

    引用Kimi Developers (@KimiDevs)@KimiDevs

    Kimi Code, our open-source coding agent, just got a major upgrade! 🔹One-line CLI install, zero setup, fast startup​ 🔹Drag in videos as coding context: reference-to-LUT, long-video-to-short, screen-recording-to-code, and more​ 🔹Plugins for stocks, financial reports, academic papers, with more coming​ 🔹Supports the ACP protocol, and works with JetBrains, Zed, and more​ 🔹Hooks for custom tools and workflows​ Try it with Kimi K2.6 👉 kimi.com/code Issues, plugin ideas, and PRs welcome! Community feedback helps shape what ships next.​🚀

    推荐理由:原文列出升级后的零配置安装、视频上下文与插件能力,读者可据此判断编码智能体的门槛变化。

6月2日周二
  1. @berryxia67

    Gemini Omni 上线数字头像功能,用户在 Gemini App 或网页的设置菜单点 Avatar,拍几张照片并录几句语音即可生成外貌与声音都像本人的数字分身。生成后在工具栏选中该 Avatar,就能把自己放进视频,普通用户几分钟可完成。所有用 Gemini Omni 生成的视频都会自动嵌入不可见 SynthID 数字水印,可在 Gemini App 中验证其是否为 AI 生成。

    引用Google Gemini (@GeminiApp)@GeminiApp

    Easily add yourself to your video creations in Gemini. Here’s how to create your own digital avatar that looks and sounds like you with Gemini Omni. 🧵

    推荐理由:原文给出三步生成数字分身并嵌入视频的流程,并说明 SynthID 水印可用于验证 AI 生成来源。

6月1日周一
  1. @kimmonismus70

    Cosmos 3 在多个公开榜单登顶,成为 Artificial Analysis 文本生成图像和图像生成视频的开源模型第一名。它在 Physics-IQ 的物理准确性上超过 Sora 2,在 PAI-Bench 整体领先 Veo 3.1,并在 RoboArena 位列机器人策略第一。作者称其以开放权重在物理表现上超过闭源前沿视频模型。

    推荐理由:原文列出 Cosmos 3 在文本生成图像、图像生成视频等多个榜单的开源排名,可据此比较开源模型与闭源前沿模型的差距。

  2. Hugging Face Blog80

    NVIDIA 发布 Cosmos 3:首个面向物理 AI 推理与动作的开源全模态模型

    NVIDIA 在 Hugging Face 上发布 Cosmos 3,这是一个面向物理 AI 的开源全模态模型。它基于 Mixture-of-Transformers 架构,将世界生成、物理推理与动作生成整合到单一模型中。

    推荐理由:NVIDIA 将世界生成、物理推理与动作生成整合到一个模型中,并给出开源模型与 Diffusers 接入方式。

5月30日周六
5月29日周五
5月28日周四
5月27日周三
5月21日周四
  1. Runway News62

    Runway 发布 Aleph 2.0 视频编辑模型及 Edit Studio 应用

    Runway 发布视频编辑模型 Aleph 2.0,并同步推出围绕其构建的 Edit Studio 应用。新模型支持编辑最长 30 秒的 1080p 视频,可做仅改动目标区域的局部编辑,用一帧编辑后的图像预览并控制最终效果,还能一次把改动应用到多个镜头。Edit Studio 面向营销团队、影视后期等场景,现已在所有 Runway 付费计划的桌面网页端开放。

    推荐理由:原文给出了模型能力细节和开放范围,读者可以据此判断对现有视频素材二次加工工作流的影响。

5月20日周三
  1. @berryxia75

    Google DeepMind 发布 Gemini Omni,将 Gemini 的智能与生成媒体系统融合,可先定义角色再放入任意场景并保持外貌、动作和光影一致,也支持用自然语言改风格、加效果或重拍已有视频。

    引用Google DeepMind (@GoogleDeepMind)@GoogleDeepMind

    We’re dropping Gemini Omni: our first step towards a model that can create anything from anything - starting with video. It combines Gemini’s intelligence with our generative media systems - representing a leap forward in world understanding, multimodality, and editing 🧵 Video

    推荐理由:Gemini Omni 把生成视频做成可对话编辑的对象,并同步在 Gemini App 等入口上线,读者可据此观察视频生成向可编辑素材演进。

  2. @berryxia73

    Gemini Omni 开始向全球 Google AI Plus、Pro 和 Ultra 订阅用户推出,首先支持视频输出。它不只构建看起来真实的场景,还能推理接下来应该发生什么,将对物理学的直观理解与 Gemini 对历史、科学和文化背景的知识结合起来。

    推荐理由:材料交代了 Gemini Omni 面向订阅层的开放节奏与视频优先的输出形态,读者可据此判断上手门槛。

  3. @minchoi81

    Google 发布新模型 Gemini Omni,可从任意输入创建内容,首发支持视频,被形容为视频版 Nano Banana。该模型已在 Gemini App、Flow 和 YouTube 上线,API 支持即将推出。

    引用Logan Kilpatrick (@OfficialLoganK)@OfficialLoganK

    Introducing Gemini Omni 🔮........ Omni is our new model that can create anything from any input — starting with video (think Nano Banana but for video). Available in the Gemini App, Flow, and YouTube, with API support coming soon! Video

    推荐理由:原文给出 Gemini Omni 从任意输入生成视频的能力,以及 Gemini App、Flow 和 YouTube 的上线入口。

  4. @kimmonismus82

    Gemini Omni 发布,官方介绍这是一款可从任意输入生成内容的新模型,首批聚焦视频,已在 Gemini App、Flow 和 YouTube 上线,API 支持即将推出。转发的作者 @kimmonismus 称这是真正的惊艳时刻,认为它是迈向 AGI 的世界模型,能从任何输入生成任何内容。

    引用Logan Kilpatrick (@OfficialLoganK)@OfficialLoganK

    Introducing Gemini Omni 🔮........ Omni is our new model that can create anything from any input — starting with video (think Nano Banana but for video). Available in the Gemini App, Flow, and YouTube, with API support coming soon! Video

    推荐理由:官方说明了 Gemini Omni 从任意输入生成内容的能力和首批视频场景,读者可据此了解当前可用渠道与范围。

  5. @Google78

    Google 在 GeminiApp 上线 Gemini Omni,支持任意组合文本与视觉输入生成电影感视频,即日起面向全球 Google AI Plus、Pro 和 Ultra 订阅用户开放。它提供对话式的视频创建与编辑方式,用户用简单提示词即可实现电影级变焦或更换背景,无需昂贵设备或技术术语。

    推荐理由:原文给出 Gemini Omni 的输入方式与开放订阅档位,读者可据此判断视频创作门槛的变化。