跳到正文

AI 视频

AI 视频生成与理解:文生视频模型、视频编辑工具与影视创作变革的追踪。

当前仅显示精选新闻

最新精选

第 1–20 条 · 共 55 条
10月3日周六
  1. 硅星人Pro · 微信公众号65

    Tavus 发布实时视频交互模型 Griffin,48% 参与者把预览版当成真人

    Tavus 发布实时视频交互模型 Griffin,在54人一分钟视频通话实验中,26人(约48%)把预览版 Griffin-Lite 当成真人,上一代系统该比例为 2.4%。模型采用全双工视频交互方案,可同时看听说并依据表情、视线和停顿回应,音频到视频生成平均延迟 0.43 秒,实时生成 720p、25 帧每秒画面;目前仅向部分可信测试者开放研究预览,团队正开发 AI 身份披露功能。

    推荐理由:原文同时给出48%的实验数字和延迟、榜单成绩,读者可以据此自行判断这轮视频交互能力的边界。

  2. DeepTech深科技 · 微信公众号67

    Tavus 发布全双工人类交互模型 Griffin,48% 受试者误认其为真人

    Tavus 于 10 月 1 日发布全双工视频到视频模型 Griffin(研究预览版 Griffin-Lite),将感知、决策和生成整合进端到端系统,替代传统级联架构。

    推荐理由:原文给出了 Griffin 的架构思路、VideoFDB 评测数据和盲测结果,读者可对比级联方案与端到端实时交互的差异。

10月2日周五
  1. Z Finance · 微信公众号65

    Higgsfield 创始人万字复盘:AI 应用死于自研模型虚荣,控制流量路由才是护城河

    Z Finance 编译 Higgsfield 创始人 Alex Mashrabov 与 20VC 的访谈,公司用 18 个月将年化收入从 100 万美元做到 10 亿美元,企业客户收入已过半。

    推荐理由:Higgsfield 创始人复盘自研模型收缩与模型路由带来的毛利差异,把分发控制权视为应用层真正的护城河。

  2. AYi65

    作者引用 Ben Affleck 在闭门峰会的分享,其创立的 16 人后期 AI 工作室 InterPositive 于 2026 年 3 月被 Netflix 以 5.87 亿美元现金全资收购。做法是解冻开源视频权重、专训最后的电影层,并用在受控舞台实拍 8 个月的私有数据集做后期训练;每部新片在自己的拍摄素材上微调专属私有模型,素材与模型迭代成果留在剧组手里。

    引用Rohan Paul@rohanpaul_ai

    Ben Affleck (Hollywood star & Artists Equity CEO) talks about how he fine-tunes open video models by unfreezing weights and trained only the last cinematic layer so a film crew can hit real production standards. for context, Ben Affleck founded InterPositive in 2022, a 16-person AI shop for film post and Netflix bought it in March 2026 for $587 mn in cash. He needed that model because public video models were trained on his peers' films, and he did not think that was a real business. So InterPositive raised money, shot its own dataset for 8 months on a controlled stage, and used it only as late-stage training. Each new film then trains a private model on its own dailies, so the production keeps the footage and the learning. That is the product Netflix paid $587 million for. ---- From "Bloomberg Live" YouTube channel, (link in comment)

    推荐理由:原文梳理了 Ben Affleck 用私有实拍数据微调开源视频模型的思路与产权闭环,读者可以借此对比公共模型与影视级生产的差距。

10月1日周四
9月24日周四
9月12日周六
9月10日周四
  1. Z Potentials · 微信公众号67

    GPT-6 Astra与实时视频模型并进,AI游戏和互动内容成本结构重排

    文章梳理一周内互动内容的模型竞争:OpenAI发布GPT-6 Astra与GPT-image-2.5(延迟最多降50%),fal发布H3 Max/H3 Max Turbo,Yoroll发布基于MiniMax H3的H3 Superfast(8×B200上推理10秒视频约需4秒)及实时互动产品YoLive。

    推荐理由:原文梳理了实时视频生成与GPT-6带动AI游戏的具体玩法、成本结构和Harness搭建思路,给出了可参照的分析框架。

9月9日周三
9月4日周五
9月3日周四
9月2日周三
  1. Google DeepMind68

    Google DeepMind 为 Gemini 推出 agentic video understanding 视频分析功能

    Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上推出 agentic video understanding,动态检索视频片段以替代固定帧率处理,token 消耗最多降 88%,成本最多降 66%,准确率最多提升 7%。

    推荐理由:官方给出 token、成本与准确率的具体降幅和开启方式,长视频处理场景下可评估是否切换处理模式。

8月31日周一
  1. MiniMax 稀宇科技 · 微信公众号66

    MiniMax 将 H3 Max 768P 与 480P 接入开放平台,支撑实时 AI 直播

    MiniMax 将 H3 Max 768P 与 H3 Max 480P 接入开放平台和 MiniMax Design。H3 Max 生成 5 秒 768p 音视频不到 3 秒,吞吐量约为 MiniMax H3 的 35 倍;fal 工程师和 Pieter Levels 已基于它搭建 Twitch 实时直播与 24 小时 AI 直播网站。

    推荐理由:官方给出 H3 Max 的生成速度、吞吐量对比和接入入口,读者可以判断实时 AI 直播这类场景是否已经跑得通。

8月28日周五
8月25日周二
  1. @alibaba_cloud68

    Wan 3.0 已在 OpenRouter 上线,支持从文本、图像或参考素材生成 2–30 秒视频,最高 1080p。OpenRouter 公布的上线定价为 480p、720p、1080p 每秒 $0.05、$0.10、$0.20,全分辨率限时 15% 折扣。阿里云同时给出 Model Studio 与 Qwen Cloud 两个 API 接入入口。

    引用@OpenRouter@OpenRouter

    Alibaba's Wan 3.0 from @Alibaba_Wan and @alibaba_cloud is now live on OpenRouter. Generate 2-30 second videos from text, images, or references at 480p, 720p, or 1080p. Launch pricing: $0.05/$0.10/$0.20 per second, with a limited-time 15% discount across every resolution. https://t.co/yzQNUKAo3o

    推荐理由:官方给出 2–30 秒、最高 1080p 的生成规格与 OpenRouter 接入入口,可据此评估视频生成的调用成本。