火山引擎 Force 大会发布豆包 2.1 Pro、Seedance 2.0 4K 等 5 款模型
火山引擎在 6 月 23 日 Force 大会上发布豆包大模型 2.1 Pro、Seedance 2.0 4K 等 5 款新模型。Seedance 2.5 将于 7 月初上线,支持 30 秒单段原生视频直出和最多 50 个全模态素材联合生成。
推荐理由:文章给出豆包 2.1 Pro 与 Seedance 系列的发布细节,可看到一个云厂商把强模型当作云入口的整体打法。
AI 视频生成与理解:文生视频模型、视频编辑工具与影视创作变革的追踪。
当前仅显示精选新闻火山引擎在 6 月 23 日 Force 大会上发布豆包大模型 2.1 Pro、Seedance 2.0 4K 等 5 款新模型。Seedance 2.5 将于 7 月初上线,支持 30 秒单段原生视频直出和最多 50 个全模态素材联合生成。
推荐理由:文章给出豆包 2.1 Pro 与 Seedance 系列的发布细节,可看到一个云厂商把强模型当作云入口的整体打法。
AllenAI 发布 MolmoMotion,一个语言引导的 3D 运动预测模型:给定视频帧、物体上的 3D 点和动作指令,预测这些点未来几秒在 3D 空间中的轨迹。
推荐理由:原文给出3D点轨迹的预测表示与机器人和视频生成两类下游验证,可据此理解动作预测的落地路径。
Kimi Code, our open-source coding agent, just got a major upgrade! 🔹One-line CLI install, zero setup, fast startup 🔹Drag in videos as coding context: reference-to-LUT, long-video-to-short, screen-recording-to-code, and more 🔹Plugins for stocks, financial reports, academic papers, with more coming 🔹Supports the ACP protocol, and works with JetBrains, Zed, and more 🔹Hooks for custom tools and workflows Try it with Kimi K2.6 👉 kimi.com/code Issues, plugin ideas, and PRs welcome! Community feedback helps shape what ships next.🚀
推荐理由:原文列出升级后的零配置安装、视频上下文与插件能力,读者可据此判断编码智能体的门槛变化。
Easily add yourself to your video creations in Gemini. Here’s how to create your own digital avatar that looks and sounds like you with Gemini Omni. 🧵
推荐理由:原文给出三步生成数字分身并嵌入视频的流程,并说明 SynthID 水印可用于验证 AI 生成来源。
推荐理由:原文列出 Cosmos 3 在文本生成图像、图像生成视频等多个榜单的开源排名,可据此比较开源模型与闭源前沿模型的差距。
NVIDIA 在 Hugging Face 上发布 Cosmos 3,这是一个面向物理 AI 的开源全模态模型。它基于 Mixture-of-Transformers 架构,将世界生成、物理推理与动作生成整合到单一模型中。
推荐理由:NVIDIA 将世界生成、物理推理与动作生成整合到一个模型中,并给出开源模型与 Diffusers 接入方式。
推荐理由:官方给出了应用内的入口和一段可直接套用的提示词,读者能据此上手试试草图转现实的效果。
推荐理由:官方给出 Gemini Omni 的多模态输入组合和订阅档位,读者可据此判断该视频生成功能的可用范围。
推荐理由:Gemini Omni 面向 Google AI Plus、Pro、Ultra 订阅用户全球开放,读者可据此确认自身订阅是否覆盖该功能。
Gemini App 表示,Gemini Omni 可将文本、视频或最多五张图片作为素材,合成为一段连贯的十秒视频。该功能现已开放试用,官方邀请用户在回复中分享作品。
推荐理由:把文本、视频和多图素材统一到十秒视频输出,读者可了解 Gemini Omni 的多模态拼合方式。
Runway 发布 Runway MCP(Model Context Protocol)服务器,把 Runway 接入用户已有的 Agent 和编码工具,在对话中直接生成图像和视频而无需切换上下文。
推荐理由:原文给出了接入方式和可用模型清单,读者可据此判断在自己的 Agent 工作流中调用 Runway 生成是否顺手。
Runway 发布视频编辑模型 Aleph 2.0,并同步推出围绕其构建的 Edit Studio 应用。新模型支持编辑最长 30 秒的 1080p 视频,可做仅改动目标区域的局部编辑,用一帧编辑后的图像预览并控制最终效果,还能一次把改动应用到多个镜头。Edit Studio 面向营销团队、影视后期等场景,现已在所有 Runway 付费计划的桌面网页端开放。
推荐理由:原文给出了模型能力细节和开放范围,读者可以据此判断对现有视频素材二次加工工作流的影响。
We’re dropping Gemini Omni: our first step towards a model that can create anything from anything - starting with video. It combines Gemini’s intelligence with our generative media systems - representing a leap forward in world understanding, multimodality, and editing 🧵 Video
推荐理由:Gemini Omni 把生成视频做成可对话编辑的对象,并同步在 Gemini App 等入口上线,读者可据此观察视频生成向可编辑素材演进。
推荐理由:材料交代了 Gemini Omni 面向订阅层的开放节奏与视频优先的输出形态,读者可据此判断上手门槛。
Introducing Gemini Omni 🔮........ Omni is our new model that can create anything from any input — starting with video (think Nano Banana but for video). Available in the Gemini App, Flow, and YouTube, with API support coming soon! Video
推荐理由:原文给出 Gemini Omni 从任意输入生成视频的能力,以及 Gemini App、Flow 和 YouTube 的上线入口。
推荐理由:官方给出 Gemini Omni 的多模态输入与视频生成能力,读者可据此判断视频生成工作流的入口变化。
Introducing Gemini Omni 🔮........ Omni is our new model that can create anything from any input — starting with video (think Nano Banana but for video). Available in the Gemini App, Flow, and YouTube, with API support coming soon! Video
推荐理由:官方说明了 Gemini Omni 从任意输入生成内容的能力和首批视频场景,读者可据此了解当前可用渠道与范围。
推荐理由:Gemini 应用开放 Gemini Omni 视频创作,读者可从覆盖的订阅档位和入口判断自身是否可用。
推荐理由:原文给出 Gemini Omni 的输入方式与开放订阅档位,读者可据此判断视频创作门槛的变化。
Google 的 Gemini Omni 支持用对话编辑视频,用户可在多轮提示中重新构想动作、改变视角或调整光线。每次指令都会基于上一条,让角色保持一致、物理表现成立,并让场景记住先前内容。
推荐理由:原文给出多轮对话编辑视频的交互方式,读者可以了解角色一致性和物理表现在连续指令下的处理。