跳到正文
Hugging Face Daily Papers·· 2026-08-28AI 评分41

基于智能体推理的多镜头长视频一致性编辑框架 MMLVE-Agent

Thinking on Shots: Consistent Multi-Shot Video Editing with Agentic Reasoning

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

研究团队提出 MMLVE 任务与 MMLVE-Agent 框架,用 LLM 与 VLM 协同实现镜头级视频解耦和指令解析,解决长视频多指令编辑中的实体碎片化与编辑幻觉问题。团队同时构建了 MMLVE-Bench 数据集及三项评测指标,实验显示该框架优于 Seedance 2.0 等闭源 SOTA 方案,消除了编辑幻觉并保持跨镜头一致性与时空过渡。

来源:Hugging Face Daily Papers · arxiv.org