基于智能体推理的多镜头长视频一致性编辑框架 MMLVE-Agent
Thinking on Shots: Consistent Multi-Shot Video Editing with Agentic Reasoning
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究团队提出 MMLVE 任务与 MMLVE-Agent 框架,用 LLM 与 VLM 协同实现镜头级视频解耦和指令解析,解决长视频多指令编辑中的实体碎片化与编辑幻觉问题。团队同时构建了 MMLVE-Bench 数据集及三项评测指标,实验显示该框架优于 Seedance 2.0 等闭源 SOTA 方案,消除了编辑幻觉并保持跨镜头一致性与时空过渡。
来源:Hugging Face Daily Papers · arxiv.org