音视频扩散模型中的“注意力三角”:跨模态语义泄漏的机制分析与推理时干预
The Attention Triangle in Audio-Video Models
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究分析了音视频扩散模型中连接文本、音频、视频三条跨模态注意力边构成的“注意力三角”,发现音频-视频边是双向的,且受模型参数中的偏见影响,成为语义泄漏的主要来源:当提示词与模型先验冲突时,跨模态交互会覆盖预期条件,将语义导向视觉上常见但错误的结果。研究者据此提取注意力信号作为诊断工具,并用于引导推理时干预,在保持生成质量的同时改善了语义 grounding。
来源:Hugging Face Daily Papers · arxiv.org