NAPE:用下一音频 patch 嵌入预测打造可扩展音频学习器
Listening Forward: Next Patch Embedding Prediction Enables Scalable Audio Learners
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究者提出自监督框架 NAPE(Next-Audio-Patch-Embedding prediction),用因果 Transformer 从 log-mel 频谱图的先前 patch 嵌入预测下一个 patch 嵌入,仅靠因果掩码和 stop-gradient 作为训练信号,不使用重建解码器、声学 tokenizer、师生结构或辅助正则损失。
来源:Hugging Face Daily Papers · arxiv.org