跳到正文
Hugging Face Daily Papers·· 2026-08-21AI 评分38

NAPE:用下一音频 patch 嵌入预测打造可扩展音频学习器

Listening Forward: Next Patch Embedding Prediction Enables Scalable Audio Learners

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

研究者提出自监督框架 NAPE(Next-Audio-Patch-Embedding prediction),用因果 Transformer 从 log-mel 频谱图的先前 patch 嵌入预测下一个 patch 嵌入,仅靠因果掩码和 stop-gradient 作为训练信号,不使用重建解码器、声学 tokenizer、师生结构或辅助正则损失。

来源:Hugging Face Daily Papers · arxiv.org