X-AuT:面向语音 LLM 的渐进式音频编码器压缩与跨尺度蒸馏
X-AuT: Progressive Audio-Encoder Compression for Speech LLMs with Cross-Scale Distillation
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
X-AuT 通过短行为探针选择层组合,并用表征对齐、跨尺度蒸馏、学生策略监督和 LoRA 微调恢复剪枝模型,语言模型主干保持冻结。在十项中英公开基准上,Qwen3-ASR-0.6B 的音频编码器从 18 层压到 16 层,宏平均错误率由 5.61% 降至 5.27%;14 层模型为 5.75%,音频塔参数减少 20.7%。
来源:Hugging Face Daily Papers · arxiv.org