跳到正文
Hugging Face Daily Papers·· 25 天前AI 评分35

X-AuT:面向语音 LLM 的渐进式音频编码器压缩与跨尺度蒸馏

X-AuT: Progressive Audio-Encoder Compression for Speech LLMs with Cross-Scale Distillation

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

X-AuT 通过短行为探针选择层组合,并用表征对齐、跨尺度蒸馏、学生策略监督和 LoRA 微调恢复剪枝模型,语言模型主干保持冻结。在十项中英公开基准上,Qwen3-ASR-0.6B 的音频编码器从 18 层压到 16 层,宏平均错误率由 5.61% 降至 5.27%;14 层模型为 5.75%,音频塔参数减少 20.7%。

来源:Hugging Face Daily Papers · arxiv.org