冻结 VLM 实现免训练语音中心全模态理解:TFO 框架发布
Training-Free Speech-Centric Omni Understanding with Frozen VLMs
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究者提出免训练全模态框架 TFO,无需架构修改或多模态重对齐,即可将冻结的 VLM 转为语音中心的全模态模型。TFO 用 Whisper 提取经置信度过滤、带时间戳的转写文本,经 VLM 原有语言接口输入,视觉通路保持不变。
来源:Hugging Face Daily Papers · arxiv.org