TLive-Omni:面向电商直播的全模态理解模型
TLive-Omni: An Omni-Modal Understanding Model for E-Commerce Live Streaming
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究团队提出 TLive-Omni,一个面向电商直播场景的全模态理解模型,可将图像、视频、音频和文本映射到统一表示空间。该模型引入 Per-vGrid 时间戳 token 组织方式实现音视频时间对齐,并采用三阶段监督训练加 Faithful-RFT 强化微调,在电商直播基准上表现强劲,同时在通用基准上保持良好泛化能力。
来源:Hugging Face Daily Papers · arxiv.org