跳到正文
Hugging Face Daily Papers·· 2026-08-25AI 评分35

TLive-Omni:面向电商直播的全模态理解模型

TLive-Omni: An Omni-Modal Understanding Model for E-Commerce Live Streaming

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

研究团队提出 TLive-Omni,一个面向电商直播场景的全模态理解模型,可将图像、视频、音频和文本映射到统一表示空间。该模型引入 Per-vGrid 时间戳 token 组织方式实现音视频时间对齐,并采用三阶段监督训练加 Faithful-RFT 强化微调,在电商直播基准上表现强劲,同时在通用基准上保持良好泛化能力。

来源:Hugging Face Daily Papers · arxiv.org