跳到正文
原文
Hugging Face Daily Papers·· 3 天前AI 评分40

PixelUMM:无编码器的统一图像与视频理解生成模型

PixelUMM: Encoder-Free Unified Image and Video Understanding and Generation

AI 导读

PixelUMM 是一个无需编码器的统一多模态模型,直接在像素空间完成图像与视频的理解和生成,将图像表示为空间 patch、视频表示为时空 tubelet,通过单层线性投影接入共享多模态主干。

来源:Hugging Face Daily Papers · arxiv.org