Hugging Face Daily Papers·· 3 天前AI 评分40
PixelUMM:无编码器的统一图像与视频理解生成模型
PixelUMM: Encoder-Free Unified Image and Video Understanding and Generation
AI 导读
PixelUMM 是一个无需编码器的统一多模态模型,直接在像素空间完成图像与视频的理解和生成,将图像表示为空间 patch、视频表示为时空 tubelet,通过单层线性投影接入共享多模态主干。
来源:Hugging Face Daily Papers · arxiv.org