跳到正文
原文
Hugging Face Daily Papers·· 2 天前AI 评分45

Multimodal Flow:在嵌入空间统一语言与视觉的流建模

Multimodal Flow: Unified Flow Modeling of Language and Vision in Embedding Spaces

AI 导读

Multimodal Flow 提出一种全连续的多模态生成模型,将文本块与图像组织为有序连续 hyperchunks,通过共享 chunk-causal flow backbone 和 Flow Matching 学习统一向量场。

来源:Hugging Face Daily Papers · arxiv.org