南大与腾讯混元提出 HYDRA/HYDRA-X,用单个 ViT Tokenizer 统一图像视频理解与生成
单个tokenizer胜任图像视频理解生成!南大&腾讯混元HYDRA打通多模态统一难题
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
南大王利民团队与腾讯混元提出 HYDRA 系列,用一个基于 ViT 的统一视觉 Tokenizer 同时承担原生多模态模型的理解与生成编码,替代此前分设语义 encoder 与重建 encoder 的做法。
来源:量子位 · 微信公众号 · mp.weixin.qq.com