跳到正文
量子位 · 微信公众号·· 2026-06-27AI 评分51

南大与腾讯混元提出 HYDRA/HYDRA-X,用单个 ViT Tokenizer 统一图像视频理解与生成

单个tokenizer胜任图像视频理解生成!南大&腾讯混元HYDRA打通多模态统一难题

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

南大王利民团队与腾讯混元提出 HYDRA 系列,用一个基于 ViT 的统一视觉 Tokenizer 同时承担原生多模态模型的理解与生成编码,替代此前分设语义 encoder 与重建 encoder 的做法。

来源:量子位 · 微信公众号 · mp.weixin.qq.com