跳到正文
@ZHO_ZHO_ZHO· @ZHO_ZHO_ZHO · X·· 15 天前AI 评分30
AI 导读

(CVPR 2026)Machine Mental Imagery 直接指出,VLM 的 text-only decoding 会迫使视觉推理被语言化,并尝试让模型利用 latent visual tokens 进行视觉想象

正文

(CVPR 2026)Machine Mental Imagery 直接指出,VLM 的 text-only decoding 会迫使视觉推理被语言化,并尝试让模型利用 latent visual tokens 进行视觉想象

来源:@ZHO_ZHO_ZHO · x.com