跳到正文
@berryxia· @berryxia · X·· 2026-05-28AI 评分44
AI 导读

Qwen发布Qwen-Image-Bench,将T2I评测从提示词对齐扩展到真实世界保真度与创意生成能力,含1000条prompt和56个细粒度facet,并配套与人类对齐ρ=0.92的Q-Judger评判模型。该基准可解释诊断现有SOTA模型差距,开发者、提示词工程师和企业可将其用于pipeline测试、创意prompt自测及T2I供应商选型。

正文

Qwen新发布的Qwen-Image-Bench,把T2I评测从“生成”直接拉到“创作”:

56个细粒度facet + ρ=0.92人类对齐Q-Judger,OpenAI、Gemini、Grok、Flux全得重排座次!

大家还在死磕提示词对齐,Qwen却证明:真实世界保真度和创意生成能力才是真正差距。

新基准1000条prompt+56个rubric,可解释诊断,现有SOTA模型差距肉眼可见。

那么,对于我们有什么实际使用价值呢?

实际怎么用?(收藏)

1. 开发者/研究者:把自己的T2I pipeline(不管是Qwen自家模型、GPT-4o图像、Gemini的Imagen系列、Grok的Flux集成还是开源SD3)扔到这个benchmark上跑一遍。

重点看Real-world Fidelity和Creative Generation两个支柱的得分,就能知道真实差距在哪。

2. Prompt工程师:以后写复杂创意prompt时,可以用Q-Judger先自测一下生成结果在56个facet上的表现,快速迭代,而不是靠人工肉眼判断。

3. 企业/产品方:要选T2I供应商或者自研图像生成时,把Qwen-Image-Bench当作新标杆。

别再只看“prompt alignment”这种基础分了,直接看创意和保真度得分,更接近真实商业场景。

4. 对比实验:论文已经证明,它在区分领先模型上的分离度远超老基准。

想验证自己模型有没有进步?用这个跑前后对比,数据会说话。

Qwen这次的打法很清晰:不光自己卷模型,还把评测标准往前推了一大步。

就像当年Scaling Law出来后大家才知道该怎么卷参数一样,这次Qwen-Image-Bench把“从生成到创作”的评价框架给立住了。

引用Adina Yakup (@AdinaYakup)@AdinaYakup
Qwen @Alibaba_Qwen just dropped a new Text to Image benchmark + a judge model huggingface.co/collections/Q… ✨ 56 fine-grained evaluation facets ✨ Measures creativity beyond prompt alignment ✨ Covers storytelling/typography/design & physical logic ✨ Human aligned judge model (ρ = 0.92)
在 X 查看被引用的帖子

来源:@berryxia · x.com