西北工大与港科大提出 IQA-T1:让多模态大模型用结构化视觉证据给图片打分,7 个基准达 SOTA
大模型给图片打分不再“靠嘴说”!结构图、频谱图当“物证”,用“视觉证据”来给图片打分 | ECCV‘26
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
西北工业大学与香港科技大学提出 IQA-T1 框架,让多模态大模型在图像质量评估中主动调用感知工具库,生成噪声残差图、梯度分布、傅里叶频谱等结构化视觉证据,再基于证据逐步推理打分。该框架在 7 个 IQA 基准上取得综合最优,平均 PLCC/SRCC 达 0.795/0.784,平均每张图仅调用 2.34 个工具,论文与代码均已开源。
来源:量子位 · 微信公众号 · mp.weixin.qq.com