PatternEval 与 PatternRL:混合思考 MLLM 的响应行为评测与对齐
Beyond Correctness: Benchmarking and Aligning Response Behaviors in Hybrid-Thinking MLLMs
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究者提出 PatternEval 诊断基准,含 2,415 条多模态提示词,覆盖视觉感知与定位、结构化图像理解、多模态知识推理,检测思维链泄漏、响应重复、逻辑矛盾和表演式推理四类失败。
来源:Hugging Face Daily Papers · arxiv.org