跳到正文
Hugging Face Daily Papers·· 2026-08-24AI 评分35

PatternEval 与 PatternRL:混合思考 MLLM 的响应行为评测与对齐

Beyond Correctness: Benchmarking and Aligning Response Behaviors in Hybrid-Thinking MLLMs

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

研究者提出 PatternEval 诊断基准,含 2,415 条多模态提示词,覆盖视觉感知与定位、结构化图像理解、多模态知识推理,检测思维链泄漏、响应重复、逻辑矛盾和表演式推理四类失败。

来源:Hugging Face Daily Papers · arxiv.org