跳到正文
Hugging Face Daily Papers·· 2026-09-03AI 评分34

面向多模态几何推理的可信用分配推理方法 CE-GRPO 发布

Learning Where Outcomes Change:Credit-Addressable Reasoning for Multimodal Geometry

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

研究提出可信用分配推理(credit-addressable reasoning),并实例化为 Code-CoT 与 CE-GRPO:前者将视觉关系表示为可按行寻址的可执行代码,并把推理组织为带类型事件;后者用结构先验与类型归一化熵选取事件边界,从共享前缀采样完整续写,将结果差异转为局部优势。

来源:Hugging Face Daily Papers · arxiv.org