面向多模态几何推理的可信用分配推理方法 CE-GRPO 发布
Learning Where Outcomes Change:Credit-Addressable Reasoning for Multimodal Geometry
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究提出可信用分配推理(credit-addressable reasoning),并实例化为 Code-CoT 与 CE-GRPO:前者将视觉关系表示为可按行寻址的可执行代码,并把推理组织为带类型事件;后者用结构先验与类型归一化熵选取事件边界,从共享前缀采样完整续写,将结果差异转为局部优势。
来源:Hugging Face Daily Papers · arxiv.org