MARGIN:面向多智能体基础模型协调的运行时置信度校准
MARGIN: Runtime Confidence Calibration for Multi-Agent Foundation Model Coordination
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
MARGIN 是一种运行时校准方法,无需重训模型或预留校准集,通过跟踪各模型近期准确率与自报置信度之比来修正置信分数,并用于多模型候选答案的加权决策。在 18 模型池的代码生成、问答与数学评测中,该方法在两次代码生成迁移上的预期校准误差低于全部五个在线校准基线,问答迁移上优于其中四个;代码生成协调实验中,答案选择准确率相比未校准的置信度加权提升 4.3 和 14.0 个百分点。
来源:Hugging Face Daily Papers · arxiv.org