跳到正文
Hugging Face Daily Papers·· 22 天前AI 评分31

有限反馈下基于 LLM 专家的在线学习

Online Learning with LLM Experts from Limited Feedback

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

研究在反馈预算有限(m ≪ T)的在线场景下,将提示词自适应路由到多个 LLM 专家以最大化回答质量,并建模为含 K 个专家动作、d 维提示词特征的 bandit 问题。所提算法在全信息设定下达到 Õ(dT/√m) 的 regret,在 bandit 设定下达到 Õ(dT√(K/m))。实验表明其能从有限反馈中高效学到跨多种 LLM 的高质量路由策略。

来源:Hugging Face Daily Papers · arxiv.org