有限反馈下基于 LLM 专家的在线学习
Online Learning with LLM Experts from Limited Feedback
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究在反馈预算有限(m ≪ T)的在线场景下,将提示词自适应路由到多个 LLM 专家以最大化回答质量,并建模为含 K 个专家动作、d 维提示词特征的 bandit 问题。所提算法在全信息设定下达到 Õ(dT/√m) 的 regret,在 bandit 设定下达到 Õ(dT√(K/m))。实验表明其能从有限反馈中高效学到跨多种 LLM 的高质量路由策略。
来源:Hugging Face Daily Papers · arxiv.org