MemFold:通过 On-Policy 优化学习长上下文个性化的紧凑软记忆
MemFold: Learning Compact Soft Memory for Long-Context Personalization via On-Policy Optimization
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
MemFold 将查询条件下的文本记忆压缩为 K 个连续向量作为读者模型的记忆接口,并用任务结果的组相对奖励与置信度门控的 on-policy 蒸馏训练读者模型,教师模型仅用于重打分、推理时完全移除。
来源:Hugging Face Daily Papers · arxiv.org