跳到正文
原文
Apple Machine Learning Research·· 1 天前AI 评分43

Apple 提出 RLTL;DR:通过内化自生成反馈实现自我提升

RLTL;DR: Self-Improvement by Internalizing Self-Generated Feedback

AI 导读

Apple 研究团队提出 RLTL;DR,让策略在每次失败后根据验证器输出自行撰写一条 TL;DR 式反馈,并将上下文中的洞察反向传播以内化“任务→洞察”映射。

来源:Apple Machine Learning Research · machinelearning.apple.com