对话生成内容的修订传播需要多少测试时算力?新基准与九种方法评测
What Else Needs Fixing? Exploring Cost-Effective Test-Time Compute for Revision Propagation in Artifacts Generated Through Conversation
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
针对 LLM 在对话中生成内容时需将局部修改传播到所有依赖部分的问题,研究者提出新基准并评测了九种修订方法,覆盖 gpt-oss-20b/120b、gpt-5.4-mini 和 qwen3.5-9b/27b/122b。
来源:Hugging Face Daily Papers · arxiv.org