Dwarkesh Patel:RLVR 可能格外不擅长科学
RLVR might be disproportionately bad at science
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
Dwarkesh Patel 撰文认为,科学理论的验证回路往往长达数十年甚至数百年,无法像编码和数学那样为 RLVR 提供紧凑的训练信号,所以 AI 未必会在科学突破上格外擅长。
来源:Dwarkesh Patel · dwarkesh.com
RLVR might be disproportionately bad at science
本站未展示全文,请前往来源网站阅读。
Dwarkesh Patel 撰文认为,科学理论的验证回路往往长达数十年甚至数百年,无法像编码和数学那样为 RLVR 提供紧凑的训练信号,所以 AI 未必会在科学突破上格外擅长。
来源:Dwarkesh Patel · dwarkesh.com