跳到正文
Dwarkesh Patel· Dwarkesh Patel·· 2026-05-17AI 评分55

Dwarkesh Patel:RLVR 可能格外不擅长科学

RLVR might be disproportionately bad at science

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

Dwarkesh Patel 撰文认为,科学理论的验证回路往往长达数十年甚至数百年,无法像编码和数学那样为 RLVR 提供紧凑的训练信号,所以 AI 未必会在科学突破上格外擅长。

来源:Dwarkesh Patel · dwarkesh.com