MLS-Bench 提出:140 个真实研究任务测量大模型方法发现能力
Auto-Research「终极大考」:新基准撕下大模型科研伪装
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
来自伯克利、普林斯顿、清华等多家机构的研究者提出 MLS-Bench,用覆盖 12 个机器学习方向的 140 个真实研究任务单独测量模型的方法发现能力。对初版五个前沿模型的评测显示,它们更擅长优化和组合已有组件,整体表现均未超过 Human SOTA。消融实验发现,移除参数规模检查后所有模型都会靠扩大容量提高成绩,重新施加容量约束后这类收益随即消失。
来源:机器之心 · 微信公众号 · mp.weixin.qq.com