FlavourBench:用可执行烹饪真值对前沿语言模型排名
FlavourBench: Ranking Frontier Language Models with Executable Culinary Ground Truth
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
FlavourBench 在 534 项替换、搭配与约束任务上评测了 27 个前沿大语言模型端点,共产生 14,418 个模型-任务评分单元,Grok 4.6 在该任务集上取得最高点估计 65.1。
来源:Hugging Face Daily Papers · arxiv.org