跳到正文
Hugging Face Daily Papers·· 2026-08-24AI 评分35

FlavourBench:用可执行烹饪真值对前沿语言模型排名

FlavourBench: Ranking Frontier Language Models with Executable Culinary Ground Truth

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

FlavourBench 在 534 项替换、搭配与约束任务上评测了 27 个前沿大语言模型端点,共产生 14,418 个模型-任务评分单元,Grok 4.6 在该任务集上取得最高点估计 65.1。

来源:Hugging Face Daily Papers · arxiv.org