跳到正文
Hugging Face Daily Papers·· 26 天前AI 评分43

Φ-Bench:大语言模型能否工程化支撑自身运行的基础设施?

Φ-Bench: Can Large Language Models Engineer the Infrastructure That Powers Them?

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

研究者提出 Φ-Bench,用于系统评估 LLM 工程化 LLM 基础设施栈的能力,覆盖从局部 kernel 级函数补全到长周期实现与端到端系统优化等不同复杂度任务。该基准源自前沿研究中的优化问题并基于真实代码仓库构建,弥补了现有基准仅关注孤立 kernel、预定义算子或预设优化目标的不足。对前沿 LLM 的实验揭示了其在工程化复杂 LLM 基础设施上的现有能力与局限。

来源:Hugging Face Daily Papers · arxiv.org