跳到正文
原文
Hugging Face Daily Papers·· 2 天前AI 评分40

关键词匹配基准在小模型工具调用上失效:一套低成本诊断阶梯

Keyword Harnesses Fail Open: A Cheap Diagnostic Ladder for Tool-Use Claims in Small Language Models

AI 导读

一项研究记录了两个共享解码器与 tokenizer 的西班牙语安全模型在宽松工具调用指标上得分几乎相同(B4:0.660 vs 0.650),但逐字复现检查完全区分二者:661.6M 模型在 6/6 示例上生成有效工具调用,1,109M 模型在 0/6 上做到。

来源:Hugging Face Daily Papers · arxiv.org