Hugging Face Daily Papers·· 2 天前AI 评分40
关键词匹配基准在小模型工具调用上失效:一套低成本诊断阶梯
Keyword Harnesses Fail Open: A Cheap Diagnostic Ladder for Tool-Use Claims in Small Language Models
AI 导读
一项研究记录了两个共享解码器与 tokenizer 的西班牙语安全模型在宽松工具调用指标上得分几乎相同(B4:0.660 vs 0.650),但逐字复现检查完全区分二者:661.6M 模型在 6/6 示例上生成有效工具调用,1,109M 模型在 0/6 上做到。
来源:Hugging Face Daily Papers · arxiv.org