AI 导读
ARC Prize 公布 Qwen3.8-27B 在 ARC-AGI (Verified) 的成绩:ARC-AGI v2 得分 42.4%,每任务成本 $0.45;ARC-AGI v1 得分 87.5%,每任务成本 $0.22。Qwen 的 chat template 对 low 和 xhigh 推理档位有指引,但没有 medium 档,这或许解释了 medium 档消耗更多 token 却得分低于 low 档。
推荐理由
ARC Prize 公布了 Qwen3.8-27B 的Verified 成绩与每任务成本,并指出 chat template 缺 medium 档指引可能影响表现。
正文
Qwen3.8-27B from @Alibaba_Qwen on ARC-AGI (Verified):
- ARC-AGI v2: 42.4%, $0.45/task
- ARC-AGI v1: 87.5%, $0.22/task
Qwen's chat template adds guidance for low and xhigh reasoning, but not medium, which may explain why medium used more tokens yet scored below low.
来源:ARC Prize · x.com