Show HN:一个 AI 办公任务基准,以及我们在自家评审模型里发现的 4 个 bug
Show HN: An AI office-work benchmark, and 4 bugs we found in our own judge
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
有人发布了一个面向 AI 办公任务的基准测试,并公开了在自己所用评审模型(judge)中发现的 4 个 bug。该基准聚焦办公场景下的任务评测,作者同时披露了评审环节的缺陷。
来源:github.com(经 Hacker News) · github.com