跳到正文
github.com(经 Hacker News)·· 2026-08-05AI 评分30

Show HN:一个 AI 办公任务基准,以及我们在自家评审模型里发现的 4 个 bug

Show HN: An AI office-work benchmark, and 4 bugs we found in our own judge

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

有人发布了一个面向 AI 办公任务的基准测试,并公开了在自己所用评审模型(judge)中发现的 4 个 bug。该基准聚焦办公场景下的任务评测,作者同时披露了评审环节的缺陷。

来源:github.com(经 Hacker News) · github.com