跳到正文
@berryxia· @berryxia · X·· 2026-05-25AI 评分54
AI 导读

开源团队发布深度研究系统 Onyx,其调度器被剥夺搜索权限后,在 DeepResearch Bench 上拿下 No.1,超过闭源的 Claude 和 ChatGPT。

正文

这个团队的研究也是有点反常识,对于LLM的研究调度也是有点不一样的研究。

一个开源团队发现把深度研究系统中最聪明的总指挥调节器直接剥夺搜索权限。

反而让整个系统在DeepResearch Bench上直接登顶吊打Claude和ChatGPT。

这个反直觉的设计让Onyx成为目前公开可用的最强深度研究员

它叫Onyx GitHub上已经完全开源你现在就能跑

故事听起来简单却戳穿了几乎所有大厂AI Agent的共同毛病。

传统深度研究系统包括OpenAI o1系列Anthropic和Google的方案都给调节器塞满了工具它能搜索网页打开链接读文档写报告一条龙到底。

结果呢?

调度器一拿到搜索权就忍不住自己动手它开始疯狂拉结果浅尝辄止根本不做高质量的任务分解最后产出的报告永远是表面级。

Onyx的团队观察到这个致命bug后做了件谁都没敢做的事把调度器的搜索工具彻底砍掉

它只能写任务brief只能分解query只能评估下级agent交回来的中间报告但它自己绝不能上网不能检索不能提前下结论

这一刀直接逼着调节器做真正的“高阶战略思考”

整个架构只保持两层上面一个纯策略的调节器下面最多6个独立的research agent。

三阶段流水线超级清晰

Phase 1 调节器无工具权限把一个复杂问题最多拆成6个聚焦的研究方向写出极度自洽的任务brief

Phase 2 把任务分发给3个隔离的研究agent每个agent最多跑8轮“搜索-阅读-思考”循环产出带引用来源的中间报告它们还能接入企业内部Confluence Slack等100+数据源并且严格做文档级权限控制

Phase 3 一个确定性步骤把所有报告去重重新编号生成统一引用地图输出最终高质量报告

因为调节器全程不碰原始数据它就不会被“看到第一个结果就想收工”的诱惑污染因为只两层传递信息不会在多层摘要里被扭曲

结果Onyx在DeepResearch Bench上拿下No.1全面超越闭源的Claude和ChatGPT

更狠的是它还能无缝接入企业内部知识库这点连很多付费方案都做不到。

你今晚就可以试

直接去Onyx GitHub仓库链接在下面star一下然后按照readme把整个系统跑起来用CrewAI做整体编排 Mistral的Voxtral做语音输入输出就能复刻一个完全开源的顶级深度研究员。

整个框架100%开源架构细节pipeline代码实验数据全在仓库里

Big Tech还在卷“给模型塞更多工具更多上下文”Onyx却用一个“故意阉割”的调节器告诉所有人最聪明的约束往往才是最强的能力。

nitter.net/i/status/2058837753954…

Video

来源:@berryxia · x.com