跳到正文
@AYi_AInotes· @AYi_AInotes · X·· 25 天前AI 评分45
AI 导读

IBM 论文提出 STAIR,用生成式检索让模型先读目录树再定位章节,在覆盖医学、金融、法律等 6 大领域 18 本教材的 SearchTome 基准上命中率达 82.6%,高于 BM25 的 59.5%、DPR 的 68.7% 和 DSI 的 76.9%。

正文

现行 RAG 架构犯过最反人类的错误,就是把一本结构严谨的书,撕成几千张碎纸条再去搜,把厚厚的法规、合同按 500 字切成碎纸条丢进向量库,

这根本不叫检索,这叫在碎纸机里碰运气,
IBM 刚挂出的这篇论文直接把窗户纸给捅破了:
人类查书从来都是先翻目录,把这个习惯教给模型,检索命中率从 68% 狂飙到 82.6%:

回顾一下现在全网知识库是怎么干活的:
把几百页的法律法规、员工手册、技术白皮书,机械地按 500 个 Token 暴力切碎、转成向量塞进向量库;
只要用户一提问,就在库里找几个最相似的碎片塞进 Prompt 里。
这种做法在工程上极其愚蠢:
因为在切碎的瞬间,章节从属、因果推导与上下文拓扑被全部物理切断;
大模型一看到长文本,就陷入著名的“迷失在中间(Lost in the middle)”,开始一本正经地凭空胡编。

真实人类查书从来不会这么干。
你查《刑法》不会撕成纸条去盲抽,而是先看目录:
民主制度 $\to$ 选举制度与政党 $\to$ 翻到对应小节精读。

IBM 团队刚挂出来的重磅论文 STAIR(arXiv:2609.03874),
用一种极度返璞归真的“生成式检索”,把这个人类常识做成了工业级系统:

看懂它的技术实现,你会发现它比盲目堆向量高维得多:

1️⃣ 提取真实目录树,以“小节”为最小单元:
直接从 PDF 提取完整的 Table of Contents,检索目标不再是切碎的碎片,而是作者亲笔写的叶子章节标题;
2️⃣ 约束解码,堵死幻觉:
拿 7B 小模型微调,输入是“整本目录树 + 你的问题”,输出只能是一个合法的章节名!
因为加了硬约束解码,模型根本没有机会去捏造不存在的伪章节,虚构章节的幻觉率从原生模型的 24% 断崖式砸到了不到 0.05%!
3️⃣ 硬核基准实测数据(拒绝营销夸大):
在覆盖医学、金融、法律等 6 大领域的 18 本公开教材(SearchTome 基准)测试中:
• 传统关键词 BM25:命中率 59.5%
• 经典向量检索 DPR:命中率 68.7%
• 最强对照 DSI:命中率 76.9%
• IBM STAIR:直接干到了 82.6%!
(顺便打个假:网传所谓的“把 GraphRAG 摩擦”纯属吹牛,论文压根没测 GraphRAG,80.6% 也只是自然科学单科成绩,全科平均是 82.6%)。

当然,必须客观划清它的适用边界:
它极其适合教材、法规、合同、技术手册这类“本来就带着清晰层级标题”的大部头;
面对没有目录的乱麻 Slack 聊天记录或流水账网页,它也巧妇难为无米之炊。

但它证明了一个至关重要的工程哲学:
检索不准,才是大模型幻觉真正的上游水龙头;
别再迷信无限扩大的上下文窗口了,
教会大模型学会先读目录、再按图索骥去翻书,往往比无脑烧算力强上一万倍。

来源:@AYi_AInotes · x.com