AI 导读
IBM 研究团队提出在 RAG 预处理阶段用 PyMuPDF 抽离文档目录树,并在向量检索前加一层基于目录元数据的轻量路由,可减少至少一半因暴力切片导致的上下文丢失。该论文第一作者已赴亚马逊图书科学团队,相关专利去年已布局。评测目前仅停留在小节定位是否正确,端到端生成效果仍取决于后续 Generator。
正文
1. 论文原文:https://t.co/KJRit7q0es (IBM 研究团队出品,第一作者已赴亚马逊图书科学团队,专利早在去年就已布局);
2. 落地借鉴建议:如果你手头有大量的企业制度或技术文档,可以在预处理阶段用 PyMuPDF 先抽离目录树,在向量检索前先做一层基于目录元数据的轻量路由,能砍掉至少一半由于暴力切片导致的上下文丢失;
3. 局限性说明:评测目前停留在“小节定位是否正确”,端到端的最终生成效果仍取决于后续 Generator 的表现。
来源:@AYi_AInotes · x.com