跳到正文

#RAG

今日 6 条
今天10月2日周五
  1. Hugging Face Daily Papers35

    RPTune:面向 LLM 商品目录搜索的学习式上下文整理

    RPTune 是一个端到端框架,将学习式目录整理与 LLM 后训练结合,用自动生成的目录监督信号提升商品搜索。其编码器-重组器整理器依据下游 LLM 反馈对商品排序和剪枝,整理后的目录再通过上下文相对奖励改进后训练。在 7 个真实商家的评测中,上下文整理带来最高 31.4 个百分点的准确率提升,后训练平均再提升 10.3 个百分点。

  2. Hacker News popular via buzzing.cc51

    turbopuffer v3 弃用矢量主索引,重构存储架构

    turbopuffer 宣布 v3 将弃用以 ANN 矢量索引为主键的存储架构,把 ANN 降为二级索引。官方称现有架构已支持单索引 100B+ 向量、200ms p99 读、1k+ QPS,但存在存储放大、写放大和向量化受限三大问题;v3 已通过 100% CI,后续将公开基准测试并逐步上线生产。

10月1日周四
  1. Aravind Srinivas53

    Perplexity 开源其上下文嵌入模型,该模型在 turbopuffer 的 context-bench 上表现最佳。引用内容显示 pplx-embed-v2-context-9b-preview 采用整篇文档视野下编码每个文本块的新训练方式,在 ConTEB 和 turbopuffer 的 context-bench 上创下 SOTA,详见 https://www.perplexity.ai/hub/blog/contextual-embedding-beyond-the-gold-passage

    引用Perplexity@perplexity_ai

    We built a new way to train contextual embedding models, which encode each chunk of a document with the whole document in view. pplx-embed-v2-context-9b-preview sets a new state of the art on ConTEB and @turbopuffer's new, privately held context-bench. https://www.perplexity.ai/hub/blog/contextual-embedding-beyond-the-gold-passage

9月30日周三
9月29日周二
  1. ByteByteGo45

    为什么 LLM 会说谎?

    LLM 的幻觉是指生成内容与事实不符、凭空编造或与给定材料相矛盾,例如把公司 14 天退款政策说成 30 天并虚构 5 个工作日到账承诺。文章将错误分为事实性幻觉、忠实性幻觉和编造三类,并解释逐 token 预测文本的机制为何会产出虚构事实。

  2. Hugging Face Daily Papers36

    RASO:通过跨 Harness 适配的检索增强技能优化

    研究者提出检索增强技能优化框架 RASO,利用外部技能语料库作为先验知识,通过跨 Harness 适配解决领域与 Harness 不匹配问题。RASO 包含无需 agent rollout 即可构建初始技能的 RASI,以及依据执行反馈迭代优化技能的 RASU 两个阶段。在四个 agent benchmark 和两个模型上,RASO 持续优于无检索增强的基线方法。

9月26日周六
  1. ByteByteGo29

    Jev 最值得替代 LLM 的 9 个场景

    TypeSafe AI 的首个 System One Model Jev 比前沿 LLM 快 100 倍、成本低 100 倍,适合承担 LLM 周边的决策类任务。文章列出 9 个替代场景:模型路由、护栏检测、工具调用权限分类、收件箱分类、重排序、LLM 评测打分、批量打标、实时决策和置信度门控。核心思路是让 LLM 负责生成,Jev 负责围绕生成的决策。

9月23日周三
9月18日周五
  1. GitHub Blog · AI & ML43

    GitHub Podcast 拆解 AI 热门观点:该不该读代码、RAG 已死、Skills 是否杀死 MCP

    GitHub Podcast 最新一期拆解了五个 AI 热门观点:AI 生成的代码仍需阅读和负责,只是审查力度应按风险分级;Skills 与 MCP 解决不同问题,前者是打包的专家经验,后者为智能体提供连接工具和数据的标准接口,二者可组合使用。RAG 并未消亡,它让模型获取训练数据之外的信息,减少 token 浪费并降低答案不完整的概率。

9月16日周三
  1. ByteByteGo52

    LLM 如何在海量文档中找到关键信息:RAG 检索链路详解

    ByteByteGo 详解 LLM 应用中的检索问题,以员工询问航班取消后酒店报销为例,说明 RAG 如何从数千份文档中找到正确且仍然有效的政策条款。文章覆盖 chunking 粒度权衡、嵌入向量的语义匹配、余弦相似度等度量选择、Flat/IVF/HNSW 索引的速度与召回权衡、元数据过滤的先筛后筛取舍,以及政策更新时的版本切换和混合检索加 reranking 的最后优化步骤。

9月3日周四
9月2日周三
  1. Meta Engineering50

    Meta 构建从专家学习的组织级第二大脑 AI 智能体

    Meta 工程团队构建了一个作为组织第二大脑的 AI 智能体,通过结构化知识体系、可组合 recipes 推理层和自动自我改进循环,把专家反馈编译为无需模型重训练的验证更新。系统将 200+ 知识文件按密度与使用频率划分、以 YAML 依赖图组织,六周内把单项评估时间从数天降到数分钟,每轮次 token 消耗减少约 80%,改进周期零回归。

8月26日周三
  1. Hugging Face Blog74

    Sentence Transformers 教程:用 MultiVectorEncoder 训练与微调多向量嵌入模型

    Hugging Face 发布 Sentence Transformers v6.0 教程,介绍第四种模型类型 MultiVectorEncoder 的完整训练方法,支持 ColBERT 风格的 late interaction 检索微调与从零训练。

    推荐理由:作者用实测对比给出多向量模型微调的完整配方,包括起点选择、损失函数和索引压缩的量化取舍。

8月21日周五
  1. Hugging Face Blog64

    Hugging Face 解析 Papers with Code 搜索背后的 Inference Endpoints、Jobs 与 Buckets 架构

    Hugging Face 介绍 Papers with Code 混合搜索架构:PostgreSQL 全文检索加 pgvector 语义检索,经 RRF 融合,用 Qwen/Qwen3-Embedding-0.6B 生成 256 维向量,已覆盖超 110,000 篇 arXiv 论文。

    推荐理由:作者复盘了自己上线论文混合搜索的架构与教训,读者可以借鉴冷启动回退、embedding 契约和 Matryoshka 维度权衡这些可迁移做法。

8月20日周四
  1. Mistral AI66

    Mistral 发布 Agentic Search,多步检索在 FinanceBench 上将准确率从 26.7% 提升至 86%

    Mistral 发布 Agentic Search,通过 search、open、navigate、read、grep 五个工具让模型多步检索、翻阅并验证复杂文档,可通过 Mistral Search Toolkit 及 Studio 和 Vibe 中的 Libraries 使用,无需微调。

    推荐理由:官方给出多步检索循环的完整工具设计和两个基准的具体数字,读者可据此评估它替代一次性 RAG 的适用场景。

8月14日周五
7月16日周四
6月23日周二
  1. Mistral AI69

    Mistral 发布 Mistral OCR 4:支持边界框、块分类和置信度分数

    Mistral 发布 Mistral OCR 4,除提取文本外还返回边界框、块类型分类(标题、表格、公式、签名等)和逐页逐词的内联置信度分数,支持 170 种语言、10 个语言组。

    推荐理由:官方说明了新模型的结构化输出能力、基准得分及其已知评分缺陷,并给出 API 与 Document AI 的选择规则,便于读者判断适用场景。

6月5日周五
5月28日周四
  1. Mistral AI62

    Mistral AI 发布开源搜索框架 Search Toolkit 公测版

    Mistral AI 发布 Search Toolkit 公测版,一个用于构建 AI 应用生产级搜索管道的开源可组合框架,统一了此前分散的数据摄取、检索与评估三个环节。

    推荐理由:官方发布开源搜索框架,把 ingestion、检索和评估整合为统一接口,适合评估它能否减少 RAG 基础设施维护成本。

4月4日周六
3月17日周二
  1. Google Research49

    Google 用高温超导研究问题测试 LLM:NotebookLM 与自建 RAG 系统表现最佳

    Google 与康奈尔大学合作,让 GPT-4o、Perplexity、Claude 3.5、Gemini Advanced Pro 1.5、NotebookLM 和一套自建 RAG 系统回答 67 道高温超导专家级问题,由 12 位国际专家盲评打分。NotebookLM 在多数维度表现突出,自建 RAG 系统紧随其后,两者与 Gemini 在观点平衡性和答案全面性上排名前三。

5月28日周三
4月9日周三
3月7日周五
5月17日周五
11月29日周三
  1. Linear Now47

    Linear 如何用 AI 检测相似 issue

    Linear 将 Similar Issues 匹配功能推向全部工作空间,用 LLM 生成向量嵌入并在 issue 创建、Triage 和支持集成中提示重复或相关 issue。该功能基于 PostgreSQL 的 pgvector 存储与检索向量,按 workspace ID 分成数百个分区并分别建索引,以支撑数千万条 issue 的余弦相似度查询。