多跳 RAG 反而更脆弱:实体图链接与迭代改写如何放大 ASR 上游错误
研究发现,实体图链接与迭代改写这两种 RAG 扩展会放大 ASR 错误:在 HotpotQA、2WikiMultiHopQA 和 MuSiQue 三个多跳 QA 基准上,两者组合时从干净文本到最高 WER 口音的 F1 差距比朴素稠密检索大 36-67%。
项目更新、模型与开源社区动态
研究发现,实体图链接与迭代改写这两种 RAG 扩展会放大 ASR 错误:在 HotpotQA、2WikiMultiHopQA 和 MuSiQue 三个多跳 QA 基准上,两者组合时从干净文本到最高 WER 口音的 F1 差距比朴素稠密检索大 36-67%。
Claude Code 发布 v2.1.245,修复了在搭载 glibc 2.44 的 Linux 发行版(如 Arch Linux、CachyOS 和 Fedora Rawhide)上的启动崩溃问题。
Task-CoEvolve 通过让验证任务与 harness 协同演化,用基于历史结果的方差加权采样聚焦能力前沿附近的任务,并从部分评估中估计全集分数。在在线文本分类和 Terminal-Bench 2.1 上,它匹配全量搜索的最终性能,同时将优化过程中的评估次数减少 80%。代码将开源。
针对开放域交互中同一组 rollout 行为不可比导致奖励偏好扭曲相对优势的问题,研究者提出训练方案 ARC(Advantage Regularization via Conditioning),通过策略条件化分组、混合奖励与熵正则恢复更公平的相对比较。
研究者推出 GameXpert-Bench,用 GameGen、GameFix、GameOpt 三条赛道分别评测编程智能体的游戏生成、缺陷诊断修复与多轮优化能力,共含 11 类 97 个生成任务、50 个游戏关卡衍生的 100 个修复任务(每个注入 19-27 个 bug)以及 17 条六轮优化链、102 个请求。
针对图像编辑中编辑概念粒度关注不足与稀疏监督导致训练低效的问题,研究者构建了包含超 1,000 个细粒度编辑概念的分层分类体系,并通过改进的合成框架搭建了 1,200 万高质量编辑对数据集 ConceptEdit-12M。同时提出密集监督训练策略,将多个互不干扰的概念合成到单张图像对中,显著提升训练效率与模型性能,并推出细粒度评测套件 ConceptEdit-Bench。
Prime Agent 是一个面向长程评估与编码智能体工作流的开源 harness,用持久 IPython REPL 实现递归语言模型抽象,Continual Harness 跨轨迹保留历史、记忆、技能、提示词和子智能体规范,递归子智能体之间可直接通信。
针对 On-policy 蒸馏(OPD)中教师奖励与真实推理进展不一致的问题,研究者提出 R2-OPD,通过构建教师奖励与独立估计的进展奖励两种轨迹内排序,在两者不一致时选择性抑制蒸馏奖励。该方法在推理表现上持续优于标准 OPD。论文编号 arXiv:2608.19408。
ReWorld 是一个交互式世界模型,通过混合注意力窗口与随机头路由分离控制与记忆,推理时用固定预算的 KV cache 加姿态索引地标库实现长时记忆。它经 LoRA 分布匹配蒸馏将采样压缩至 4 步,可实时流式生成 704x1280 视频。在 64 秒往返 rollout 中,其 12 chunk 固定缓存仍能重建起始视角,旋转误差 11.95°。
TileMix 是一种以 tile 为中心的精度路由内核,将注意力矩阵切分为硬件对齐的 score tile,用紧凑 bitmask 把每个 tile 组分配到 FP16 或 INT8 计算,两条路径共享 online-softmax 状态。
检索增强问答系统在模型标识、提示词、检索策略等全部固定的情况下,仅因索引从 1 个分片扩展到 7 个分片,就会出现答案漂移。
Apodex 1.1 通过环境扩展与智能体协同扩展两条路径提升复杂任务的持续执行能力,在专业工作、金融、科研、数学、编程和搜索等场景达到领先水平,且所用模型规模明显小于许多前沿系统。其 35B 参数的 Apodex 1.1 Mini 以可本地部署的形式保留了较强的工作能力。
RISE 是一个面向 World Action Models 的系统级自适应想象框架,通过 Latent Evaluator 与 Rollout Gate 逐步做出 Roll/Stop 决策,按预期规划收益动态分配想象预算,减少不必要的 rollout。
研究团队提出 TLive-Omni,一个面向电商直播场景的全模态理解模型,可将图像、视频、音频和文本映射到统一表示空间。该模型引入 Per-vGrid 时间戳 token 组织方式实现音视频时间对齐,并采用三阶段监督训练加 Faithful-RFT 强化微调,在电商直播基准上表现强劲,同时在通用基准上保持良好泛化能力。
WorldMind 是首个面向游戏世界模型的解耦式状态感知 NPC 行为框架,将交互式世界建模拆分为理解、决策、控制与生成四层,并通过闭环重连让 NPC 行为锚定在不断演化的游戏状态上。团队同时发布 BOSS-140K 数据集及可规模化自动采集的智能体,实验显示其能可靠重建紧凑状态并完成基于机制的规划,在约 70% 的成对比较中因 NPC 行为更具战术性与连贯性而优于基线。
Claude Code 发布 v2.1.243,本次更新仅涉及 CHANGELOG.md 与 feed.xml 的维护性改动。
PhysCaP 是一个面向机器人操作的物理信息 Code-as-Policy 智能体,通过引入物理信息探索层,让智能体以交互方式主动获取信息。它包含无需训练的属性提取模块,仅凭机器人本体感知即可估计物体质量与刚度,并采用 Planner 与 Prioritizer 双智能体设计平衡探索成本与信息效率。
Hydra-0 是一个以动作流为条件的通用世界模型,将机器人动作表示为像素运动,从而跨本体、任务、环境和视频生成骨干学习动作后果。其最佳配置相比动作条件基线将机器人运动误差降低 90.4%、物体运动误差降低 60.2%,并在 RoboLab 基准上实现重放与参考成功率之间 r=0.96 的 Pearson 相关性。
研究者提出 PV-SST 同行投票社交平台测试床,用 448 次试验、112 个模型×话题×种子区块检验 LLM 智能体群体行为。相比仅给话题的对照组,按同行点赞排序的往轮帖子信息流提升了最终轮词汇相似度(核心面板 +0.0082 TF-IDF 余弦,p=0.000105;更大变体 +0.0109,p=0.000001),但该对比混合了曝光与排序,无法单独识别排序效应。
SparsePR 是一种免训练稀疏注意力方法,通过 Response-Coupled Partitioning 与 Probe-Fitted Residual Reconstruction,将未探测查询的注意力输出误差较无语义块稀疏注意力降低 61.6–90.5%,执行对密度为 22%。
FlavourBench 在 534 项替换、搭配与约束任务上评测了 27 个前沿大语言模型端点,共产生 14,418 个模型-任务评分单元,Grok 4.6 在该任务集上取得最高点估计 65.1。
ParaTempo 是一个免训练的异步并行推理框架,以分支局部的"时间置信度"(对答案空间收敛程度的度量)驱动全部控制流程:低置信度分支被剪枝、持续收敛的分支提前退役、释放的算力用于派生新分支,置信度加权投票集中后全局停止生成。在数学与科学推理基准上,该方法平均延迟降低 21.8-32.2%,token 总用量减少 18.1-30.3%,同时保持有竞争力的准确率。代码与数据集已公开。
一篇综述提出全谱系人类上下文分类法,将人本智能划分为六个相互关联的层级:作为可观察主体(视觉外观与空间几何)、作为动态行动者(运动动力学与交互建模)、作为情境智能体(世界模拟与具身能动)。文章梳理了该领域的数据家族、计算架构范式与代表性训练和推理优化策略,并系统整理了相关数据集、benchmark 与评测指标,同时讨论了可扩展、可信、物理落地且可部署的开放挑战与方向。
研究者提出 Patch Reparameterization,在保留预训练语义 ViT 原有语义通路的同时,加入重建感知的 patch embedding,使冻结的 ViT 块既能保持多模态理解,又能高保真重建图像。
Daedalus-150M 是一个为 CPU 推理设计的卷积-注意力混合小模型,18 个 block 中仅 6 个保留完整注意力,其余 12 个使用短卷积,内存宽度固定为两个时间步。
EviRank 将多模态图像重排序重构为语义约束满足问题,把纯文本、纯图像或组合查询解析为统一证据包:覆盖实体、属性、关系等六类语义槽位的类型化标准,并标注为必需、禁止或可忽略。该方法在文本到图像、图像到图像和组合图像检索五个基准上取得 SOTA,且无需训练;其蒸馏出的轻量学生模型以显著更低成本保留教师模型 90% 以上能力。
研究者提出两步超参数迁移框架,为大规模 MoE 模型估算最优学习率:先为采用 MLA 和 Muon 优化器的 MoE 适配 μP,使最优学习率在宽度缩放模型间稳定迁移;再沿 token 维度建立预测性缩放律,用小型代理模型线性回归外推到 10 万亿 token 训练规模,R² 达 0.95。
一项受控研究发现,在线策略蒸馏(OPD)传递的是教师的推理行为而非具体答案,训练难度几乎不影响效果,连教师从未解决的问题也有用。迁移效果强烈依赖师生同源关系:同源组合能让学生在跨语言、推理范围甚至其他领域上接近教师,跨源组合则基本只拟合训练分布。这种广泛影响是双刃剑——按领域路由提示词无法限制各教师的影响,多教师组合会在能力间形成依赖混合比例的跷跷板效应。
研究者推出 OmniAssistBench,用于评测 Omni-LLM 作为实时视频助手的交互能力,通过逆向拆解互联网视频构建多轮交互数据,耗时超 1000 专家人时。测试中 Gemini-3-Pro 得 66.4 分(满分 100),开源 Qwen3-Omni-Instruct 得 51.2 分。模型普遍能理解用户输入,但在手势等视觉提示、多轮历史上下文保持和延迟到目标事件再响应上仍频繁出错。
研究团队提出 AgentMercury,一个从高层商业场景合成可执行环境的框架,先构建含实体、服务、工具、状态和跨服务不变量的持久世界,再让任务自然涌现。
针对 LLM/VLM 用户模拟器难以复现真实购物会话的问题,研究者提出 GUI 智能体 RecVerse,通过截图感知页面并生成多轮轨迹。它采用工作记忆、情景记忆与偏好记忆构成的分层记忆机制,并以轨迹级 RL 目标对齐真实用户的动作分布与购物意图。团队同时发布交互式电商 GUI 轨迹数据集 USB,实验显示 RecVerse 在行为保真度与意图一致性上显著优于现有基线。
一篇批判性叙事综述指出,Transformer 模型、检索增强流程与大语言模型(LLM)正在重塑圣训计算科学,数据资源扩充、分词任务成熟、传述人与来源核验问题得到更好形式化,LLM 辅助流程已支持语料规模化扩充、多语言访问与有依据的评估。
论文提出 Graph Engineering(图工程),一种面向下一代 LLM 智能体系统的范式,通过构建显式、动态、演化的图结构来表示任务、智能体与系统状态,从而组织复杂目标、编排异构智能体并支持系统级演化。
研究者提出 CLEAR,一种用轻量隐藏状态门控连续调节安全低秩适配器激活强度的条件式安全适配框架,旨在减少有害输出同时避免改动冻结主干。在 Llama-3-8B-Instruct 上,CLEAR 将 HarmBench ASR 从 32.3% 降至 0.5%,并比全局 SFT 或 LoRA 的 GSM8K 准确率高出最多 7.1 个百分点。
InfinityEdit 是一种轻量级编辑适配器,让流式视频生成器具备无限视频编辑能力:给定前序片段和编辑指令,模型生成延续该流并应用编辑的下一片段。适配器包含历史交叉注意力、时序因果自注意力和编辑交叉注意力三个模块,推理时仅在编辑请求到达的 chunk 激活,后续 chunk 由原模型以重置锚帧生成。实验显示其能在无界编辑序列下忠实延续视频流并保持稳定。
研究者提出 PatternEval 诊断基准,含 2,415 条多模态提示词,覆盖视觉感知与定位、结构化图像理解、多模态知识推理,检测思维链泄漏、响应重复、逻辑矛盾和表演式推理四类失败。
Llama-Mobile 提出一套面向 VLM 的量化框架,采用每参数 2.7-bit 的新格式,可在 Arm CPU 上高效执行,且量化流程由模型自身生成训练数据、无需访问原始训练环境。该框架将 Llama 3.2 11B Vision Instruct 压缩至 3.7 GB(8-bit 激活),在标准视觉问答任务上保持较强性能。
Claude Code 发布 v2.1.241 版本,本次更新以修复 bug 和提升可靠性为主,未引入新功能。
Claude Code 发布 v2.1.240 版本,本次更新以修复 bug 和提升可靠性为主。
FireRedTeam 发布 FireRedAudio,一个基于共享 9B LLM 的通用音频语言模型,采用解耦连续表示,Audio Encoder 负责理解、RedAE 通路负责生成。
推荐理由:原文给出模型架构设计和多基准评测数据,并附完整开源代码,读者可据此评估其音频理解与生成能力。