跳到正文

#推理

今日 6 条
今天10月2日周五
  1. Rohan Paul68

    Google 发布论文 Cogentic,让多个 Gemini 智能体同时探索不同证明方向,由专用组件进行对抗式验证,并将已证结果保存供后续轮次使用。多数问题仅需约 100 次模型调用,5 个开放问题的结果均经人类专家独立确认,涉及在线学习、拍卖理论和机制设计。论文地址 arxiv.org/abs/2609.40324。

    推荐理由:原文给出了 Cogentic 多智能体证明发现系统的结构设计与验证结果,其中的严格审查与已证工作记录方法可迁移到长任务 Agent 设计。

  2. Hugging Face Daily Papers43

    视频大模型时序推理为何在输出层“褪色”:TAI 方法无需训练即可增强时序表征

    视频大语言模型(VideoLLMs)的时序推理能力在中间层达到峰值,却随层数加深逐渐衰减至输出层,导致反转帧序后预测结果往往不变。研究者据此提出 Temporal Activation Injection(TAI),在峰值层提取时序表征并注入后续层,无需训练即可在三个 VideoLLM 和四个基准上稳定提升时序推理,且对非时序任务影响极小。该研究已被 NeurIPS 2026 接收。

  3. Hugging Face Daily Papers35

    HC-DLM:分层连续扩散语言模型

    研究者提出分层连续扩散语言模型(HC-DLM),将离散 token 生成与连续隐变量轨迹耦合在单一去噪过程中,训练目标由 token 似然的变分下界推导而来。该模型以隐变量作为唯一持久生成状态,每步从中读出 token 并反馈作为下一步隐变量更新的脚手架。在 Sudoku、Countdown 和 LM1B 上,同等模型规模下 HC-DLM 在谜题准确率和生成困惑度上均优于离散与连续扩散基线。

  4. Ars Technica · AI68

    AI 系统以 16 块 GPU 击败史上最强 Stratego 选手

    来自 CMU、MIT、NYU 和 Stanford 的团队开发 AI 系统Ataraxos,以 15 胜 1 负 4 平击败公认史上最强 Stratego 选手 Pim Niemeijer,训练仅用 16 块 GPU 和几千美元。Stratego 是隐藏信息量大且时间跨度长的非完全信息游戏,此前连 DeepMind 也没能造出稳定战胜顶尖人类的机器。

10月1日周四
9月30日周三
  1. Hugging Face Daily Papers43

    自回归 Transformer 如何从局部观测外推混沌系统的全局动力学

    小型自回归 Transformer 仅用受限参数区间的轨迹训练,就能在训练分布之外的闭环评估中复现倍周期分岔、混沌动力学和吸引子结构。在 logistic 映射上,模型复现了直至周期 128 的连续倍周期分岔,得到有限阶标度比 4.6687,与 Feigenbaum 常数误差在 5×10⁻⁴ 以内。研究还通过因果干预揭示了控制参数信息经注意力机制影响状态预测与闭环动力学的路径。

  2. Hugging Face Daily Papers35

    邻近监督更优:Neighborhood OPSD 自蒸馏方法提升数学推理模型性能

    Neighborhood OPSD(N-OPSD)通过局部参数扰动构建冻结专家池,将参考对齐修正转化为学生可用的监督信号,在 AIME 2024、AIME 2025 和 HMMT February 2025 三项基准上,将 Average@12 较标准 OPSD 分别提升 2.75、1.67 和 1.94 分(对应 Qwen3-1.7B、4B、8B)。推理时仅使用蒸馏后的学生模型。

  3. Hugging Face Daily Papers32

    SpatialCORE:让大型视觉语言模型基于置信度进行空间推理

    SpatialCORE 是一个后训练框架,将模型对生成式 grounding 的自身置信度转化为空间推理的学习信号,通过自调节空间奖励按坐标 token 置信度加权每个预测边界框的匹配质量,并用答案门控将 grounding 优化与最终答案正确性绑定。该框架在多个基准上取得开源及专用空间推理模型中的 SOTA 结果,并可零样本迁移到未见数据分布,源代码已公开。

  4. Hugging Face Daily Papers41

    通过位置选择性自蒸馏从语言反馈中训练 LLM 评判模型

    研究提出位置选择性自蒸馏方法,利用自然语言反馈训练 LLM 评判模型。该方法基于教师与学生模型间的逐位置熵偏移进行位置掩码,保留熵偏移分布的低尾部分,从而提升分布外泛化能力。实验显示,自蒸馏评判模型在主观任务子类别上比 GRPO 等结果监督强化学习训练的评判模型高出 2-9 个百分点,在客观任务上保持竞争力。

9月29日周二
  1. Hugging Face Daily Papers36

    FlexRouter:为灵活 LLM 路由学习互补模型集合

    FlexRouter 是一个显式建模模型互补性的 LLM 路由框架,以「答案覆盖」为目标,最大化所选模型中至少一个给出正确答案的概率。它用 Determinantal Point Processes(DPPs)建模路由策略,并通过基于失败集边缘化的训练目标直接优化覆盖,推理时采用边际对数行列式增益的贪心策略,无需预设预算即可自适应确定子集大小。

  2. Hugging Face Daily Papers35

    音频-视觉大语言模型中的“问题接力”机制与 SECRET 去幻觉方法

    音频-视觉大语言模型(AVLLM)存在源混淆接地幻觉,即未使用模态的线索会诱发所需模态不支持的回答。路径干预与表征分析揭示“问题接力”机制是成因,据此提出的免训练方法 SECRET 通过对比不同模态路径干预诱发的问题表征,将问题状态引向所需源证据。

  3. Hugging Face Daily Papers40

    LoopVL:循环视觉智能

    LoopVL 将 Loop Transformer 扩展到视觉语言模型,通过 Module-Loop 与 Model-Loop 计算,用共享模块迭代更新统一的视觉语言状态。该模型从零开始经语言预训练、多模态训练和后训练,在多模态理解与视觉推理基准上超过同规模及更大规模的非循环模型。研究还观察到 LoopVL 出现"视觉顿悟时刻",即视觉注意力随循环次数发生显著转移。

  4. Hugging Face Daily Papers32

    自注意力在竞争下的检索容量研究

    研究通过保留每个注意力头、层和查询中注意力权重最高的 token 并测量 NLL 增幅,估算语言模型维持损失容差所需的有效注意力集合大小。基于注意力的选择显著优于随机选择,扩展上下文会增大所需集合大小但其占上下文比例下降,对保留权重重新归一化可大幅缩小该集合。

  5. Hugging Face Daily Papers45

    Prompt2Skill:仅凭自然语言指令实现无监督技能优化

    Prompt2Skill 是一个仅凭自然语言任务描述即可构建技能的无监督框架,能从提示词中推导任务规范、发现或合成数据集,并通过反思式编辑闭环迭代优化技能。在问答、阅读理解、电子表格操作和数学推理四个领域,该框架平均提升 10.8 分,持续优于直接提示基线。

  6. Hugging Face Daily Papers33

    CorrGRPO:面向多奖励学习的相关性归一化 GRPO

    CorrGRPO 提出将 GRPO 中成对奖励协方差归一化为皮尔逊相关系数,在不改变中心化总奖励的前提下,平衡不同尺度奖励对归一化的影响,避免大尺度奖励主导优势值计算。研究者在代码生成、工具调用和智能体安全三类任务上,使用 0.5B 至 8B 参数的模型进行对比,结果显示 CorrGRPO 在三项任务上均优于 GRPO 及其他变体。代码已开源。

  7. Apple Machine Learning Research45

    Apple 研究:语言模型树结构表达式序列化的通信瓶颈

    Apple 研究者提出往返协议,用生成器把算术表达式转成应用题、再由提取器还原,以符号等价作为精确判定,测试十六个模型的全部两两组合。结果显示该信道有损且不对称:交换生成与提取角色可使准确率变化最多 60.4 个百分点,最佳组合达 92.9%;至少 73.6% 的失败源于生成端,难度由树结构而非模型家族决定。约 3600 条微调样本即可让所有开源权重模型超过未训练的 Gemini-3.1-Pro。

9月28日周一
9月27日周日
9月26日周六
9月25日周五
9月23日周三
  1. Apple Machine Learning Research46

    Apple 提出 probe guidance:用冻结内部状态引导流匹配模型

    Apple 研究团队提出 probe guidance,利用现有扩散模型冻结的内部状态构建引导信号,无需在推理时增加额外前向计算。该方法在连续扩散语言模型的无条件生成上刷新 SOTA,应用于 1.7B 扩散语言模型时持续提升多项选择题基准表现。研究还发现,autoguidance 中的弱模型必须来自训练的低熵区域。

9月16日周三
  1. Google Research43

    Google Research 提出 Retrieve-for-Train:用 RL 编译扩散模型绕过推理瓶颈

    Google Research 提出 Retrieve-for-Train 框架,通过离线强化学习发现奖励对齐的查询扇出并编译为监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,实现单次非自回归的查询扇出,无需推理时的 CoT 思考 token。该方法基于 Gemma3-4B 和 Qwen3-4B 微调,旨在解决零样本 LLM 在数据库感知查询分解中的复述坍缩与自回归延迟瓶颈。

9月2日周三
  1. Hugging Face Blog52

    Allen AI 发布 BenchMIRT:在题目层面审计 LLM 基准实际测量的能力

    Allen AI 发布 BenchMIRT,一种基于多维 IRT 的方法,用于在单个题目层面审计 LLM 基准实际测量的能力。方法基于 100 个 LLM 在 16 个基准、超 34K 题目上的结果训练,未事先告知标签即独立恢复出安全与通用推理两个维度;分析发现 BBQ 和 WMDP 与通用推理的关联强于安全,HarmBench 的版权题也更接近推理。

8月17日周一
8月12日周三
  1. Google Research62

    Google Research 提出知识剖析框架:召回而非编码是前沿 LLM 事实性的瓶颈

    Google Research 发表研究,提出知识剖析(knowledge profiling)行为框架与 WikiProfile 基准(2,150 条 Wikipedia 事实,每条配 10 个任务),用于区分 LLM 事实错误的编码失败与召回失败。

    推荐理由:研究把事实错误拆分为编码失败与召回失败,指出前沿模型瓶颈在召回而非存储,并量化了 thinking 的恢复作用。

8月5日周三
  1. AI as Normal Technology67

    Princeton 团队用 shadow evaluations 测试前沿 Agent 的开放式 AI 研究能力,专家否决了两篇 Agent 论文

    Sayash Kapoor 等人发布论文,用 shadow evaluations 让前沿 AI Agent 回答两篇未发表论文的核心研究问题,各给数千美元 API 额度和六天时间,原论文作者明确否决了两篇 Agent 论文。

    推荐理由:原文提出 shadow evaluations 方法,用未发表论文测试前沿 Agent 的开放式研究能力,并给出五个具体失败模式,可迁移到对 RSI 进展的评估。

7月27日周一