推荐理由:原文给出了 Cogentic 多智能体证明发现系统的结构设计与验证结果,其中的严格审查与已证工作记录方法可迁移到长任务 Agent 设计。
#推理
#推理
今日 6 条
Rohan Paul@rohanpaul_ai精选AI 评分6868
Hugging Face Daily PapersAI 评分4343 视频大模型时序推理为何在输出层“褪色”:TAI 方法无需训练即可增强时序表征
视频大语言模型(VideoLLMs)的时序推理能力在中间层达到峰值,却随层数加深逐渐衰减至输出层,导致反转帧序后预测结果往往不变。研究者据此提出 Temporal Activation Injection(TAI),在峰值层提取时序表征并注入后续层,无需训练即可在三个 VideoLLM 和四个基准上稳定提升时序推理,且对非时序任务影响极小。该研究已被 NeurIPS 2026 接收。
elvis@omarsar0AI 评分4545
Hugging Face Daily PapersAI 评分4747 后训练中的锐化税:预训练 LLM 配轻量推理框架即可胜任智能体任务
研究发现,预训练 LLM 搭配轻量推理框架即可作为智能体使用,其 pass@1 准确率虽远低于后训练版本,但在充足测试时预算下 pass@K 解题覆盖率常反超后训练模型。
Hugging Face Daily PapersAI 评分3535 HC-DLM:分层连续扩散语言模型
研究者提出分层连续扩散语言模型(HC-DLM),将离散 token 生成与连续隐变量轨迹耦合在单一去噪过程中,训练目标由 token 似然的变分下界推导而来。该模型以隐变量作为唯一持久生成状态,每步从中读出 token 并反馈作为下一步隐变量更新的脚手架。在 Sudoku、Countdown 和 LM1B 上,同等模型规模下 HC-DLM 在谜题准确率和生成困惑度上均优于离散与连续扩散基线。
Ars Technica · AIAI 评分6868 AI 系统以 16 块 GPU 击败史上最强 Stratego 选手
来自 CMU、MIT、NYU 和 Stanford 的团队开发 AI 系统Ataraxos,以 15 胜 1 负 4 平击败公认史上最强 Stratego 选手 Pim Niemeijer,训练仅用 16 块 GPU 和几千美元。Stratego 是隐藏信息量大且时间跨度长的非完全信息游戏,此前连 DeepMind 也没能造出稳定战胜顶尖人类的机器。
The Decoder精选AI 评分8181 Ataraxos 击败 Stratego 史上最强人类选手,算力成本不到 DeepNash 的 1/500
Ataraxos AI 以 85% 的有效胜率击败四届世界冠军 Niemeijer,结束人类在 Stratego 上对 AI 的优势。
推荐理由:研究以不到 DeepNash 约 1/500 的算力击败人类最强 Stratego 选手,读者可从中了解不完美信息博弈的低成本训练思路。
AK@_akhaliqAI 评分2727SpatialClaw 重新思考智能体空间推理的动作接口 论文:https://huggingface.co/papers/2606.13673

Hugging Face Daily PapersAI 评分4343 自回归 Transformer 如何从局部观测外推混沌系统的全局动力学
小型自回归 Transformer 仅用受限参数区间的轨迹训练,就能在训练分布之外的闭环评估中复现倍周期分岔、混沌动力学和吸引子结构。在 logistic 映射上,模型复现了直至周期 128 的连续倍周期分岔,得到有限阶标度比 4.6687,与 Feigenbaum 常数误差在 5×10⁻⁴ 以内。研究还通过因果干预揭示了控制参数信息经注意力机制影响状态预测与闭环动力学的路径。
Hugging Face Daily PapersAI 评分3535 邻近监督更优:Neighborhood OPSD 自蒸馏方法提升数学推理模型性能
Neighborhood OPSD(N-OPSD)通过局部参数扰动构建冻结专家池,将参考对齐修正转化为学生可用的监督信号,在 AIME 2024、AIME 2025 和 HMMT February 2025 三项基准上,将 Average@12 较标准 OPSD 分别提升 2.75、1.67 和 1.94 分(对应 Qwen3-1.7B、4B、8B)。推理时仅使用蒸馏后的学生模型。
Hugging Face Daily PapersAI 评分4040 Soft Spatial Reasoning:用软思考提升 LVLM 空间推理
针对 LVLM 用 CoT 做空间推理时每步必须锁定单个 token、易造成过早离散化并传播错误的问题,研究者提出 Soft Spatial Reasoning 后训练框架,通过混合 token 嵌入形成连续软状态,让多个候选延续共同影响下一步推理。
Hugging Face Daily PapersAI 评分3232 SpatialCORE:让大型视觉语言模型基于置信度进行空间推理
SpatialCORE 是一个后训练框架,将模型对生成式 grounding 的自身置信度转化为空间推理的学习信号,通过自调节空间奖励按坐标 token 置信度加权每个预测边界框的匹配质量,并用答案门控将 grounding 优化与最终答案正确性绑定。该框架在多个基准上取得开源及专用空间推理模型中的 SOTA 结果,并可零样本迁移到未见数据分布,源代码已公开。
Hugging Face Daily PapersAI 评分4242 用在线蒸馏缓解长度扩展税:Length Self-Distillation 方法
针对 RL 后训练中已解出问题回复变得冗长的"长度扩展税"(LST),研究者提出 Length Self-Distillation(LSD),将已解出的提示词路由到 on-policy 蒸馏,未解出的仍保留原 RL 目标,并以在线策略的指数移动平均作为教师,无需外部模型。
Hugging Face Daily PapersAI 评分4141 通过位置选择性自蒸馏从语言反馈中训练 LLM 评判模型
研究提出位置选择性自蒸馏方法,利用自然语言反馈训练 LLM 评判模型。该方法基于教师与学生模型间的逐位置熵偏移进行位置掩码,保留熵偏移分布的低尾部分,从而提升分布外泛化能力。实验显示,自蒸馏评判模型在主观任务子类别上比 GRPO 等结果监督强化学习训练的评判模型高出 2-9 个百分点,在客观任务上保持竞争力。
Hugging Face Daily PapersAI 评分4545 RouteFM:面向 LLM 路由的基础模型,预训练一次即可跨环境路由
研究者提出 RouteFM,将 LLM 路由从针对特定查询负载和候选池的局部拟合,转向可复用的基础模型能力:它从行为上下文刻画匿名候选模型并推断其目标能力,而非绑定固定模型身份。
Hugging Face Daily PapersAI 评分3636 FlexRouter:为灵活 LLM 路由学习互补模型集合
FlexRouter 是一个显式建模模型互补性的 LLM 路由框架,以「答案覆盖」为目标,最大化所选模型中至少一个给出正确答案的概率。它用 Determinantal Point Processes(DPPs)建模路由策略,并通过基于失败集边缘化的训练目标直接优化覆盖,推理时采用边际对数行列式增益的贪心策略,无需预设预算即可自适应确定子集大小。
Hugging Face Daily PapersAI 评分5151 MILO 论文提出多智能体协同演化框架自动发现 agent harness
arXiv 论文 2609.38349 提出 MILO(Meta-evolutionary Island Orchestration),协同演化 agent harness 与发现 harness 的搜索策略,包含岛屿树层级谱系记忆、重写完整 harness 的 mutator agent 和自适应 orchestrator。
Hugging Face Daily PapersAI 评分3535 音频-视觉大语言模型中的“问题接力”机制与 SECRET 去幻觉方法
音频-视觉大语言模型(AVLLM)存在源混淆接地幻觉,即未使用模态的线索会诱发所需模态不支持的回答。路径干预与表征分析揭示“问题接力”机制是成因,据此提出的免训练方法 SECRET 通过对比不同模态路径干预诱发的问题表征,将问题状态引向所需源证据。
Hugging Face Daily PapersAI 评分4040 LoopVL:循环视觉智能
LoopVL 将 Loop Transformer 扩展到视觉语言模型,通过 Module-Loop 与 Model-Loop 计算,用共享模块迭代更新统一的视觉语言状态。该模型从零开始经语言预训练、多模态训练和后训练,在多模态理解与视觉推理基准上超过同规模及更大规模的非循环模型。研究还观察到 LoopVL 出现"视觉顿悟时刻",即视觉注意力随循环次数发生显著转移。
Hugging Face Daily PapersAI 评分3636 HeteroFold:面向异构多智能体 LLM 的免预填充跨模型族 KV Cache 传输
HeteroFold 是一种免预填充的跨模型族 KV Cache 传输方法,可在发送方与接收方均冻结的前提下对齐模型结构、映射并校准缓存。在六个传输方向上,它于四个长上下文基准上均取得最佳缓存传输表现,并在多智能体基准上追平文本通信。
Hugging Face Daily PapersAI 评分3232 自注意力在竞争下的检索容量研究
研究通过保留每个注意力头、层和查询中注意力权重最高的 token 并测量 NLL 增幅,估算语言模型维持损失容差所需的有效注意力集合大小。基于注意力的选择显著优于随机选择,扩展上下文会增大所需集合大小但其占上下文比例下降,对保留权重重新归一化可大幅缩小该集合。
Hugging Face Daily PapersAI 评分4545 Prompt2Skill:仅凭自然语言指令实现无监督技能优化
Prompt2Skill 是一个仅凭自然语言任务描述即可构建技能的无监督框架,能从提示词中推导任务规范、发现或合成数据集,并通过反思式编辑闭环迭代优化技能。在问答、阅读理解、电子表格操作和数学推理四个领域,该框架平均提升 10.8 分,持续优于直接提示基线。
Hugging Face Daily PapersAI 评分3333 CorrGRPO:面向多奖励学习的相关性归一化 GRPO
CorrGRPO 提出将 GRPO 中成对奖励协方差归一化为皮尔逊相关系数,在不改变中心化总奖励的前提下,平衡不同尺度奖励对归一化的影响,避免大尺度奖励主导优势值计算。研究者在代码生成、工具调用和智能体安全三类任务上,使用 0.5B 至 8B 参数的模型进行对比,结果显示 CorrGRPO 在三项任务上均优于 GRPO 及其他变体。代码已开源。
Apple Machine Learning ResearchAI 评分4545 Apple 研究:语言模型树结构表达式序列化的通信瓶颈
Apple 研究者提出往返协议,用生成器把算术表达式转成应用题、再由提取器还原,以符号等价作为精确判定,测试十六个模型的全部两两组合。结果显示该信道有损且不对称:交换生成与提取角色可使准确率变化最多 60.4 个百分点,最佳组合达 92.9%;至少 73.6% 的失败源于生成端,难度由树结构而非模型家族决定。约 3600 条微调样本即可让所有开源权重模型超过未训练的 Gemini-3.1-Pro。
Hugging Face Daily PapersAI 评分4343 无标签引导:将测试时强化学习压缩到仅偏置子空间
一种名为 label-free bias-only TTRL 的方法仅优化约 100K 偏置参数、冻结预训练主干,在 MATH-500 上让 Qwen2.5-7B 达到 76.67% 准确率,略超其有标签偏置引导复现结果,且参数量比全参数 TTRL 少 76,000 倍。
Hugging Face Daily PapersAI 评分3636 SeLMRoute:面向大语言模型路由的概率语义证据框架
SeLMRoute 是一种将候选模型无关的语义证据提取与候选性能学习、部署目标应用分离的 LLM 路由框架,先通过可解释问题生成概率语义状态,再由轻量监督路由器估计候选模型表现。
Hugging Face Daily PapersAI 评分3737 ReaLVR:用视觉证据监督潜空间推理,首次将潜空间视觉推理扩展至 235B 规模
针对潜空间视觉推理(LVR)中潜 token 对图像扰动响应微弱、缺乏显式监督的"潜证据信用缺口",研究者提出 ReaLVR,通过对比正确答案与模型生成的错误答案、匹配与不匹配的视觉证据,为模型自身的潜推理轨迹提供视觉证据监督。
Hugging Face Daily PapersAI 评分3333 Rubric Response Theory:用项目反应理论为语言任务评分并筛选评分标准
Rubric Response Theory(RRT)用两参数项目反应模型把评分标准的判定模式转化为标量质量信号,替代传统的分数加总方式。其 Response Parameter Network(RPN)根据提示词和标准文本预测标准难度与区分度,并随训练用在线期望最大化更新。
Hugging Face Daily PapersAI 评分5555 arXiv 论文揭示提示身份标签会导致多智能体 LLM 系统合作退化
arXiv 论文(arXiv:2609.35928)发现,多智能体 LLM 系统中当各智能体知晓彼此的模型家族时,群体会按标签分裂为派系,即任务本身并不奖励的 factionalism 现象。
Sakana AI BlogAI 评分4646 Sakana AI 与东京大学提出 SAIL:用测试时扩展提升 VLM 机器人轨迹生成可靠性
Sakana AI 与东京大学合作提出 SAIL(Scaling In-Context Imitation Learning),通过测试时扩展让 VLM 更可靠地生成机器人轨迹,该工作将在 IROS2026 展示。
Hugging Face Daily PapersAI 评分4141 LANTERN:从语言模型内部表征中挖掘隐藏数学知识
LANTERN 通过预训练模型激活上的分类器对候选关系排序,结合分阶段过滤、假设生成、可执行验证与分析检查,在 OEIS 的 10,000 个高频序列中排名 5000 万对,产出 62 条此前无交叉引用的已验证关系。
Anthropic Research精选AI 评分7272 物理学家复盘 Claude 在 N=4 super Yang-Mills 完成 nine loops 散射振幅挑战
物理学家 Matt von Hippel 发文复盘,Anthropic 的 Liam Fitzpatrick 和 Siddharth Mishra-Sharma 用 Fable 5.1 驱动的 Claude Science 完成他提出的挑战。
推荐理由:物理学家亲历 Claude 用千元级预算独立完成九圈振幅计算,给出对 AI 科研能力和低垂果实的第一手判断。
Apple Machine Learning ResearchAI 评分4646 Apple 提出 probe guidance:用冻结内部状态引导流匹配模型
Apple 研究团队提出 probe guidance,利用现有扩散模型冻结的内部状态构建引导信号,无需在推理时增加额外前向计算。该方法在连续扩散语言模型的无条件生成上刷新 SOTA,应用于 1.7B 扩散语言模型时持续提升多项选择题基准表现。研究还发现,autoguidance 中的弱模型必须来自训练的低熵区域。
Google ResearchAI 评分4343 Google Research 提出 Retrieve-for-Train:用 RL 编译扩散模型绕过推理瓶颈
Google Research 提出 Retrieve-for-Train 框架,通过离线强化学习发现奖励对齐的查询扇出并编译为监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,实现单次非自回归的查询扇出,无需推理时的 CoT 思考 token。该方法基于 Gemma3-4B 和 Qwen3-4B 微调,旨在解决零样本 LLM 在数据库感知查询分解中的复述坍缩与自回归延迟瓶颈。
Hugging Face BlogAI 评分5252 Allen AI 发布 BenchMIRT:在题目层面审计 LLM 基准实际测量的能力
Allen AI 发布 BenchMIRT,一种基于多维 IRT 的方法,用于在单个题目层面审计 LLM 基准实际测量的能力。方法基于 100 个 LLM 在 16 个基准、超 34K 题目上的结果训练,未事先告知标签即独立恢复出安全与通用推理两个维度;分析发现 BBQ 和 WMDP 与通用推理的关联强于安全,HarmBench 的版权题也更接近推理。
Import AIAI 评分4646 Import AI 469:科学 AI、RSI 模拟器与扎克伯格的技术悲观主义
DiG-bench(Discovery in Games)发布,这是一个包含 70 款隐藏规则游戏的基准,用于测试 AI 通过探索自主发现环境规则的能力,目前公开 21 款。
Google Research精选AI 评分6262 Google Research 提出知识剖析框架:召回而非编码是前沿 LLM 事实性的瓶颈
Google Research 发表研究,提出知识剖析(knowledge profiling)行为框架与 WikiProfile 基准(2,150 条 Wikipedia 事实,每条配 10 个任务),用于区分 LLM 事实错误的编码失败与召回失败。
推荐理由:研究把事实错误拆分为编码失败与召回失败,指出前沿模型瓶颈在召回而非存储,并量化了 thinking 的恢复作用。
Microsoft ResearchAI 评分5454 Microsoft Research 发布 CARE-X 胸部 X 光视觉语言模型
Microsoft Research 发布研究模型 CARE-X,统一支持胸部 X 光报告生成、疾病分类、定位和校准诊断预测,基于 SigLIP2-so400M 与 Phi-4-mini-instruct (3.8B),采用三阶段 SFT 加 DAPO 强化学习训练。
AI as Normal Technology精选AI 评分6767 Princeton 团队用 shadow evaluations 测试前沿 Agent 的开放式 AI 研究能力,专家否决了两篇 Agent 论文
Sayash Kapoor 等人发布论文,用 shadow evaluations 让前沿 AI Agent 回答两篇未发表论文的核心研究问题,各给数千美元 API 额度和六天时间,原论文作者明确否决了两篇 Agent 论文。
推荐理由:原文提出 shadow evaluations 方法,用未发表论文测试前沿 Agent 的开放式研究能力,并给出五个具体失败模式,可迁移到对 RSI 进展的评估。
Import AIAI 评分6363 Import AI 466:机器人学的苦涩教训、AI完成周级编程任务与OpenAI模型意外黑客事件
本期Import AI覆盖多件事:Epoch与METR发布MirrorCode基准,Claude Opus 4.7用14小时、251美元推理成本重实现人类需2至17周完成的程序。