跳到正文

Hugging Face Daily Papers

huggingface.co · 开发者平台

当前显示全部 AI 相关新闻
切换来源
809 条AI 相关新闻 · 最新在前
9月28日周一
  1. Hugging Face Daily Papers35

    FAR:面向世界模型的自适应多线索情景记忆召回框架

    研究者提出 Future-Aware Recall(FAR),一个从未来感知预测监督中学习情景记忆召回的框架,通过负扩散预测损失近似条件对数似然来衡量记忆的预测效用,并训练一个推理时对未来盲的检索器。该检索器能学习各线索的相关性,自动决定每个查询该信任时间、姿态、视觉、音频中的哪些线索。在三种互补设置下,FAR 即使使用相同检索线索也优于手工设计的召回方法。

9月27日周日
  1. Hugging Face Daily Papers42

    DataMagic:通过声明式多智能体编排创作数据视频

    DataMagic 提出一种从原始表格数据自动生成数据视频的声明式多智能体编排方法。其 DVSpec 规范统一图表、旁白与动画并保证数据溯源,配合“先生成后编排”策略优化叙事连贯性。在 109 个真实样本上,DataMagic 将质量分数从 GPT-5 的 2.13/5 提升至 3.89(+83%),执行成功率超 95%,并将创作耗时降低 79.7%。

9月26日周六
  1. Hugging Face Daily Papers40

    BiasReducer:面向奖励模型的自适应偏见缓解框架

    BiasReducer 通过只编辑奖励模型的线性奖励头,自动识别并削弱模型对长度、自信度等表层属性的依赖,无需重新训练。在五个奖励模型上,BiasReducer-M 将三项基准平均提升 8.3、18.0 和 6.9 个百分点,优于两个基于训练的基线。该增益可迁移至下游,减少冗余冗长与谄媚,同时保持相当的评判质量。

  2. Hugging Face Daily Papers34

    用 Jev 决策模型替代大语言模型,实现低延迟边缘服务编排

    研究将 Jev 的决策导向 API 集成到边缘服务编排中,在 8,280 条请求和 33 种测试条件下,其决策延迟中位数比最快的 LLM 降低 22.7-64.5%,且几乎不随输入规模变化。四字段合约下,Jev 每次正确决策的 API 费用低 59.7-80.9%,代价是少量精确匹配分数。在实时准入路径上,LLM 低于 0.1 的负载下 Jev 仍能保持 0.91-0.95 的请求精确且准时。

  3. Hugging Face Daily Papers38

    PluginRSI:用可复用插件递归改进 Agent Harness

    PluginRSI 将 Agent harness 拆解为原子化插件组合,各插件独立改进并汇入共享插件库,每轮迭代再重组为新 harness。该方法在软件工程、命令行交互和问答任务上均优于现有 harness 优化方法,且迁移到其他 solver 模型后仍保持优势。演化出的插件库还能加速后续优化,在未见任务上收敛更快、更高。

  4. Hugging Face Daily Papers43

    CUA-SWE:当 Computer-Use Agent 遇上可视化软件工程

    研究者推出 CUA-SWE,一个面向"计算机使用+软件工程"的 benchmark、环境与评测流水线,覆盖四个软件工程领域,要求智能体在同一任务内改代码与配置、执行命令、操作运行中的软件并查看视觉反馈。每个任务配有确定性的专属测试,用于验证软件是否满足需求并保持既定行为。该工作评测前沿智能体如何结合源码级执行与应用截图、图形交互,产出经过验证的软件改动。

9月25日周五
  1. Hugging Face Daily Papers40

    DMM:通过迭代意图去噪实现多智能体路径规划的联合动作优化

    DMM(Decentralized Master-Mind)提出用离散的迭代意图精炼替代一次性动作采样,解决多智能体路径规划中局部有效动作重组为不兼容联合动作的问题。该方法受扩散模型去噪启发,通过通信轮次耦合智能体选择,并用模仿学习预训练、MICPO 强化学习优化。在 1,600 个 MovingAI 任务上,DMM 经 MICPO 微调后解决 1,598 个,覆盖率最高,且可扩展至超百万智能体。

  2. Hugging Face Daily Papers35

    RWTD:用奖励加权传输蒸馏对齐一步生成模型

    研究提出奖励加权传输蒸馏(RWTD),一种仅需生成样本和标量奖励评估的一步生成模型后训练方法,通过混合当前与参考分布的自适应目标,经特征空间最优传输与不动点回归实现。该方法将一步 SANA Sprint 1.6B 的 GenEval 分数从 0.73 提升至 0.80,偏好对齐实验显示其具备跨奖励泛化能力,能兼顾改进与组合能力保留。

9月24日周四
  1. Hugging Face Daily Papers41

    基于检索的开放式评估在哪里失败?从长篇医学答案事实性验证自动归纳分类体系

    研究针对基于检索的医学事实性评估,基于 MedExpert 开放式数据集和 3 个封闭式数据集构建了两套分类体系,将失败拆解为检索阶段五个质量维度的错误与验证器推理的六个连续步骤。团队用 LLM-as-Judge 自动归纳模式,在 4 种检索方法和 6 个前沿验证模型上压力测试,发现扩大模型规模、增加推理投入、扩展权威网络来源和医学微调均无法消除这些失败模式。

9月23日周三
  1. Hugging Face Daily Papers41

    NowWAM:用去噪替代未来预测的机器人控制生成式适配

    研究提出 NowWAM,一种无需未来目标的协同训练方法,直接对当前观测去噪并从同一视觉流预测机器人动作,将生成式目标与动作表征耦合。在 LIBERO-Plus 上,NowWAM 搭配 FLUX2-Klein 达到 87.7%,较未来目标协同训练基线提升 6.1 分,训练视觉 token 从 784 减至 392,单步时间从 2.85 s 降至 1.63 s,提速 1.8 倍。

9月22日周二
  1. Hugging Face Daily Papers40

    OSWorld-Pro:面向计算机使用智能体的过程式评测基准

    OSWorld-Pro 是一个面向计算机使用智能体(CUA)的过程式评测基准,包含 300 多个任务、2800 多个子目标,基于 67000 多条人工标注,用人类对齐的 LLM-Judge 评估子目标完成情况。该基准对 SOTA 模型仍有挑战,Claude Opus 5 仅得 75.7%,低于其在 OSWorld 上的 83.4%。研究还识别出子目标无关操作、点击类错误等过程性失败模式。

9月16日周三
  1. Hugging Face Daily Papers42

    让 LLM 在 RL 中学会永不放弃:Never Give Up 自适应采样方法

    研究提出 Never Give Up(NGU)自适应采样方法,通过异步 RL 持续为同一问题生成样本直到答对,将算力从简单题重新分配给难题。作者称 RL 对 LLM 存在"马太效应":简单题提升大、难题提升小。在数学基准 Deepscaler 上 NGU 提升了单位算力性能,在编程任务 Manufactoria 上,标准 GRPO 无法完全解题,NGU 则迭代攻克越来越难的测试直至完全解决。

9月15日周二
  1. Hugging Face Daily Papers49

    推理模型缺乏系统性?在规则归纳任务上评估推理模型

    一项研究将认知科学中的规则归纳任务扩展到推理模型,通过重组、替换等任务同构方式构造结构等价的变体,发现模型虽能正确解出某个任务,却常在结构等价的变体上失败。这表明许多模型行为缺乏系统性,难以在其被评估的特定语境之外稳健地确立推理模型的认知能力。

  2. Hugging Face Daily Papers48

    ModaLens:测量报告条件下的医学 VLM 图像敏感性

    ModaLens 是一种配对图像替换审计方法,用于测量报告可用性如何改变医学视觉语言模型的图像敏感性。在 MedGemma-27B 上对 3,199 个 MIMIC-CXR 配对病例测试,有报告时答案变化率为 4.26%,无报告时为 20.94%,配对增加 16.7 个百分点(95% CI 15.6-17.7),表明报告可用性降低了图像替换敏感性。

  3. Hugging Face Daily Papers36

    MInTRL:离线策略干预如何提升在线策略强化学习

    研究者提出 Minimal Intervention Reinforcement Learning(MInTRL),通过在在线策略 rollout 中周期性插入稀疏局部修正来扩展探索边界,训练时采用序列级优势回归目标,无需重要性采样。在数学与代码基准上,MInTRL 持续优于标准在线策略与离线策略基线;消融显示自干预和不同 judge 策略下仍有效,且性能在中等干预强度时达到峰值。

  4. Hugging Face Daily Papers45

    AlayaVista:从全景状态到透视视频的流式世界建模

    AlayaVista 是一个相机可控的流式视频世界模型,将全景世界演化与透视观测合成解耦:给定单张透视图像,先用预训练全景扩展模型构建 360 度场景先验,再以相机条件化的全景 latent 状态演化场景,由 latent viewport renderer 映射为透视视频 latent,透视 refiner 负责恢复细节、抑制伪影并做超分。