跳到正文

Hugging Face Daily Papers

huggingface.co · 开发者平台

当前显示全部 AI 相关新闻
切换来源
739 条AI 相关新闻 · 最新在前
8月17日周一
  1. Hugging Face Daily Papers40

    UniProbe:用多结构内部表征的可学习 Token 级大视觉语言模型幻觉检测器

    UniProbe 是一款轻量可学习的 Token 级幻觉检测器,对冻结的 LVLM 单次前向传播的计算轨迹建模,通过 GNN、ViT、GRU 交替处理图像 patch、查询 token 与生成 token 构成的注意力有向图。它在多种 LVLM 骨干上取得 SOTA 的 Token 级与物体幻觉检测效果,解码时可将物体幻觉降低最多 55%,延迟仅为标准生成的 1.06 倍。

  2. Hugging Face Daily Papers33

    PRM-as-a-Judge 1.5:机器人过程评估工具包发布

    PRM-as-a-Judge 1.5 发布,这是一个将机器人 rollout 视频转化为密集进度曲线并派生多项细粒度指标的机器人过程评估工具包。它在 1.0 版本基础上新增三项指标,分别刻画失败侧进度、回撤后恢复与成功侧执行质量,并推出 RoboPulse++ 用于评估过程奖励模型(PRM)的可靠性。团队同时开源了包含 benchmark、指标实现与可视化工具的评估套件,支持可复现的操控过程评估。

  3. Hugging Face Daily Papers42

    时间序列基础模型中的预测坍缩现象与 CalibRank 解法

    在预测 1000 只美股小时级收益时,时间序列基础模型(TSFM)出现预测近乎平坦、横截面相关性差的"预测坍缩"现象,而同一设定下预测成交量时该现象基本消失。研究覆盖 TSFM、12 个深度学习预测模型和 97 个公开基准配置,发现其与目标可预测性密切相关,并揭示校准与排序之间的权衡:优化平方误差导致预测平坦,直接优化横截面相关性可提升排序但会使预测幅度膨胀逾一个数量级。

  4. Hugging Face Daily Papers35

    LLM 预训练中的领域数据重复扩展研究

    研究发现,在固定 tokens-per-parameter(TPP)比例下,领域数据的最优重复次数随模型规模增大而轻微上升;不同领域中,最优重复次数与该领域最终验证损失呈强负相关,验证损失越低的领域越能从更多重复中获益,而唯一领域数据量与最优重复次数的关系较弱。这表明用相同 TPP 的小型代理模型调出的重复次数,可为更大模型提供实用估计。

  5. Hugging Face Daily Papers43

    Dion3:全栈正交更新优化器,将 Muon 步时最高降低 6 倍

    Dion3 是 Muon 优化器的改进版本,通过 Gram Newton-Schulz 算法、CuteDSL 内核和 megabatching 策略,在保持或改善 Muon 损失表现的同时将优化器步时最高降低 6 倍。该版本还修改了更新规则,每步仅对动量矩阵的部分行做正交化,速度和性能均优于此前的压缩版 Dion。Dion3 已通过 dion 包发布,可作为 Muon 的直接替代品使用。

  6. Hugging Face Daily Papers30

    SPARGen:用原生多模态生成统一空间感知与推理

    SPARGen 是一个统一多模态框架,将 3D 重建、稠密对应和空间推理统一建模为指令条件下的生成任务,通过将结构化与语言输出序列化为 token 序列、并以图像对齐形式生成稠密几何场,让空间监督共同塑造原生多模态生成模型内的共享表示。在 3D 重建、对应和空间推理的多项基准上,SPARGen 在单一原生多模态生成框架内对异构空间任务取得了有竞争力的表现。

  7. Hugging Face Daily Papers44

    可验证奖励强化学习中的验证器诱导支持重塑

    研究发现,带可验证奖励的在线策略强化学习(RLVR)会在提升当前目标的同时,让后续目标所需的成功行为变得难以采样。在 Qwen3-8B-Base 的 IFEval 上,pass@1 上升 6.5 个百分点,而 best@32 下降 9.8 个百分点,且该分化在两个模型家族和多个 IF 基准上均出现。这类变化集中在回答最前面的几个 token,RLVR 主要是在重排基座策略已有的开头方式。

  8. Hugging Face Daily Papers43

    HumanTracker:面向全面且人类对齐的人形动作追踪基准

    HumanTracker 是一个面向人形动作追踪的评测基准,包含约 153 小时、由多位专业表演者采集的光学动作轨迹,按四类动作家族组织并配有文本标签用于细粒度诊断。团队同时提出偏好对齐指标 HumanScore,基于 12K 动作对(含 24K 段动作)训练,能比运动学指标更好地预测人类偏好,并暴露脚滑、触地时机错误等接触与稳定性问题。该工作已被 ECCV 2026 接收。

  9. Hugging Face Daily Papers40

    MobileMem:从一年移动端体验中学习长期记忆

    研究者推出 MobileMem,一个面向端侧长期记忆的基准与框架,基于一年期移动端体验数据构建。它通过知识驱动的合成流程,从用户-App 会话中生成连贯且时间一致的长期轨迹,提供文本与多模态两种设置,覆盖多跳与时序推理、知识更新和隐式偏好推断。MobileMem 让智能体记住过去、理解当下并适应未来,将记忆从信息检索推进到体验智能。