跳到正文

Hugging Face Daily Papers

huggingface.co · 开发者平台

当前显示全部 AI 相关新闻
切换来源
766 条AI 相关新闻 · 最新在前
9月30日周三
  1. Hugging Face Daily Papers32

    SpatialCORE:让大型视觉语言模型基于置信度进行空间推理

    SpatialCORE 是一个后训练框架,将模型对生成式 grounding 的自身置信度转化为空间推理的学习信号,通过自调节空间奖励按坐标 token 置信度加权每个预测边界框的匹配质量,并用答案门控将 grounding 优化与最终答案正确性绑定。该框架在多个基准上取得开源及专用空间推理模型中的 SOTA 结果,并可零样本迁移到未见数据分布,源代码已公开。

  2. Hugging Face Daily Papers36

    视频生成模型后训练与对齐综述:TMLR 2026 首篇系统梳理

    一篇发表于 TMLR 2026 的综述首次系统梳理视频生成模型的后训练与对齐,将后训练统一为一个框架,并按对齐信号的施加方式区分隐式对齐与显式对齐。方法被归为四类:监督微调、自训练与蒸馏、偏好与奖励方法、推理时方法。文章还梳理了常用数据集、benchmark 与评估实践,并讨论可扩展奖励设计、长时程时序一致性、稳定性与表现力权衡及安全生成等开放挑战。

  3. Hugging Face Daily Papers34

    MemLife:面向长期第一视角视频记忆的整理与推理系统

    MemLife 是一个多模态记忆系统,通过构建实体锚定的第一人称文本片段,并用时间索引的智能体读取器进行检索,在无需训练、查询时不访问原始视频的情况下,于四个长时程基准上比最强免训练基线提升 4.6–12.0%。配套的 MemOpt 强化学习框架优化记忆写入器,使 MemLife 再提升 2.7–5.0%,且增益可跨写入器与读取器骨干及不同记忆系统泛化。

  4. Hugging Face Daily Papers46

    合成预预训练在规模扩展下依然有效,但并非语法先验

    一项覆盖 500M 至 7B 参数、PT 预算最高 100B token 的研究显示,合成数据预预训练(PPT)的 token 效率增益在规模扩展后依然存在,3B 规模下可节省至少 21B PT token。但研究未发现一致证据表明这些增益来自语法先验,下游表现与语法可接受性在各模型规模上并不一致。增益实际来自提升长程检索能力的 PPT 任务,且对 PT 数据混合方式稳健,仅在缺少网页文本时减弱。

  5. Hugging Face Daily Papers41

    通过位置选择性自蒸馏从语言反馈中训练 LLM 评判模型

    研究提出位置选择性自蒸馏方法,利用自然语言反馈训练 LLM 评判模型。该方法基于教师与学生模型间的逐位置熵偏移进行位置掩码,保留熵偏移分布的低尾部分,从而提升分布外泛化能力。实验显示,自蒸馏评判模型在主观任务子类别上比 GRPO 等结果监督强化学习训练的评判模型高出 2-9 个百分点,在客观任务上保持竞争力。

  6. Hugging Face Daily Papers36

    DARA:面向多奖励强化学习的密度感知奖励聚合方法

    针对多奖励强化学习中各目标学习进度不均的问题,研究者提出密度感知奖励聚合方法 DARA,通过逆平方根密度校正,为激活频率较低的奖励信号赋予更高权重。在工具调用任务上,DARA 最多减少 26% 训练步数达到高格式合规率;在数学推理任务上,最多减少 65% 步数接近长度合规饱和,最终性能与 GDPO 相当。

  7. Hugging Face Daily Papers37

    FrameMorrow:用前瞻 token 做未来引导的帧选择,实现长时程视频生成

    FrameMorrow 提出一种前瞻式帧选择器,先预测一小组代表未来信息需求的前瞻 token,再用它们从历史中挑选相关帧,而非依据当前内容判断历史相关性。该方法选择显式历史帧而非模型内部状态,可即插即用地接入包括闭源模型在内的多种生成器,额外推理成本很低。团队在 5 个基准、11 个生成模型上评测,覆盖长视频生成、交互式生成与动作条件世界模型,长程一致性、视觉质量和动作对齐均有稳定提升。

  8. Hugging Face Daily Papers34

    FailBank:用运行时反馈自进化提升 VLA 模型安全性与成功率

    针对 VLA 模型中运行时安全屏蔽与策略不匹配的问题,研究者提出四阶段自进化框架 FailBank,将运行时反馈转化为持久的策略改进。在 VLA-Arena 基准的两个难度等级和两个 VLA 主干上,FailBank 将任务成功率分别提升 8.5 和 6.9 个百分点,策略引发的累计成本降低 35.6% 和 23.8%;相比运行时屏蔽,成功率提升 25.4 和 9.5 个百分点。

  9. Hugging Face Daily Papers55

    arXiv 论文:多智能体系统潜空间通信的安全风险与修复

    研究显示,多智能体系统的潜空间通信即使良性训练链接也会提高有害顺从度,而智能体本身的安全对齐未被改动。攻击者可通过在有害查询-响应对上优化链接、投毒训练数据或强化学习攻击放大该效应,在三种通信拓扑和四个安全基准上将平均有害顺从分从 27.9 提至 76.9;把奖励调整为更安全行为可修复被攻陷的链接,无需更新智能体。

  10. Hugging Face Daily Papers37

    AutoDataBench:面向加速自动研究的数据中心测试平台

    AutoDataBench 是一个隔离数据因素、系统评估 LLM「数据智能」的受控测试平台,覆盖数据诊断、组织与构建三类优化任务,在固定非数据因素下考察前沿 LLM 通过迭代实验改进训练数据的能力。研究还对比训练前预测与实际结果,检验 LLM 是否具备数据效应推理能力,并发现复用 AutoDataBench 轨迹进行 mid-training 可提升下游编码性能。

  11. Hugging Face Daily Papers33

    LexReward:面向法律语言模型的分类驱动奖励框架

    LexReward 是一个面向法律语言模型的分类驱动奖励框架,从 Style、Element、Chain 三个维度刻画法律回答质量,并为每个维度制定评分细则。基于该奖励构建的偏好数据用于 DPO 训练,在三个维度上均提升表现;训练出的奖励模型 LexRM 通过强化学习分别改善对应维度的策略表现,且奖励阶段无需参考答案。

9月29日周二
  1. Hugging Face Daily Papers44

    HelixWorld:实时交互式音视频世界模型

    HelixWorld 是实时交互式音视频世界模型,让视觉场景与基于相机的空间立体声在用户交互下原生协同演化。研究团队构建了含真实立体声与公制相机位姿的高保真空间音视频数据集,预训练 6-DoF 相机轨迹与用户动作条件下的双向教师模型,并通过在线轨迹蒸馏将其压缩为少步流式学生模型,在单 GPU 上以 24 FPS 实现无漂移的联合音视频推演。

  2. Hugging Face Daily Papers41

    Tacit-TTS:从自回归解码到掩码预测的高效无转写语音克隆

    Tacit-TTS 是一个从 IndexTTS2 蒸馏而来的无转写零样本语音克隆系统,用掩码非自回归生成替代自回归文本到语义解码,并引入免训练声学长度估计与 ReFlow 蒸馏加速流匹配渲染器。在四个中英文数据集上,其对超过 5 秒的语句生成速度比 IndexTTS2 快 10 倍以上,同时保持有竞争力的零样本质量。无转写条件还支持跨语言及非词汇参考,如其他八种语言、婴儿咿呀声和合成乱语。

  3. Hugging Face Daily Papers36

    FlexRouter:为灵活 LLM 路由学习互补模型集合

    FlexRouter 是一个显式建模模型互补性的 LLM 路由框架,以「答案覆盖」为目标,最大化所选模型中至少一个给出正确答案的概率。它用 Determinantal Point Processes(DPPs)建模路由策略,并通过基于失败集边缘化的训练目标直接优化覆盖,推理时采用边际对数行列式增益的贪心策略,无需预设预算即可自适应确定子集大小。

  4. Hugging Face Daily Papers36

    RASO:通过跨 Harness 适配的检索增强技能优化

    研究者提出检索增强技能优化框架 RASO,利用外部技能语料库作为先验知识,通过跨 Harness 适配解决领域与 Harness 不匹配问题。RASO 包含无需 agent rollout 即可构建初始技能的 RASI,以及依据执行反馈迭代优化技能的 RASU 两个阶段。在四个 agent benchmark 和两个模型上,RASO 持续优于无检索增强的基线方法。

  5. Hugging Face Daily Papers35

    音频-视觉大语言模型中的“问题接力”机制与 SECRET 去幻觉方法

    音频-视觉大语言模型(AVLLM)存在源混淆接地幻觉,即未使用模态的线索会诱发所需模态不支持的回答。路径干预与表征分析揭示“问题接力”机制是成因,据此提出的免训练方法 SECRET 通过对比不同模态路径干预诱发的问题表征,将问题状态引向所需源证据。