跳到正文

Hugging Face Daily Papers

huggingface.co · 开发者平台

当前显示全部 AI 相关新闻
切换来源
814 条AI 相关新闻 · 最新在前
9月8日周二
  1. Hugging Face Daily Papers34

    KnowChange:面向遥感变化检测的知识引导变化数据合成框架

    研究者提出知识引导的变化数据合成框架 KnowChange,利用预训练视觉语言模型作为知识源,从变化前场景和指定变化类型推理合理的变化位置与类别转换。该框架将知识引导的变化模拟与可泛化合成模型结合,可在统一框架内灵活合成多种变化类型。实验显示,KnowChange 生成的数据在合成到真实迁移和合成数据增强上均持续优于现有合成数据集,且生成规模更紧凑。

  2. Hugging Face Daily Papers38

    FactoSR:用分解式强化学习提升 VLM 空间推理能力

    FactoSR 是一个分解式强化学习框架,将世界一致性推理拆解为平面对应(XY)、深度一致性(Z)和时间可逆性(T)三个几何子目标,把不适定的投影恢复问题转化为可验证的推理步骤。在多视角与视频基准上,该方法在 VSI-Bench 提升 5.9%、All-Angles-Bench 提升 4.5%,论文已被 ECCV 2026 接收。

  3. Hugging Face Daily Papers43

    2026 PNPL 竞赛:LibriBrain100 上的词语分类与高效跨被试泛化

    2026 PNPL 竞赛基于扩展数据集 LibriBrain100 展开,新增 32 名被试(每人约 40 分钟数据)并将单被试数据扩至约 80 小时,任务升级为词语分类。竞赛设 Deep 与 Broad 两条赛道:前者追求单被试词语分类的最优性能,后者聚焦跨被试泛化,将受试者特定微调数据从约 40 分钟逐步压缩至约 20、10 分钟。

  4. Hugging Face Daily Papers45

    拒绝而不带拒绝语:通过结构分析安全微调响应以减少语言模型误拒

    研究将安全微调数据集中的响应拆分为模板化拒绝语句和解释拒绝理由两部分,发现拒绝语句会诱导模型依赖表面线索,从而妨碍其准确区分有害与良性查询。仅用理由部分训练可在保持相当安全性能的同时减少误拒,该效果在 ICL 配置下同样成立,并与所评估的推理时缓解方法兼容。

9月7日周一
  1. Hugging Face Daily Papers44

    EditVid:一个无需训练的统一视频编辑框架,兼顾指令引导与主体引导编辑

    EditVid 是一个无需训练的统一视频编辑框架,结合稀疏因果记忆、基于对应关系的后注意力 token 注入和软潜变量混合,同时支持指令引导与参考引导编辑。在 FiVE 上,EditVid 取得 78.16 FiVE-Acc,而最强的无需训练基线为 58.95,并在 IVEBench 上取得有竞争力的结果。用户研究显示,相较 7 种对比方法,EditVid 总体偏好度为 51.8%。

  2. Hugging Face Daily Papers47

    LLM 思维链的机制解析:推理操作在隐藏表示中的几何结构

    研究揭示大语言模型的推理操作在隐藏表示中具有可分离的几何结构,且这种可分离性在中间层达到峰值。该结构无法用词汇或位置混淆因素解释,token 级操作对齐随层数增加而更分散,相同表层 token 因周围操作不同而表示各异。注意力掩蔽实验表明,chunk 起始处的操作对齐表示依赖前序推理上下文。

  3. Hugging Face Daily Papers36

    音视频扩散模型中的“注意力三角”:跨模态语义泄漏的机制分析与推理时干预

    研究分析了音视频扩散模型中连接文本、音频、视频三条跨模态注意力边构成的“注意力三角”,发现音频-视频边是双向的,且受模型参数中的偏见影响,成为语义泄漏的主要来源:当提示词与模型先验冲突时,跨模态交互会覆盖预期条件,将语义导向视觉上常见但错误的结果。研究者据此提取注意力信号作为诊断工具,并用于引导推理时干预,在保持生成质量的同时改善了语义 grounding。

  4. Hugging Face Daily Papers32

    HoloWorld:统一室内外城市世界生成框架

    HoloWorld 是首个在连贯 3D 城市世界中统一室内外生成的框架,基于持续更新的跨尺度世界上下文,从城市级规划到单体建筑逐步表示和更新世界信息,使生成的室内空间与对应建筑外观保持明确对应。其城市外观生成的平均 AQS 分数较 SOTA 提升 7.68%,并获得最高平均 RDR 分数,同时保持建筑级室内外对应与跨街区连续性。

  5. Hugging Face Daily Papers54

    τ^τ-Bench:面向端到端真实智能体构建的评测环境

    研究者提出 τ^τ-Bench(读作 hyper-tau-bench),把构建 LLM 智能体本身当作任务:开发智能体拿到企业真实记录、持有需求的客户、必须走通的生产 API、待继承的代码库以及服务成本与模型限制,需据此交付完整的客服智能体,并通过将该智能体部署到留出的模拟用户上来评分。

  6. Hugging Face Daily Papers43

    ShallowStream:用浅层索引与深层回答实现流式视频理解

    ShallowStream 是一个面向流式视频理解的新框架,利用 MLLM 浅层同时完成帧编码与检索索引构建,查询时再基于浅层注意力分数和多样性感知策略选取上下文帧作答。它在性能持平最强流式方法的同时,将单帧 prefill 延迟和 10 秒端到端延迟分别最多降低 52.1x 和 11.9x,代码已开源。

  7. Hugging Face Daily Papers34

    AdaptVPR:面向鲁棒视觉位置识别的路线感知难正样本生成框架

    针对光照、天气、季节变化和动态遮挡导致的域偏移问题,AdaptVPR 提出路线感知生成式增强框架,用视觉语言模型解析场景属性并评估可编辑性,通过全局外观、局部遮挡和双路线三种路径生成同地点难正样本。该框架构建了含 160K 条经验证合成样本的 AdaptCities 数据集,在多个 VPR 基线和视觉基础骨干上取得一致提升,挑战性域偏移下 R@1 最高提升 9.2%。源码与数据资源已公开。

  8. Hugging Face Daily Papers41

    OR-Clarify:让 LLM 在建模前先问清楚——交互式优化的动态预表述澄清基准

    研究者提出 OR-Clarify 基准和 InterOPT 两阶段框架,用于评估和提升 LLM 在运筹优化建模前的澄清能力。OR-Clarify 通过部分公开的问题描述与隐藏槽位,在有限交互中衡量槽位恢复、停止行为、静默假设和交互成本;InterOPT 先识别影响建模的关键缺口,再决定是否继续提问或停止。

  9. Hugging Face Daily Papers39

    量化如何破坏循环网络记忆:低精度时序推理中的循环状态写回

    研究提出"循环状态写回"概念,在荧光寿命成像的 GRU 编码器-解码器上,将连续状态传播替换为确定性 4-bit 状态存储后,τ1 和 τ2 的估计误差分别增大约 70 倍和 300 倍。误差反馈、残差记忆和方向记忆可在不重新训练的情况下恢复精度;在独立训练的 LSTM 上,粗粒度写回复现了相同失败,且 cell state 比 hidden state 更敏感。

  10. Hugging Face Daily Papers37

    RISE:通过自外推策略蒸馏实现递归自我改进

    RISE 提出一种无需外部教师模型的策略蒸馏方法,通过从模型自身 RLVR 训练轨迹中构造合成教师,将稀疏的结果奖励参数更新转化为密集的 token 级监督目标。该方法在数学推理、多领域 STEM、代码生成和多轮智能体任务中均优于纯 RLVR 训练和在线自蒸馏。由于教师模型随学生模型每轮迭代更新,蒸馏成为递归改进机制而非一次性压缩步骤。

  11. Hugging Face Daily Papers48

    MaxKernel:面向 TPU 的智能体化内核生成系统

    MaxKernel 是一个面向 TPU 内核开发的多智能体系统,提供 Human-in-the-Loop、全自动 Auto 以及基于图的自主搜索三种范式,共享规划、实现、自调试、测试与硬件剖析等子智能体。该系统在包含 50 项内核任务的 JaxBench 及多个开源模型真实负载上评测,生成的实现可匹配专家手工调优基线。MaxKernel 已开源。

9月5日周六
  1. Hugging Face Daily Papers45

    RoboTok:面向人类演示检索与灵巧操作学习的互联网级数据引擎

    RoboTok 是一个可扩展数据引擎,用查询人类操作视频从互联网视频中检索与操作相关的演示,用于训练灵巧机器人策略。它从 3D 手部轨迹学习潜在运动空间,可跨视角、场景外观和遮挡变化比较操作行为,并支持高效索引检索。真实机器人实验中,RoboTok 引导的策略相较最强基线平均成功率提升 42.2 个百分点。

  2. Hugging Face Daily Papers55

    论文定位 RLVR 解空间收窄位置:损失集中在推理入口

    一篇论文定位了 RLVR 收窄解空间的位置,在对 Qwen2.5-3B 的 PPO 与 GRPO 训练中,解法覆盖率最多下降 67%。研究发现收缩集中在推理轨迹入口,首个算术操作前的每 token 似然偏移是后续推理的 11 到 16 倍,仅提供未被选中的入口前缀就能把低覆盖家族的完成率从 0.018 提升到 0.212。

  3. Hugging Face Daily Papers43

    DRACO:用动态评分标准为长时程智能体训练做细粒度信用分配

    DRACO 提出一种基于动态评分标准(rubric)的信用分配方法,用于无真值成功信号的长时程智能体训练:训练中动态生成 rubric 以跟踪策略能力变化,每条完整轨迹评分一次,再将判断以闭式解重新分配到各步骤,在 GRPO 中产生差异化的逐步优势,且不引入额外训练归因模块。

  4. Hugging Face Daily Papers43

    Last Translation Benchmark:用人工校验规则击破领先机器翻译模型

    研究者推出 Last Translation Benchmark(LTB),收录经人工撰写与同行评审的文本、图像、音频、视频样本,专门用于击破领先机器翻译模型。每个样本附带手工编写的校验规则,描述该样本上的具体失败情形,从而支持可靠且可操作的评估。该基准为持续接收投稿的实时数据集,最新版本 LTBv1 收录 2026 年 9 月 1 日前接受的贡献。

9月4日周五
  1. Hugging Face Daily Papers34

    QCell:重组与对齐细胞查询的重叠实例分割模型

    QCell 是一种基于查询的显微镜重叠细胞实例分割模型,通过实例重组模块在潜空间分解并重组查询表示,并用对比查询对齐目标分离重叠细胞查询。在 ISBI2014 上,QCell 比 SOTA 方法提升 +2.2 AP 和 +2.7 AJI,同时提出新的 Organoid 重叠细胞分割基准。该工作已被 BMVC 2026 接收,代码、模型与数据集均已公开。