跳到正文

Hugging Face Daily Papers

huggingface.co · 开发者平台

当前显示全部 AI 相关新闻
切换来源
814 条AI 相关新闻 · 最新在前
9月14日周一
  1. Hugging Face Daily Papers31

    有限反馈下基于 LLM 专家的在线学习

    研究在反馈预算有限(m ≪ T)的在线场景下,将提示词自适应路由到多个 LLM 专家以最大化回答质量,并建模为含 K 个专家动作、d 维提示词特征的 bandit 问题。所提算法在全信息设定下达到 Õ(dT/√m) 的 regret,在 bandit 设定下达到 Õ(dT√(K/m))。实验表明其能从有限反馈中高效学到跨多种 LLM 的高质量路由策略。

  2. Hugging Face Daily Papers49

    Benchmark Radar:面向 AI 基准与评测的活数据库与搜索引擎

    Benchmark Radar 是一个面向 AI 基准与评测的活数据库与搜索引擎,覆盖 LLM 评测、智能体与工具使用、编码、推理、安全及领域评测。系统每日从 37 个来源发现基准论文、仓库、数据集与发布,目录含 1,283 条来源记录和 12,916 条数值观测,并保留来源身份与引用。已发布网页仪表盘、基准排行榜、Pareto 前沿视图、饱和与趋势视图、每日订阅、可下载证据及离线查询 CLI。

  3. Hugging Face Daily Papers38

    COBRA-Skills:用上下文赌博机引导智能体技能进化

    COBRA-Skills 将 LLM 智能体技能优化建模为动态候选空间上的预算化序列优化,通过上下文赌博机引导的优先级排序与基于证据的技能进化,把评估资源集中到更有潜力的候选上。在六个异构智能体基准和三个目标模型上,该方法平均性能最强,相比 SkillOpt 降低 55–58% 优化成本,每个基准仅用 50 个优化样本。

  4. Hugging Face Daily Papers42

    PLC-DPO:在噪声与模糊偏好优化中的后验标签校正

    针对 DPO 假设所有偏好标签可靠的问题,研究者提出 PLC-DPO,利用校准后的策略-参考模型 margin 作为在线证据,将每对样本的训练信号分流为干净、翻转或平局三类,主动校正监督方向与强度。在 57 个数据集-模型-基准组合中,PLC-DPO 对 DPO 的平均胜率达 60.5,优于次优方法的 55.5。该工作为 EMNLP 2026 Findings,代码已开源。

  5. Hugging Face Daily Papers39

    SNAP3D:从单张图像生成可用于装配的物理合理 3D 部件

    SNAP3D 提出一种物理引导框架,从单张图像生成部件级 3D 资产,解决相邻部件相互穿透、连接无效或受重力坍塌的问题。该方法消除部件间穿透、恢复接触图,并在接触面引入参数化连接件,借助物理仿真反馈优化其位置、朝向与尺寸以提升装配稳定性。实验显示其物理可实现性与稳定性显著优于多个部件级 3D 生成器,并已通过 3D 打印和真实装配验证。

9月12日周六
  1. Hugging Face Daily Papers36

    多语言实体链接新框架:先推理再检索,稀有实体准确率最高提升 23.3%

    研究者提出一种免训练框架,让具备推理能力的视觉语言模型迭代搜索并推理 Wikipedia,以解决多模态实体链接在稀有实体上的性能退化问题。在覆盖 Hindi、Indonesian、Japanese、Tamil、Vietnamese 五种语言的 MERLIN 基准上,最佳系统整体超越 SOTA 6.9%,稀有实体切片最高提升 23.3%。

9月11日周五
  1. Hugging Face Daily Papers35

    ActReview:用作者反驳引导训练数据与评分标准,生成可执行的同行评审意见

    研究提出 ActReview,一个以作者反驳为引导的后训练框架,将可执行同行评审生成拆解为诊断性论断生成与修改建议生成两个子任务。团队从 OpenReview 真实评审-反驳对话构建 ActReview-40K,对 Qwen3-8B-Base 先做多任务监督微调再用 GRPO 配合候选感知、弱点专属的评分奖励训练,并发布含 1,000 条实例的 ActReview-Bench。

  2. Hugging Face Daily Papers38

    Negative Self-Distillation:让 LLM 通过避开缺陷来学习推理

    针对 On-Policy Self-Distillation(OPSD)在复杂推理任务上会抑制模型不确定性表达、惩罚探索与自我纠错行为的问题,研究者提出 Negative Self-Distillation(NSD)框架,让模型自行生成问题特定的负面条件(如扮演"粗心推理者"),并将学生分布推离这一自生成负面教师,而非模仿特权解答。

  3. Hugging Face Daily Papers32

    Mi-Ripple:修复迭代 AI 编辑导致的图像退化

    Mi-Ripple 是一种诊断引导的修复流程,用于抑制迭代参考条件图像编辑产生的网格状与颗粒状"数字波纹"纹理,同时保护图像结构。它先分离周期性晶格伪影与内容纠缠的颗粒纹理,再结合选择性频谱陷波、结构感知平滑和干净参考再生。在 14 次仅陷波执行中,全图残差标准差为 0.08–0.44 CIELAB 亮度单位;配对再生示例中参考清洗使输出碎片密度降低 45%。

  4. Hugging Face Daily Papers29

    DRG-MAPPO:面向协同空战的分层动态角色图多智能体强化学习框架

    DRG-MAPPO 是一个融合图关系建模与动态角色分配的多智能体强化学习框架,用于协同空战。它通过图注意力机制提取友军、敌军与威胁间的关系特征,由高层策略动态分配"leader""supporter"等战术角色,低层策略据此执行机动动作,并设计目标优先级辅助任务促进集火行为。实验显示其胜率达 87%,达到 SOTA 水平。

  5. Hugging Face Daily Papers46

    TempCloze:Video-LLM 能否识别缺失的中间片段?

    研究团队推出 TempCloze,一个视频完形填空基准,要求 Video-LLM 根据视频开头和结尾片段从四个候选中找出真正缺失的中间内容。该基准包含来自七个来源的 1,521 个视频,并沿 Semantic、Alignment、Progression 三个维度构建同源干扰项。对 10 个闭源和 21 个开源 Video-LLM 的评测显示,时间对齐(Alignment)是主要瓶颈。

  6. Hugging Face Daily Papers35

    X-AuT:面向语音 LLM 的渐进式音频编码器压缩与跨尺度蒸馏

    X-AuT 通过短行为探针选择层组合,并用表征对齐、跨尺度蒸馏、学生策略监督和 LoRA 微调恢复剪枝模型,语言模型主干保持冻结。在十项中英公开基准上,Qwen3-ASR-0.6B 的音频编码器从 18 层压到 16 层,宏平均错误率由 5.61% 降至 5.27%;14 层模型为 5.75%,音频塔参数减少 20.7%。

  7. Hugging Face Daily Papers46

    World in World:用世界模型探索世界

    World in World 是一种免训练的推理时接口,可将源视频观测、目标视角投影、几何渲染和检索生成状态等异构控制证据转化为带相机与时间标签的干净视觉状态,并通过冻结因果视频模型的原生自注意力读取。它借助对应路由器和 Evidence-wise attention CFG(EWA),在同一个冻结骨干上支持相机控制重渲染、长时程回访和人体动作迁移。

  8. Hugging Face Daily Papers49

    SenseNova-U1.5:迈向原生统一视觉智能

    SenseNova-U1.5 发布,这是一个 8B-MoT 原生统一多模态模型,在无编码器、无 VAE 架构下实现视觉内容的理解、推理与生成。模型支持最高 4K 原生分辨率,并通过多专家 on-policy 蒸馏优化视觉美学、双语文字渲染、信息图生成与图像编辑等能力。官方将开源训练代码,涵盖监督微调、强化学习与 on-policy 蒸馏。