跳到正文

Hugging Face Daily Papers

huggingface.co · 开发者平台

当前显示全部 AI 相关新闻
切换来源
766 条AI 相关新闻 · 最新在前
8月24日周一
  1. Hugging Face Daily Papers37

    InfinityEdit:用轻量级编辑点火适配器实现无限视频编辑

    InfinityEdit 是一种轻量级编辑适配器,让流式视频生成器具备无限视频编辑能力:给定前序片段和编辑指令,模型生成延续该流并应用编辑的下一片段。适配器包含历史交叉注意力、时序因果自注意力和编辑交叉注意力三个模块,推理时仅在编辑请求到达的 chunk 激活,后续 chunk 由原模型以重置锚帧生成。实验显示其能在无界编辑序列下忠实延续视频流并保持稳定。

8月22日周六
  1. Hugging Face Daily Papers44

    τ_0-VLA:世界模型引导测试时计算的分层机器人基础模型

    分层机器人基础模型 τ_0-VLA 将高层子任务生成建模为可扩展计算的推理问题,通过世界模型引导的测试时计算,在每步推理中借助执行记忆生成子任务,必要时搜索备选方案后再输出。该模型基于 40,115 小时异构真实世界数据和多模态协同训练,在域内与分布偏移场景下增加测试时计算均显著提升下一子任务预测准确率,并转化为长程机器人操作任务更高的闭环成功率。

8月21日周五
  1. Hugging Face Daily Papers43

    GOAG:面向灵巧机器人操作的生成式物体无关抓取规划器

    研究人员提出 GOAG,一种学习特定夹爪接触面分布隐表示的深度生成模型,无需物体专属训练数据即可采样有效抓取配置,仅在推理时引入物体特征。在 MultiDex 数据集上,该方法平均成功率达 86.93%,生成大量抓取时速度显著更快,性能与专门针对该数据集训练的领先方法相当。

  2. Hugging Face Daily Papers35

    CoToGrasp:基于规范工作空间的接触拓扑条件灵巧抓取合成

    CoToGrasp 是一种严格以特定接触拓扑为条件生成多样稳定抓取的生成式框架,采用与物体无关的训练方式,通过基于特征的规范工作空间将局部物体特征投影到统一的以夹爪为中心的域中,实现对未见物体的零样本泛化。在 DexGraspNet 数据集上,CoToGrasp 取得 SOTA 性能,超越现有分类法引导的规划器,并在实体机器人平台上验证了所合成接触拓扑的物理可行性与运动学可行性。

  3. Hugging Face Daily Papers40

    NARU:面向日语超长视频叙事演变与文化细微理解的新基准

    研究者推出 NARU 基准,用于评估日语长视频中的叙事演变与文化理解推理,包含 1,481 道问题、155 个视频共 146.8 小时,覆盖四个叙事与五个文化维度。该基准通过分层记忆标注流程构建,并经 68 名母语者两阶段验证。对八种模型配置的评测显示,模型在长程叙事整合与文化根基推理上均存在明显不足。

  4. Hugging Face Daily Papers46

    如何量化 ASR 模型的基准优化行为

    研究提出一套量化 ASR 模型基准优化的方法,聚焦音频无法确定参考转写文本的情形,通过参考分歧、掩码数字恢复和拼写切换三类行为探针发现,得分最高的开源模型在音频矛盾、被掩码或含糊时仍逐字输出基准参考文本片段。机制探针显示模型会依据狭窄声学线索覆盖对音频的忠实表征,转而采用基准优化策略,且该行为可通过低秩线性引导或简单在片段末尾追加音频被因果操控。

  5. Hugging Face Daily Papers43

    Chain-of-Experience:让 LLM 在推理时持续自我改进

    研究提出 Chain-of-Experience(CoE),让 LLM 在测试时通过自我反馈或环境信号(如正确性、公开代码测试通过率)迭代积累经验,形成持续改进循环。在数学、编程和知识任务上测试 8 个 LLM(含 GPT-5、Gemini-2.5 Pro、Claude-4.5 Sonnet),整体提升 5.6%,API 成本降低 19%,且每 token 准确率高于现有测试时策略。

  6. Hugging Face Daily Papers38

    SkillEvo:从多轮交互反馈中生成自更新进化梯度

    SkillEvo 提出用多轮用户模拟生成反馈梯度、并用独立治理层约束进化方向,解决现有 Agent Skills 进化在首轮修补后梯度衰减、多轮缺陷不可见而停滞的问题。在 6 类云服务、9 个生产 Skills 和 98 个 skill-reference 文件上,SkillEvo 比基于自我反思的进化高 23.0 分,比单轮 QA 驱动的进化高 15.4 分。

  7. Hugging Face Daily Papers34

    MuseCPEval:面向音乐编辑系统的音乐上下文保持评估框架

    研究者提出首个音乐上下文保持(MuseCP)评估框架 MuseCPEval,覆盖四类音乐属性并配有细粒度指标,用于衡量音乐编辑中本应保持不变的音乐特征。客观验证与人类研究证实了这些指标的有效性,对多种音乐编辑系统的案例研究显示其可作为测试平台与诊断工具。该工作已被 ISMIR 2026 接收。

  8. Hugging Face Daily Papers37

    RapidLiDAR:面向实时自适应的 LiDAR 场景补全

    RapidLiDAR 将 LiDAR 场景补全的初始化本身变为可学习的数据驱动模块,通过自适应初始化预测每个输入点的空间变化位移,无需手动调噪声。该方法在 SemanticKITTI 和 KITTI-360 上达到与 SOTA 相当的补全性能,0.1 秒完成整场景,比此前最快方法快 2.3 倍,匹配车载 LiDAR 10 Hz 采集率。论文已被 ECCVW 2026 接收,代码已开源。

  9. Hugging Face Daily Papers32

    HOTFIXR:用定向合成多语言数据提升 LLM 跨语言推理能力

    研究团队提出数据生成框架 HOTFIXR,通过探测学生模型的多语言薄弱点并生成定向合成训练数据来缓解语言特定能力差异。在三个分布内任务、三个分布外任务和四种分布外语言上,HOTFIXR 平均将分布内性能提升 6.2%,并将微调导致的分布外任务灾难性遗忘降低 3.7%、分布外语言性能降低 7.1%。代码将在论文被接收后发布。

8月20日周四
  1. Hugging Face Daily Papers45

    SkillGate:在长程智能体中训练策略内技能选择

    SkillGate 通过将 token 支持划分为两条互不重叠的信用通道——结果信用只到达执行 token,动作局部优势只到达技能命名 token——解决了长程智能体技能选择中的"选择器信用饥饿"问题。在 16 个候选技能的设定下,五个智能体基准测试中,SkillGate 将 9B 策略的试验成功率从 40.8% 提升至 53.2%,同时将误导性候选的暴露减少三分之二,并读取更少的技能。

  2. Hugging Face Daily Papers37

    AdaPop:面向 LLM 遗忘的自适应流行度方法

    AdaPop 是一种按事实流行度自适应调整梯度压力的 LLM 遗忘方法,结合局部 token 置信度与来自 Wikidata sitelinks、LLM-as-Judge 等外部代理的流行度指数,并用双上升控制器逐 epoch 自动调节保留惩罚。在三个模型家族和两个基准上,AdaPop 在改写查询下泄漏的遗忘内容比对比方法少约 5 倍,在对抗性改写下少约 1.6 倍。