跳到正文

Hugging Face Daily Papers

huggingface.co · 开发者平台

当前显示全部 AI 相关新闻
切换来源
766 条AI 相关新闻 · 最新在前
8月20日周四
  1. Hugging Face Daily Papers41

    Zetta ζ:面向自进化物理智能的高效闭环具身执行框架

    Zetta 是一个闭环具身执行框架,通过三个时间尺度分离的循环在线进化基于代码的运行时 critic 与恢复技能,同时保持基础策略冻结。它在 LIBERO-Pro 和 RoboCasa 上分别达到 90.8% 和 93.6% 的成功率,推理提速 11.1 倍,并实现技能零样本迁移。配套的 Z-Infra 将智能体逻辑与异构执行资源解耦。

  2. Hugging Face Daily Papers33

    面向单步逆合成的化学合理性感知大语言模型 C3LM 训练

    研究者提出 Top-K prompting 训练与推理范式,并构建约 4560 万条已验证反应的 CREED-CCV-2+USPTO-XL 数据集,训练出化学约束一致性语言模型 C3LM。该模型结合微调与基于 ChemCensor 及新颖性导向的奖励,在 OOD URSA-expert-2026 基准上取得 SOTA。反应唯一性分析显示 LLM 与传统模型探索互补的反应空间,支持集成式逆合成系统。

  3. Hugging Face Daily Papers42

    语言模型血缘验证新方法:中心化残差签名(Centered Residual Signatures)

    研究者提出一种无需数据的白盒血缘验证方法,仅凭权重即可判断两个兼容模型检查点是否同源。该方法在 residual-MLP 和 GPT-2 基准上以 AUROC=1.0 区分微调、LoRA 合并、剪枝、量化后代与独立及蒸馏模型,在 GPT-2 上比最接近的鲁棒基线快 76 倍。案例研究正确识别出 3 个相关和 7 个无关的 LLaMA-2 公开检查点。

  4. Hugging Face Daily Papers37

    SemaPLC:面向 PLC 代码生成的项目级、验证门控智能体框架

    SemaPLC 是一个项目级、验证门控的智能体框架,只有在外部检查确认规格、编译与实时运行行为后才判定任务完成。在 117 个独立 POU 任务上,它在全部七个模型上取得最高严格验证通过率,平均 72.6%;在 65 个需在真实项目中编译运行的任务上,其动态行为得分 52.2,明显高于基线的 22.4 至 31.4。该框架已开源。

  5. Hugging Face Daily Papers45

    SPADE:在自适应合成可执行环境中的自博弈框架

    SPADE 是一个自博弈强化学习框架,让单个 LLM 同时扮演环境设计者和推理智能体,环境设计者以可执行代码形式编写带 reset()/step() 接口的长时程训练环境。扩展到 30B 参数模型时,SPADE 在八个数学、科学、代码与推理基准上平均超过最强固定环境基线 +5.3,BFCL-v4 多轮提升 +5.7,ACEBench-Agent 提升 +13.9。

  6. Hugging Face Daily Papers37

    循环语言模型提升组合式工具调用能力

    研究在 API-Bank、BFCL 和 NESTful 上评测原生与改造后的循环语言模型,发现循环计算在组合式、依赖感知的工具调用上普遍有增益,而在孤立 API 调用上提升较小且更依赖具体模型。多步工具调用准确率通常随循环深度增加而上升,自适应推理则通过按需分配算力实现更优的算力-性能权衡。

  7. Hugging Face Daily Papers40

    SkillForge:用自蒸馏智能体解决项目专属代码问题

    SkillForge 是一个自蒸馏框架,通过重新实现仓库中测试覆盖的核心功能来合成项目专属问题,并将解决过程中获得的知识蒸馏为与仓库实体绑定的可复用技能,用于后续真实问题修复。在开源和闭源模型上的实验显示,该方法持续优于强基线,且无需依赖历史问题修复记录或为每个问题付出高昂的测试时探索成本。

  8. Hugging Face Daily Papers38

    FACET:在终端任务合成中保留源意图与可执行状态

    FACET 是一个终端任务合成框架,通过将相关智能体技能重构为信息丰富的场景,并先构建和修复执行环境再生成任务产物,让容器状态成为指令、参考解与验证器的共享基础。它生成带密集可执行检查的复杂终端任务,用其成功轨迹微调多个规模的模型,在 Terminal-Bench 2.1 上性能持续提升。

  9. Hugging Face Daily Papers57

    研究提出 FAR 流水线,从 5,245 篇组合数学论文筛出 77 项待人工复审结果

    研究提出 FAR(Find、Attempt、Recommend)文献到复审的级联流程,把研究者输入从单个问题改为研究方向。在组合数学试点中,流水线从 5,245 篇论文提取 6,453 条候选猜想或公开问题,筛出 4,717 条表述清晰且仍未解决的问题,经推理与自动分诊得到 598 项潜在解答,最终选出 77 项交由作者团队复审。

8月19日周三
  1. Hugging Face Daily Papers38

    DiSCO:通过分布引导的对比提示词优化防御文生图有害内容

    DiSCO 是一种零样本、严格黑盒的文生图防御方法,完全在提示词层面工作,无需重训练、微调或访问模型内部。它通过 beam search 做分布引导的后缀扩展,并用目标模型自身生成的安全与不安全图像池进行对比打分,迭代反馈直至产出安全内容。在 I2P 基准的多种红队攻击下,DiSCO 将无防御与已有防御模型的 ASR 分别降低 37.7% 和 25.13%,同时保持语义保真度并提升图像连贯性。

  2. Hugging Face Daily Papers42

    EditBridge:面向高保真高效超高清图像编辑的扩散桥框架

    EditBridge 是一个扩散桥框架,将低分辨率编辑结果到高分辨率对应图像的细化建模为结构化数据到数据翻译,并以原始高分辨率图像为条件保留真实细节。它引入先验引导的分块稀疏注意力机制,将跨图像交互限制在空间对齐区域,从而降低计算开销。实验显示其可在最高 4K 分辨率下实现高保真编辑,2K 下提速 3.6–8.4 倍,4K 编辑仅需 61 秒。

  3. Hugging Face Daily Papers38

    用统一层方程统一图神经网络

    研究者提出一个"通用层方程",用更新域、通道集、传播库、逐通道消息映射、通道融合算子、ego/残差映射和更新映射七个组件统一描述图神经网络架构,核心分解将信息移动位置(传播库)与移动内容(消息映射)分离。该框架覆盖局部消息传递、注意力、谱滤波、全局通信等七类非互斥架构家族,可组织超过 200 种架构,并关联过平滑、过挤压、异质性和表达能力等议题。

  4. Hugging Face Daily Papers30

    个性化自动科研:迈向真正的 AI 联合科学家

    研究者提出"个性化自动科研"问题,主张 AI 联合科学家应将研究者的既有工作、方法储备与合作网络纳入检索、假设搜索、实验、写作和评审的每个环节。该框架包含图结构的研究者表征、全流程个性化与基于个体的评估三部分,并指出当前系统存在"一刀切"失效模式:不同研究者提出同一目标会得到几乎相同的研究结果。

  5. Hugging Face Daily Papers38

    TAMP-Nav:面向高效具身导航的 Point、Think、Memorize 与 Align 框架

    研究者提出统一具身导航框架 TAMP-Nav,通过 Pixel-to-3D 动作公式让 VLM 只选 2D 像素再投影为 3D 坐标交由 SLAM 控制器执行,并引入选择性推理与 Anchor-Trajectory 记忆机制及基于 GRPO 的两级对齐范式。该框架在 R2R-CE 上达到 66.2% SR 的 SOTA 表现,仅需 90k 训练轨迹,兼具运行时与样本效率。

  6. Hugging Face Daily Papers38

    从语料到协同进化能力:面向通用图像生成的能力中心数据设计

    研究者提出一套能力驱动的数据基础设施,将能力专属监督构建与能力对齐的课程调度耦合,通过三个可互操作的数据引擎分别构建文本-图像 grounding、图像间变换和图像-知识关联监督。该框架构建了 440M 图像的 T2I 语料、120M 编辑对和超 27M 图像-实体对,并从头训练了 3B 和 6B 两种规模的多模态扩散模型,在 CPI-Bench 上完成定量评估。

  7. Hugging Face Daily Papers32

    GS-Voxel:面向大规模 3DGS 生成的无拟合结构化潜变量

    GS-Voxel 是一种无拟合结构化潜变量框架,可将预优化 3DGS 重建确定性转换为稀疏活跃体素,无需逐场景额外优化,并保留所选图元的亚体素位置与渲染属性。其 GS 专用因子化 VAE 分别编码体素几何与局部高斯属性,潜变量规模随占用体素数增长,而非受固定场景图元总数限制。研究还通过重叠感知分块推理,将基于卫星视图图像的条件生成扩展到单次训练裁剪之外的大面积航拍 3DGS 场景。

  8. Hugging Face Daily Papers54

    ASI-Bench 基准发布,用 60 项项目级任务评估 AI 自主科研能力

    ASI-Bench 是面向通用科研领域的基准,包含覆盖 11 个科学领域的 60 项项目级研究任务,用于联合评估 AI 的创新探索与自主科研执行能力。该基准在同一研究项目中逐步撤去人类方法指引,测试 AI 能独立推进到何种程度;在 18 种智能体与模型配置上,平均分从完整方法指引下的 50.91 降至仅指定方法的 29.10,需自行确定方法时进一步降至 26.62。