跳到正文

开发者平台

项目更新、模型与开源社区动态

当前显示全部 AI 相关新闻
按账号或来源筛选(6)
1,680 条AI 相关新闻 · 最新在前
8月20日周四
  1. Hugging Face Daily Papers40

    SkillForge:用自蒸馏智能体解决项目专属代码问题

    SkillForge 是一个自蒸馏框架,通过重新实现仓库中测试覆盖的核心功能来合成项目专属问题,并将解决过程中获得的知识蒸馏为与仓库实体绑定的可复用技能,用于后续真实问题修复。在开源和闭源模型上的实验显示,该方法持续优于强基线,且无需依赖历史问题修复记录或为每个问题付出高昂的测试时探索成本。

  2. Hugging Face Daily Papers38

    FACET:在终端任务合成中保留源意图与可执行状态

    FACET 是一个终端任务合成框架,通过将相关智能体技能重构为信息丰富的场景,并先构建和修复执行环境再生成任务产物,让容器状态成为指令、参考解与验证器的共享基础。它生成带密集可执行检查的复杂终端任务,用其成功轨迹微调多个规模的模型,在 Terminal-Bench 2.1 上性能持续提升。

  3. Hugging Face Daily Papers57

    研究提出 FAR 流水线,从 5,245 篇组合数学论文筛出 77 项待人工复审结果

    研究提出 FAR(Find、Attempt、Recommend)文献到复审的级联流程,把研究者输入从单个问题改为研究方向。在组合数学试点中,流水线从 5,245 篇论文提取 6,453 条候选猜想或公开问题,筛出 4,717 条表述清晰且仍未解决的问题,经推理与自动分诊得到 598 项潜在解答,最终选出 77 项交由作者团队复审。

8月19日周三
  1. Hugging Face Daily Papers38

    DiSCO:通过分布引导的对比提示词优化防御文生图有害内容

    DiSCO 是一种零样本、严格黑盒的文生图防御方法,完全在提示词层面工作,无需重训练、微调或访问模型内部。它通过 beam search 做分布引导的后缀扩展,并用目标模型自身生成的安全与不安全图像池进行对比打分,迭代反馈直至产出安全内容。在 I2P 基准的多种红队攻击下,DiSCO 将无防御与已有防御模型的 ASR 分别降低 37.7% 和 25.13%,同时保持语义保真度并提升图像连贯性。

  2. Hugging Face Daily Papers42

    EditBridge:面向高保真高效超高清图像编辑的扩散桥框架

    EditBridge 是一个扩散桥框架,将低分辨率编辑结果到高分辨率对应图像的细化建模为结构化数据到数据翻译,并以原始高分辨率图像为条件保留真实细节。它引入先验引导的分块稀疏注意力机制,将跨图像交互限制在空间对齐区域,从而降低计算开销。实验显示其可在最高 4K 分辨率下实现高保真编辑,2K 下提速 3.6–8.4 倍,4K 编辑仅需 61 秒。

  3. Hugging Face Daily Papers38

    用统一层方程统一图神经网络

    研究者提出一个"通用层方程",用更新域、通道集、传播库、逐通道消息映射、通道融合算子、ego/残差映射和更新映射七个组件统一描述图神经网络架构,核心分解将信息移动位置(传播库)与移动内容(消息映射)分离。该框架覆盖局部消息传递、注意力、谱滤波、全局通信等七类非互斥架构家族,可组织超过 200 种架构,并关联过平滑、过挤压、异质性和表达能力等议题。

  4. Hugging Face Daily Papers30

    个性化自动科研:迈向真正的 AI 联合科学家

    研究者提出"个性化自动科研"问题,主张 AI 联合科学家应将研究者的既有工作、方法储备与合作网络纳入检索、假设搜索、实验、写作和评审的每个环节。该框架包含图结构的研究者表征、全流程个性化与基于个体的评估三部分,并指出当前系统存在"一刀切"失效模式:不同研究者提出同一目标会得到几乎相同的研究结果。

  5. Hugging Face Daily Papers38

    TAMP-Nav:面向高效具身导航的 Point、Think、Memorize 与 Align 框架

    研究者提出统一具身导航框架 TAMP-Nav,通过 Pixel-to-3D 动作公式让 VLM 只选 2D 像素再投影为 3D 坐标交由 SLAM 控制器执行,并引入选择性推理与 Anchor-Trajectory 记忆机制及基于 GRPO 的两级对齐范式。该框架在 R2R-CE 上达到 66.2% SR 的 SOTA 表现,仅需 90k 训练轨迹,兼具运行时与样本效率。

  6. Hugging Face Daily Papers38

    从语料到协同进化能力:面向通用图像生成的能力中心数据设计

    研究者提出一套能力驱动的数据基础设施,将能力专属监督构建与能力对齐的课程调度耦合,通过三个可互操作的数据引擎分别构建文本-图像 grounding、图像间变换和图像-知识关联监督。该框架构建了 440M 图像的 T2I 语料、120M 编辑对和超 27M 图像-实体对,并从头训练了 3B 和 6B 两种规模的多模态扩散模型,在 CPI-Bench 上完成定量评估。

  7. Hugging Face Daily Papers32

    GS-Voxel:面向大规模 3DGS 生成的无拟合结构化潜变量

    GS-Voxel 是一种无拟合结构化潜变量框架,可将预优化 3DGS 重建确定性转换为稀疏活跃体素,无需逐场景额外优化,并保留所选图元的亚体素位置与渲染属性。其 GS 专用因子化 VAE 分别编码体素几何与局部高斯属性,潜变量规模随占用体素数增长,而非受固定场景图元总数限制。研究还通过重叠感知分块推理,将基于卫星视图图像的条件生成扩展到单次训练裁剪之外的大面积航拍 3DGS 场景。

  8. Hugging Face Daily Papers54

    ASI-Bench 基准发布,用 60 项项目级任务评估 AI 自主科研能力

    ASI-Bench 是面向通用科研领域的基准,包含覆盖 11 个科学领域的 60 项项目级研究任务,用于联合评估 AI 的创新探索与自主科研执行能力。该基准在同一研究项目中逐步撤去人类方法指引,测试 AI 能独立推进到何种程度;在 18 种智能体与模型配置上,平均分从完整方法指引下的 50.91 降至仅指定方法的 29.10,需自行确定方法时进一步降至 26.62。

  9. Hugging Face Daily Papers49

    StartupBench:面向市场验证的端到端工作流评测通用智能体

    研究者推出 StartupBench,一个基于市场验证 AI 创业产品构建的端到端智能体基准,将真实产品工作流转化为面向交付物的任务并用细粒度评分标准评估。在统一 agent harness 下,最强模型也仅能完成约 30% 的任务,复杂指令遵循与领域专业知识是主要失败原因。结果表明许多已被市场验证的工作流仍超出当前通用智能体的可靠能力范围。