跳到正文

开发者平台

项目更新、模型与开源社区动态

当前显示全部 AI 相关新闻
按账号或来源筛选(5)
1,024 条AI 相关新闻 · 最新在前
8月19日周三
  1. Hugging Face Daily Papers38

    从语料到协同进化能力:面向通用图像生成的能力中心数据设计

    研究者提出一套能力驱动的数据基础设施,将能力专属监督构建与能力对齐的课程调度耦合,通过三个可互操作的数据引擎分别构建文本-图像 grounding、图像间变换和图像-知识关联监督。该框架构建了 440M 图像的 T2I 语料、120M 编辑对和超 27M 图像-实体对,并从头训练了 3B 和 6B 两种规模的多模态扩散模型,在 CPI-Bench 上完成定量评估。

  2. Hugging Face Daily Papers32

    GS-Voxel:面向大规模 3DGS 生成的无拟合结构化潜变量

    GS-Voxel 是一种无拟合结构化潜变量框架,可将预优化 3DGS 重建确定性转换为稀疏活跃体素,无需逐场景额外优化,并保留所选图元的亚体素位置与渲染属性。其 GS 专用因子化 VAE 分别编码体素几何与局部高斯属性,潜变量规模随占用体素数增长,而非受固定场景图元总数限制。研究还通过重叠感知分块推理,将基于卫星视图图像的条件生成扩展到单次训练裁剪之外的大面积航拍 3DGS 场景。

  3. Hugging Face Daily Papers54

    ASI-Bench 基准发布,用 60 项项目级任务评估 AI 自主科研能力

    ASI-Bench 是面向通用科研领域的基准,包含覆盖 11 个科学领域的 60 项项目级研究任务,用于联合评估 AI 的创新探索与自主科研执行能力。该基准在同一研究项目中逐步撤去人类方法指引,测试 AI 能独立推进到何种程度;在 18 种智能体与模型配置上,平均分从完整方法指引下的 50.91 降至仅指定方法的 29.10,需自行确定方法时进一步降至 26.62。

  4. Hugging Face Daily Papers49

    StartupBench:面向市场验证的端到端工作流评测通用智能体

    研究者推出 StartupBench,一个基于市场验证 AI 创业产品构建的端到端智能体基准,将真实产品工作流转化为面向交付物的任务并用细粒度评分标准评估。在统一 agent harness 下,最强模型也仅能完成约 30% 的任务,复杂指令遵循与领域专业知识是主要失败原因。结果表明许多已被市场验证的工作流仍超出当前通用智能体的可靠能力范围。

  5. Hugging Face Daily Papers39

    Agentic ESOpt:以极低 GPU 需求微调长时程 LLM 智能体

    Agentic ESOpt 是一个面向长时程 LLM 智能体的全参数微调框架,用进化策略(ES)替代强化学习,仅需推理级 GPU 显存即可完成全参数优化。在 WebArena-Lite 上,Qwen-3.5-27B 的全参数优化较 No Skill 基线提升 6.69%;在测试时自动启发式设计中,其在线提示词—参数协同进化在 36 个设置中的 28 个优于匹配基线。

  6. Hugging Face Daily Papers34

    分层语言模型的多字节预测(MBP):并行生成多字节加速推理

    分层语言模型提出多字节预测(MBP),可并行生成多个字节,在不增加参数、性能影响极小的前提下加速推理。MBP 基于多 token 预测(MTP)范式,引入与分层 LM 潜在 token(segment)对齐的可变长度预测窗口,以及不破坏因果性的注意力掩码方案。在指令跟随、问答、摘要和机器翻译等任务上,MBP 实现了性能与推理吞吐之间的帕累托最优权衡。

  7. Hugging Face Daily Papers50

    HarmProfile:刻画前沿 LLM 的有害输出分布

    HarmProfile 是一个内容中心的安全基准数据集,收录 23 个前沿 LLM、13 个模型家族产生的 8 万多条已验证有害内容,覆盖 15 个危害大类与 57 个子类。论文基于该语料发现,前沿 LLM 会大规模稳定生成有害内容,但各自的风险画像不同,危害程度与多样性随模型能力上升,模型可能表面安全却在对齐表层下藏有更危险的知识。源代码已公开。

  8. Hugging Face Daily Papers37

    无标签策略下准确率与顺序敏感性出现分化

    一项针对大语言模型多选题基准的研究发现,阻止模型看到选项标签并不能可靠提升准确率。研究测试了生成后匹配与单独打分两种去偏策略,完整分解显示瓶颈在于隐藏选项而非匹配步骤;唯一能稳定匹配基线的配置是展示全部选项并配合 LLM 匹配器。完全消除位置影响仍未带来稳定准确率增益,而循环置换往往能提升表现。

8月18日周二
  1. Hugging Face Daily Papers42

    PACE-Bench:在动态环境中通过代码演化评测物理适应能力

    PACE-Bench 是一个基于模拟器的基准,包含六个物理领域的 144 个源到目标适应对,用于测试智能体在环境条件改变后能否通过代码迭代恢复。评测显示 Reflexion + Qwen3-14B 仅解决 35.9% 的完整基准对,GPT-5.5 在完整预算下解决 Statics 子集的 66.7%。结果表明基于模拟器的反思比未经验证的自我修正更可靠,而机制重设计而非参数推断才是核心瓶颈。

  2. Hugging Face Daily Papers45

    ENTLORE:面向企业问答中隐性组织推理的图基基准

    ENTLORE 是一个图基企业问答基准构建框架,包含来自三类来源的 2,341 篇文档和 907 道问题,覆盖显式查找、跨源组合与隐性组织推理三类任务,并在 56 种模型与访问配置上评测。即使提供 gold documents,仍有 30.4% 的隐性组织推理问题无法回答,而显式与组合类问题分别仅为 12.6% 和 6.2%。该基准、数据与代码已公开。

  3. Hugging Face Daily Papers51

    COLM 2026 论文:思维模型放大的推理行为并非高预测性行为

    发表于 COLM 2026 的研究在 15 个模型、6 个基准上标注 15,282 条推理轨迹,提出 Behavioral Lift 指标衡量某行为出现与否时正确率的变化。研究发现思维模型显著放大自我纠错、假设检验和不确定性承认,而提升正确率最高的行为是置信度校准、知识对齐和自我意识。置信度校准是最强的正向正确率信号之一却几乎未被放大,不确定性承认被放大 3 至 7 倍却与正确率弱相关或负相关。

  4. Hugging Face Daily Papers41

    研究发现大语言模型自发涌现模块化认知架构,与人脑功能分区高度相似

    一项覆盖语言、形式推理、社会推理、物理推理四大认知域共 46 项任务的电路分析发现,大语言模型自发形成了与人脑相似的模块化架构:在人类大脑中依赖同一网络的任务,在 LLM 中会调用重叠的神经元,而依赖不同网络的任务则调用不同神经元。研究者认为,模块化可能是智能系统的基本属性,而非生物大脑独有的进化偶然。

  5. Hugging Face Daily Papers45

    研究:LLM 能识别错误判例,却难以发现引用页码与论点不符

    一项被 ICML 2026 AI for Law 研讨会接收的研究用真实法律引用做受控扰动,测试了 14 种模型配置的引用支持验证能力。模型能识别 93-100% 的错判例引用,但只发现 37-61% 的法院判决书错页码引用和 52-83% 的法律文书错页码引用。GPT-5.4 高推理强度仍漏掉法院判决书中 40%、法律文书中 18% 的页码不匹配,模型往往依据主题相关而非页面级支持就接受引用。

8月17日周一
  1. Hugging Face Daily Papers34

    面向通用科学 AI 的路径:科学图像的多模态理解

    ALD/E-ImageMiner 基准与 ICDAR 2026 原子层沉积/刻蚀科学图表信息抽取竞赛提供来自 205 篇出版物的 1,951 张图表,由专家标注用于分类、数据表格抽取、摘要和视觉问答。作者提出以"从图像中获取科学概念理解"作为长期基准目标,未来方向涵盖更广领域与图表类型、跨文档综合、假设评估、溯源、不确定性、反事实 grounding 及开放式多模态研究。

  2. Hugging Face Daily Papers41

    LittleLearner:在教学控制的知识暴露下训练语言模型

    研究者发布 LITTLECURRICULUM——一个 88B token 的预训练语料,仅覆盖美国小学教材内容,明确排除五年级以上才教授的概念、事实与词汇。基于该语料从零训练的 5B 参数模型 LITTLELEARNER 具备开放式评测所需的语言能力,同时拥有与可解释课程大纲对应的清晰知识与能力边界。

  3. Hugging Face Daily Papers40

    UniProbe:用多结构内部表征的可学习 Token 级大视觉语言模型幻觉检测器

    UniProbe 是一款轻量可学习的 Token 级幻觉检测器,对冻结的 LVLM 单次前向传播的计算轨迹建模,通过 GNN、ViT、GRU 交替处理图像 patch、查询 token 与生成 token 构成的注意力有向图。它在多种 LVLM 骨干上取得 SOTA 的 Token 级与物体幻觉检测效果,解码时可将物体幻觉降低最多 55%,延迟仅为标准生成的 1.06 倍。

  4. Hugging Face Daily Papers33

    PRM-as-a-Judge 1.5:机器人过程评估工具包发布

    PRM-as-a-Judge 1.5 发布,这是一个将机器人 rollout 视频转化为密集进度曲线并派生多项细粒度指标的机器人过程评估工具包。它在 1.0 版本基础上新增三项指标,分别刻画失败侧进度、回撤后恢复与成功侧执行质量,并推出 RoboPulse++ 用于评估过程奖励模型(PRM)的可靠性。团队同时开源了包含 benchmark、指标实现与可视化工具的评估套件,支持可复现的操控过程评估。