跳到正文

Hugging Face Daily Papers

huggingface.co · 开发者平台

当前显示全部 AI 相关新闻
切换来源
841 条AI 相关新闻 · 最新在前
9月10日周四
  1. Hugging Face Daily Papers46

    SAEScientist-Bench:AI 智能体能否自主开展 SAE 可解释性研究?

    研究者提出 SAEScientist-Bench,用于评估 AI 智能体能否像科学家一样使用 SAE 工具自主完成机制可解释性发现。任务要求智能体在 Gemma-2-9B-IT 的 Gemma Scope 词典中检索 131K+ 特征,并与 Neuronpedia 上的专家参考特征对比激活排名、对比文本上的概念选择性和因果引导效果。

  2. Hugging Face Daily Papers39

    RESCUE-BENCH:面向关系感知多方情感支持对话系统的基准

    研究者构建了 RESCUE 基准,用于评估 LLM 能否捕捉并利用多人关系中不断变化的动态来提供情感支持。该基准取自真实情侣与家庭访谈对话,包含 191 个样本、7,079 个标注轮次和 1,064.8 分钟视频,定义了关系理解与关系敏感支持两类能力下的六项任务。对十款 LLM 的实验显示,模型在依赖局部情绪线索的任务上表现尚可,但在关系模式预测、观点预测和支持策略预测等关系密集型任务上表现不佳。

  3. Hugging Face Daily Papers43

    Φ-Bench:大语言模型能否工程化支撑自身运行的基础设施?

    研究者提出 Φ-Bench,用于系统评估 LLM 工程化 LLM 基础设施栈的能力,覆盖从局部 kernel 级函数补全到长周期实现与端到端系统优化等不同复杂度任务。该基准源自前沿研究中的优化问题并基于真实代码仓库构建,弥补了现有基准仅关注孤立 kernel、预定义算子或预设优化目标的不足。对前沿 LLM 的实验揭示了其在工程化复杂 LLM 基础设施上的现有能力与局限。

  4. Hugging Face Daily Papers46

    重新审视后训练中的完整推理轨迹:部分轨迹与端点训练即可奏效

    研究发现,LLM 后训练(如 SFT)中完整推理轨迹带来的收益有限,而部分轨迹即使被大幅截断仍然有效。基于注意力的分析和受控 token 移除实验表明,中间 token 对最终推理质量贡献极小,模型可依据已知轨迹端点从内部知识推断缺失步骤。仅用端点训练还能改变推理行为,并提升基于强化学习或 on-policy 蒸馏的后训练方法效果。

  5. Hugging Face Daily Papers32

    RenderFormer-V2:用异构场景基元做神经渲染

    RenderFormer-V2 是一个基于 Transformer 的统一神经渲染模型,无需逐场景训练或专用代码即可处理焦散、体积散射、环境光照、带纹理与位移的表面及分布外材质等光照传输效果。它延续两阶段设计,在视图无关阶段引入窗口注意力与渲染感知注意力汇以提升可扩展性,并支持环境贴图和参与介质等异构场景基元,采用独立于表面反射模型的材质编码。该工作已被 ECCV 2026 接收。

  6. Hugging Face Daily Papers46

    NOAH:面向全病程建模的时间感知多模态生成式 Transformer 模型

    研究者提出 NOAH,一个时间感知、任务无关的生成式 Transformer 模型,可表征并预测完整的多模态患者病程。该模型基于 MIMIC 数据集家族中 299,000 名患者、431,000 次就诊的逾 5.59 亿条临床事件构建,原生处理医学图像、时间序列与数值信号、分类事件及结构化与非结构化临床记录。

9月9日周三
  1. Hugging Face Daily Papers32

    研究:Qwen3-8B 只做意图理解、策略执行预批程序,110/110 匹配答案与证据

    一项企业分析研究让语言模型只负责理解问题,由确定性策略选择并运行预先批准的分析程序,同时返回结果与证据。在 440 次运行中,三个 8B 模型运行时生成 SQL 并选工具,330 次运行规划无一满足完整的答案加证据契约,而策略执行的 Qwen3-8B 分析器 110 次全部匹配。

  2. Hugging Face Daily Papers37

    无需配对监督的 3D 编辑:通过生成先验蒸馏学习

    研究者提出一种无需配对 3D 监督的前馈式 3D 编辑框架,通过生成先验蒸馏从基础模型向 3D 编辑模型迁移视觉、语义与几何知识。该方法借助可微渲染管线,在主编辑视图用图像编辑模型的 2D 视觉先验、在新视图用视觉语言模型的语义先验进行监督,并引入 3D 感知分布匹配正则化以缓解几何坍塌与多视图不一致。实验显示其在指令保真度与跨视图一致性上显著优于现有基线。

  3. Hugging Face Daily Papers35

    Counter-Swarm Doctrine:如何遏制 AI 智能体的协同入侵

    针对 Hugging Face 事件与一起公开 wiki 调查,研究者提出防御的操作单元应是可修订的“协同事件”,将观察到的传输、任务权限与响应历史关联起来。核心问题是前瞻性事件发现:在评估者给出归属之前,判断哪些动作属于同一事件。论文给出评估设计,在同等审查成本与误报负载下比较孤立动作、滚动窗口、已知群体与前瞻发现的事件,并检验通道关闭与状态隔离后的复发情况。

  4. Hugging Face Daily Papers35

    A*-Thought-V2:通过 LLM 几何动力学实现高效潜在推理

    A*-Thought-V2 提出一种基于 LLM 几何动力学的框架,将 CoT 建模为隐藏状态轨迹,用显式-隐式交错潜在架构替代硬删除。在 Qwen3.5-9B 和 Qwen3.6-27B 上,六个基准测试平均准确率最高提升 2.6%,响应长度最多减半,单位计算准确率提升 2.29 倍,预处理和训练时间分别减少 94.6% 和最高 80.3%。

  5. Hugging Face Daily Papers31

    SQS:通过稀疏量化子分布的贝叶斯 DNN 压缩

    研究者提出 SQS,一个通过贝叶斯变分学习同时进行剪枝与低比特量化的统一框架,采用 spike-and-slab 先验诱导稀疏性、用高斯混合模型(GMM)建模量化权重,并给出高效近似与变分方法的一致性理论结果。在 ResNet、BERT-base、Llama3.2 和 Qwen2.5 上的压缩实验显示,SQS 在性能下降相当的情况下压缩率高于现有方法。该论文已被 TMLR 接收。

  6. Hugging Face Daily Papers38

    Transformer 何时开始利用推断出的对话伙伴专业水平:编码早、使用晚

    研究用 ExpertCollab 多轮研究规划对话语料发现,Transformer 对对话伙伴专业水平的推断在早期层最易解码,到网络中点前已降至接近随机水平。反事实修补显示,在解码峰值层注入专业水平差异几乎不改变固定后期层读出,而在中点之后注入则几乎完全传播,差距超过一个数量级。这表明推断出的关系属性在被因果使用前早已被表征,界定了读取或引导伙伴条件行为的干预位置。

  7. Hugging Face Daily Papers43

    为 Cosmos3 视觉-语言-动作策略添加希腊语:机器人策略语言迁移的测量研究

    研究仅用机器改写指令、不改架构,为 Cosmos3 视觉-语言-动作策略加入希腊语。在 90 任务判别套件、每组 3 个种子的测试中,双语训练比对照组稳定高出 6.7-7.1 分,达到英语性能约五分之二;仅希腊语训练最多超出对照 2.7 分,无希腊语演示的多语言文本塔则停留在错误指令下限。策略还会过拟合译者的措辞,每任务用 7 种表述训练可将该损失约减半。