跳到正文

Hugging Face Daily Papers

huggingface.co · 开发者平台

当前显示全部 AI 相关新闻
切换来源
814 条AI 相关新闻 · 最新在前
9月4日周五
  1. Hugging Face Daily Papers47

    AutoTraceGT:用扎根理论大规模分析智能体行为

    研究者提出 AutoTraceGT,首个将社会科学扎根理论自动化应用于智能体轨迹分析的多智能体流水线,通过开放式、轴心式与理论式编码迭代至饱和,为每个任务生成定制化行为分类体系。在六个轨迹语料库上,其生成的编码手册覆盖人工标注分类体系中 73%-91% 的失败模式,并发现后者遗漏的新模式。该编码手册作为演绎特征空间时,在下游失败预测任务上优于零样本和少样本 LLM 基线。

  2. Hugging Face Daily Papers37

    SGD 优化中的渗流动力学:方差级联与离散尺度不变性

    研究将随机梯度流(SGF)建模为渗流过程,发现嵌套架构对称性迫使子网络以离散块形式合并,而非单边连接,这种结构转变在宏观序参量上表现为方差尖峰。作者进一步给出 Adam 和 AdamW 在重尾梯度噪声下捕获论证成立的充分条件,并在训练好的 Transformer 上进行了测量。

  3. Hugging Face Daily Papers39

    PACE:评估模型能否识别用户请求中的隐藏冲突

    研究者提出 PACE 数据集,用于评估模型能否识别以自我中心知识或事件形式存在的潜在约束,从而判断看似合理的用户请求是否不当。PACE 将基于明确人设的用户请求与自我中心 KB 事实配对,要求模型整合上下文证据判断请求是否冲突。同时提出多智能体框架 PaceMaker,通过查询改写、多跳图遍历和冲突感知过滤协调检索关键证据,在 PACE 上的证据检索质量和冲突决策准确率均持续优于现有方法。

  4. Hugging Face Daily Papers47

    Puffin-World:以原生 3D 世界状态扩展统一多模态模型

    Puffin-World 是一个统一多模态架构,无需外部离线模块即可整合物理理解、空间模拟与 3D 世界生成和重建,联合建模物理(重力场与纬度)、几何(深度)、外观(图像)三种原生世界状态,并引入统一 Omni-Camera 表示。团队构建了含 1500 万视觉-语言-相机三元组和 100 万条轨迹的 Puffin-16M 数据集,并已开源代码、模型与数据集。

  5. Hugging Face Daily Papers58

    Principia:面向视频模型的关系物理测试基准

    Principia 是一个通过配对物体间关系一致性来评测视频模型牛顿物理推理的基准,涵盖重力、弹性、摩擦、转动惯量、抛体、动量、单摆和弹簧振子八种现象,并使用与相机标定无关的一致性评分。在六个主流视频生成模型的数千次生成结果中,没有模型得分超过 0.42,而它们在同一批评测中 VBench 得分约 0.8。视觉语言模型检测关系物理违规的最佳准确率仅为 67%,多数接近随机水平。

9月3日周四
  1. Hugging Face Daily Papers38

    Debias-SparseGPT:面向大语言模型的偏差感知剪枝方法

    Debias-SparseGPT 是一种训练后剪枝方法,通过基于人口统计学对比输入定义的二阶项引入表征去偏,在 25%、50% 和结构化 2:4 稀疏度下均比 SparseGPT 减少剪枝引入的偏差,同时保持模型困惑度和零样本准确率。在最严格的 2:4 结构化稀疏下,用长上下文、内容丰富的样本增强校准集可进一步提升下游性能与公平性。该工作已被 EMNLP 2026 接收。

  2. Hugging Face Daily Papers28

    无需跨资产收益协方差的投资组合风险边界:来自语言模型表征的分布场

    研究提出用企业级分布特征替代跨资产收益协方差,为投资组合风险提供单边上界证明,加权成对松弛在可检验条件下凸且只需边际波动率尺度。在2018-2022年52家公司面板上,基于Qwen3-Embedding-8B新闻表征构建的配置在四个预设上限组合群体中处于样本内方差第0.69至1.33百分位,等风险加权则处于第21.1至28.6百分位。

  3. Hugging Face Daily Papers34

    FoldingAgent:从折纸演示视频推断参数化折纸程序

    FoldingAgent 是一个智能体框架,能直接从折纸演示视频中推断出显式的参数化折叠程序。它基于预训练 VLM,配备模拟几何变换、验证物理合理性、检索比对视觉内容及自评估预测的工具,并定义了几何与参数化折叠动作构成的参数空间,可顺序操作并重新规划动作以缓解多步折叠的累积误差。

  4. Hugging Face Daily Papers52

    VibeVoice-ASR-Streaming 技术报告提出 LLM 端到端流式说话人归属 ASR,开源 1.5B 与 7B 权重

    VibeVoice-ASR-Streaming 技术报告提出一种基于 LLM 的端到端流式说话人归属 ASR 方法,将固定大小音频块、少量前瞻音频与历史文本交错输入,无需独立说话人分离阶段即可在语音到达时输出谁说了什么。7B 模型在五个评测集上取得最低平均 WER/CER,说话人归属在 13 项评测设置中有 12 项最佳或并列最佳。团队同时开源 1.5B 与 7B 模型权重及推理代码。