跳到正文

开发者平台

项目更新、模型与开源社区动态

当前显示全部 AI 相关新闻
按账号或来源筛选(5)
1,107 条AI 相关新闻 · 最新在前
9月3日周四
  1. Hugging Face Daily Papers38

    Debias-SparseGPT:面向大语言模型的偏差感知剪枝方法

    Debias-SparseGPT 是一种训练后剪枝方法,通过基于人口统计学对比输入定义的二阶项引入表征去偏,在 25%、50% 和结构化 2:4 稀疏度下均比 SparseGPT 减少剪枝引入的偏差,同时保持模型困惑度和零样本准确率。在最严格的 2:4 结构化稀疏下,用长上下文、内容丰富的样本增强校准集可进一步提升下游性能与公平性。该工作已被 EMNLP 2026 接收。

  2. Hugging Face Daily Papers28

    无需跨资产收益协方差的投资组合风险边界:来自语言模型表征的分布场

    研究提出用企业级分布特征替代跨资产收益协方差,为投资组合风险提供单边上界证明,加权成对松弛在可检验条件下凸且只需边际波动率尺度。在2018-2022年52家公司面板上,基于Qwen3-Embedding-8B新闻表征构建的配置在四个预设上限组合群体中处于样本内方差第0.69至1.33百分位,等风险加权则处于第21.1至28.6百分位。

  3. Hugging Face Daily Papers34

    FoldingAgent:从折纸演示视频推断参数化折纸程序

    FoldingAgent 是一个智能体框架,能直接从折纸演示视频中推断出显式的参数化折叠程序。它基于预训练 VLM,配备模拟几何变换、验证物理合理性、检索比对视觉内容及自评估预测的工具,并定义了几何与参数化折叠动作构成的参数空间,可顺序操作并重新规划动作以缓解多步折叠的累积误差。

  4. Hugging Face Daily Papers52

    VibeVoice-ASR-Streaming 技术报告提出 LLM 端到端流式说话人归属 ASR,开源 1.5B 与 7B 权重

    VibeVoice-ASR-Streaming 技术报告提出一种基于 LLM 的端到端流式说话人归属 ASR 方法,将固定大小音频块、少量前瞻音频与历史文本交错输入,无需独立说话人分离阶段即可在语音到达时输出谁说了什么。7B 模型在五个评测集上取得最低平均 WER/CER,说话人归属在 13 项评测设置中有 12 项最佳或并列最佳。团队同时开源 1.5B 与 7B 模型权重及推理代码。

  5. Hugging Face Daily Papers35

    SimLoss:单次推理的细粒度图像描述方法

    SimLoss 是一种无参考的嵌入空间目标函数,用于单次推理的细粒度图像描述,通过 InfoNCE 对比损失将视觉语言模型投影的隐藏状态与冻结图像嵌入对齐,无需人工细粒度描述或多阶段伪描述。其全微分微调版本 SimLoss FFT 精度最高,F1 接近多阶段方法,且推理速度约为多阶段流程的 20 倍;基于奖励的 SimLoss GRPO 召回率最强。

  6. Hugging Face Daily Papers43

    HarnessDev:LLM 能否创建并演化自己的 Agent Harness?

    研究者提出 HarnessDev 基准,将评估对象从任务输出转向可运行基础设施,包含 Creation 与 Evolution 两个阶段。Creation 覆盖 6 个创建者 LLM、4 个领域和 5 个下游基准共 2,207 个实例,生成 harness 在代码与搜索研究上落后于人工参考,在写作与机器学习实验上持平或超越,执行成本差异较大。

  7. Hugging Face Daily Papers50

    研究提出 ASPIRE 基准,测试模型能否从模糊目标中自我进化

    研究团队提出 ASPIRE 基准,考察模型能否仅凭一句自然语言能力目标完成自我进化,下游评测任务对智能体保持隐藏。智能体需自行选择数据与更新方法、构建训练和验证信号并决定何时评测,基准同时支持模型权重与 agent-harness 两条进化路径,并在覆盖六个目标的 520 条隐藏专家题目上评测。

  8. Hugging Face Daily Papers44

    Kirin:从野外视频生成动物动作

    研究团队提出 Kirin 框架,可从野外动物视频重建 3D 动作、大规模学习动作先验并生成可直接用于动画资产的真实动作。团队基于大量野外视频构建了 AiM3D,这是首个面向四足动物、提供对齐视频-文本-动作三元组的大规模数据集。其视觉引导动作生成模型以文本和图像为条件,结合现成图像到 3D 模型自动绑定并驱动 3D 网格,生成可直接渲染的动画动物。

  9. Hugging Face Daily Papers44

    Pixel Linguist II:像素文本表示学习的设计基础

    研究通过系统性消融实验确定鲁棒视觉文本表示学习的四个关键要素:可变图像分辨率与渲染字号、自然图文对、布局感知渲染、两阶段多语言课程。据此训练的 Pixel Linguist II 采用原生分辨率与实时渲染,在 2.8 亿训练样本上完成多语言课程训练,在英文、跨语言及多语言 Visual STS 与 ViDoRe 上取得新的 SOTA,并在 80% 视觉 token 压缩下保持稳健。

  10. Hugging Face Daily Papers40

    Cliff:从第一个错误中学习过程奖励

    针对 RLVR 依赖粗粒度结果奖励、对中间推理过程指导不足的问题,研究者提出奖励塑形策略 Cliff,用现成 LLM 作为教师识别每条 rollout 中的第一个错误,将轨迹拆分为正确前缀与错误后缀,并转化为 token 级优势。在 12 个场景的实验中,Cliff 持续提升推理表现,分别超过 on-policy distillation 15%、标准 GRPO 7%,即使教师模型能力一般也有效。

  11. Hugging Face Daily Papers41

    PaperCompiler:通过仓库级规格编译实现忠实的论文到代码生成

    PaperCompiler 将论文证据编译为显式的仓库级实现规格,保留来源溯源并区分论文支持、推断、外部委托和未解决信息,规格中编码非退化要求、归属分配、跨文件依赖和文件级约束。在 Paper2CodeBench 上,其基于参考的忠实度相对提升 13.8%(从 3.64 到 4.15),高严重度评估批评从 13.2% 降至 6.1%。

  12. Hugging Face Daily Papers69

    SolarWM:为长时程视频世界模型提供开放数据与可扩展训练

    论文提出 SolarWM,一个完全开放的视频世界模型基础,覆盖从数据准备到长时程推理的全流程。其数据引擎把 10 个数据集的 143 万条片段统一为帧对齐格式,并在共享接口下基于 Wan2.2、LTX-2.5 和 MiniMax-H3 实例化四个 5B 至 33B 模型。模型仅用 5 秒序列训练即可支持分钟到小时的实时交互 rollout,数据、流程、配方、权重与框架均已开放。

  13. Hugging Face Daily Papers40

    CoGR:用强化学习让生成式检索器查询侧与物品侧协同进化

    CoGR 是一个让 LLM 在查询侧和物品侧直接生成关键词表示的检索框架,关键词通过倒排索引匹配,兼容现有检索基础设施。它采用两阶段训练:先监督微调建立对齐的关键词空间,再用 GRPO 交替优化两侧生成器,物品侧使用反事实边际奖励。在内部 APP Marketplace 数据集和公开 WANDS 基准上,CoGR 的 F1 分别比最强基线提升 10.9% 和 36.1%。

  14. Hugging Face Daily Papers48

    LLM 智能体持久记忆存在内生授权洗白风险,EAL-Bench 揭示最高 50.2% 虚假授权

    研究提出"内生授权洗白"概念:LLM 智能体的持久记忆若错误记录权限变更,可在无外部攻击下凭虚假授权执行未授权操作。新基准 EAL-Bench 测试显示,增量记忆更新下写入方为最高 50.2% 的未授权请求创建虚假权限,执行方在 98.6% 的试验中照此行动。要求权限有有效源事件背书、用有界事件溯源追踪权限变更可大幅降低洗白,但也会拒绝更多合法操作,形成安全与效用的权衡。

  15. Hugging Face Daily Papers51

    RealSWE:真实用户请求下的编码智能体组合式评测基准

    RealSWE 提出由 SWE-bench Verified 与 Pro 衍生的 381 个多变量任务族,用于评测真实用户请求风格下的编码智能体。对真实提示词与基准问题的对比显示,只含问题陈述的请求占真实提示词的 88%,在基准问题中仅占 7%;87% 的真实提示词为随意书写,而 94% 的基准问题为正式书写。

  16. Hugging Face Daily Papers45

    研究发现:中等训练阶段的知识蒸馏更利于推理而非事实记忆,提出 Switch Distillation 方法

    基于 logit 的知识蒸馏在中训练阶段会拖慢事实记忆的习得,但推理能力仍持续提升,原因是教师模型对程序性数据更有信心、而学生模型更早掌握低熵事实知识。为此提出的 Switch Distillation 以教师预测熵为路由信号,仅在教师有信心的 token 上蒸馏,其余回退到交叉熵。

  17. Hugging Face Daily Papers40

    通过非结构化数据自适应结构化实现 Token 高效的数据推理智能体

    研究者提出 agentic data cracking,让智能体在推理过程中顺带将非结构化数据自适应、推测性地结构化,从而减少重复打开文档的开销。在 FanOutQA 上每道测试题仅扩展一个相关问题,该方法在保持准确率的同时将成本降低 53%;而理想预结构化存储的推理成本可低 28 倍。

  18. Hugging Face Daily Papers37

    腾讯混元联合北电、北大发布 DramaChain Bench:首个覆盖短剧生成全链路的端到端评测基准

    腾讯混元联合北京电影学院、北京大学等发布 DramaChain Bench,这是首个覆盖剧本、分镜、关键帧、镜头级视频到成片全链路的短剧生成评测基准。该基准基于 DramaChain Dimensions 的 5 个评估轴、63 个叶子维度构建,由 3 位专业标注员对 5,785 个条目独立打分,产出 17,488 条有效评分和 255,925 条可追溯归因记录。