跳到正文

开发者平台

项目更新、模型与开源社区动态

当前显示全部 AI 相关新闻
按账号或来源筛选(6)
1,680 条AI 相关新闻 · 最新在前
8月21日周五
  1. Hugging Face Daily Papers46

    如何量化 ASR 模型的基准优化行为

    研究提出一套量化 ASR 模型基准优化的方法,聚焦音频无法确定参考转写文本的情形,通过参考分歧、掩码数字恢复和拼写切换三类行为探针发现,得分最高的开源模型在音频矛盾、被掩码或含糊时仍逐字输出基准参考文本片段。机制探针显示模型会依据狭窄声学线索覆盖对音频的忠实表征,转而采用基准优化策略,且该行为可通过低秩线性引导或简单在片段末尾追加音频被因果操控。

  2. Hugging Face Daily Papers43

    Chain-of-Experience:让 LLM 在推理时持续自我改进

    研究提出 Chain-of-Experience(CoE),让 LLM 在测试时通过自我反馈或环境信号(如正确性、公开代码测试通过率)迭代积累经验,形成持续改进循环。在数学、编程和知识任务上测试 8 个 LLM(含 GPT-5、Gemini-2.5 Pro、Claude-4.5 Sonnet),整体提升 5.6%,API 成本降低 19%,且每 token 准确率高于现有测试时策略。

  3. Hugging Face Daily Papers38

    SkillEvo:从多轮交互反馈中生成自更新进化梯度

    SkillEvo 提出用多轮用户模拟生成反馈梯度、并用独立治理层约束进化方向,解决现有 Agent Skills 进化在首轮修补后梯度衰减、多轮缺陷不可见而停滞的问题。在 6 类云服务、9 个生产 Skills 和 98 个 skill-reference 文件上,SkillEvo 比基于自我反思的进化高 23.0 分,比单轮 QA 驱动的进化高 15.4 分。

  4. Hugging Face Daily Papers34

    MuseCPEval:面向音乐编辑系统的音乐上下文保持评估框架

    研究者提出首个音乐上下文保持(MuseCP)评估框架 MuseCPEval,覆盖四类音乐属性并配有细粒度指标,用于衡量音乐编辑中本应保持不变的音乐特征。客观验证与人类研究证实了这些指标的有效性,对多种音乐编辑系统的案例研究显示其可作为测试平台与诊断工具。该工作已被 ISMIR 2026 接收。

  5. Hugging Face Daily Papers37

    RapidLiDAR:面向实时自适应的 LiDAR 场景补全

    RapidLiDAR 将 LiDAR 场景补全的初始化本身变为可学习的数据驱动模块,通过自适应初始化预测每个输入点的空间变化位移,无需手动调噪声。该方法在 SemanticKITTI 和 KITTI-360 上达到与 SOTA 相当的补全性能,0.1 秒完成整场景,比此前最快方法快 2.3 倍,匹配车载 LiDAR 10 Hz 采集率。论文已被 ECCVW 2026 接收,代码已开源。

  6. Hugging Face Daily Papers32

    HOTFIXR:用定向合成多语言数据提升 LLM 跨语言推理能力

    研究团队提出数据生成框架 HOTFIXR,通过探测学生模型的多语言薄弱点并生成定向合成训练数据来缓解语言特定能力差异。在三个分布内任务、三个分布外任务和四种分布外语言上,HOTFIXR 平均将分布内性能提升 6.2%,并将微调导致的分布外任务灾难性遗忘降低 3.7%、分布外语言性能降低 7.1%。代码将在论文被接收后发布。

8月20日周四
  1. Hugging Face Daily Papers45

    SkillGate:在长程智能体中训练策略内技能选择

    SkillGate 通过将 token 支持划分为两条互不重叠的信用通道——结果信用只到达执行 token,动作局部优势只到达技能命名 token——解决了长程智能体技能选择中的"选择器信用饥饿"问题。在 16 个候选技能的设定下,五个智能体基准测试中,SkillGate 将 9B 策略的试验成功率从 40.8% 提升至 53.2%,同时将误导性候选的暴露减少三分之二,并读取更少的技能。

  2. Hugging Face Daily Papers37

    AdaPop:面向 LLM 遗忘的自适应流行度方法

    AdaPop 是一种按事实流行度自适应调整梯度压力的 LLM 遗忘方法,结合局部 token 置信度与来自 Wikidata sitelinks、LLM-as-Judge 等外部代理的流行度指数,并用双上升控制器逐 epoch 自动调节保留惩罚。在三个模型家族和两个基准上,AdaPop 在改写查询下泄漏的遗忘内容比对比方法少约 5 倍,在对抗性改写下少约 1.6 倍。

  3. Hugging Face Daily Papers41

    Zetta ζ:面向自进化物理智能的高效闭环具身执行框架

    Zetta 是一个闭环具身执行框架,通过三个时间尺度分离的循环在线进化基于代码的运行时 critic 与恢复技能,同时保持基础策略冻结。它在 LIBERO-Pro 和 RoboCasa 上分别达到 90.8% 和 93.6% 的成功率,推理提速 11.1 倍,并实现技能零样本迁移。配套的 Z-Infra 将智能体逻辑与异构执行资源解耦。

  4. Hugging Face Daily Papers33

    面向单步逆合成的化学合理性感知大语言模型 C3LM 训练

    研究者提出 Top-K prompting 训练与推理范式,并构建约 4560 万条已验证反应的 CREED-CCV-2+USPTO-XL 数据集,训练出化学约束一致性语言模型 C3LM。该模型结合微调与基于 ChemCensor 及新颖性导向的奖励,在 OOD URSA-expert-2026 基准上取得 SOTA。反应唯一性分析显示 LLM 与传统模型探索互补的反应空间,支持集成式逆合成系统。

  5. Hugging Face Daily Papers42

    语言模型血缘验证新方法:中心化残差签名(Centered Residual Signatures)

    研究者提出一种无需数据的白盒血缘验证方法,仅凭权重即可判断两个兼容模型检查点是否同源。该方法在 residual-MLP 和 GPT-2 基准上以 AUROC=1.0 区分微调、LoRA 合并、剪枝、量化后代与独立及蒸馏模型,在 GPT-2 上比最接近的鲁棒基线快 76 倍。案例研究正确识别出 3 个相关和 7 个无关的 LLaMA-2 公开检查点。

  6. Hugging Face Daily Papers37

    SemaPLC:面向 PLC 代码生成的项目级、验证门控智能体框架

    SemaPLC 是一个项目级、验证门控的智能体框架,只有在外部检查确认规格、编译与实时运行行为后才判定任务完成。在 117 个独立 POU 任务上,它在全部七个模型上取得最高严格验证通过率,平均 72.6%;在 65 个需在真实项目中编译运行的任务上,其动态行为得分 52.2,明显高于基线的 22.4 至 31.4。该框架已开源。

  7. Hugging Face Daily Papers45

    SPADE:在自适应合成可执行环境中的自博弈框架

    SPADE 是一个自博弈强化学习框架,让单个 LLM 同时扮演环境设计者和推理智能体,环境设计者以可执行代码形式编写带 reset()/step() 接口的长时程训练环境。扩展到 30B 参数模型时,SPADE 在八个数学、科学、代码与推理基准上平均超过最强固定环境基线 +5.3,BFCL-v4 多轮提升 +5.7,ACEBench-Agent 提升 +13.9。

  8. Hugging Face Daily Papers37

    循环语言模型提升组合式工具调用能力

    研究在 API-Bank、BFCL 和 NESTful 上评测原生与改造后的循环语言模型,发现循环计算在组合式、依赖感知的工具调用上普遍有增益,而在孤立 API 调用上提升较小且更依赖具体模型。多步工具调用准确率通常随循环深度增加而上升,自适应推理则通过按需分配算力实现更优的算力-性能权衡。