跳到正文

开发者平台

项目更新、模型与开源社区动态

当前显示全部 AI 相关新闻
按账号或来源筛选(6)
1,683 条AI 相关新闻 · 最新在前
8月26日周三
  1. Hugging Face Daily Papers35

    无需训练的长度自适应解码:Entropy-Valley 提升掩码扩散机器翻译

    研究者提出 Entropy-Valley(EV),一种无需训练的长度选择器,通过全掩码前向传播的平均预测熵为候选目标画布打分,选出骨干模型最易填充的长度。相比基于训练语料长度统计的基线,EV 在 En→Zh、Zh→En、En→De 上分别恢复了参考目标长度所带来 COMET-22 增益的 64.9%、65.3% 和 33.0%。

  2. Hugging Face Daily Papers32

    OPDVR:用可验证奖励改造 on-policy 蒸馏,无需额外超参数

    研究者提出 OPDVR,将 on-policy 蒸馏(OPD)与可验证奖励强化学习(RLVR)无缝结合且不引入任何额外超参数。该方法先基于轨迹正确性重构采样 token OPD 的隐式奖励,再用 ReLU 门控让正确轨迹获得非负奖励、错误轨迹获得非正奖励,从而把采样 token OPD 变成标准 RLVR 方法,可直接搭配 GRPO 等策略梯度算法。

  3. Hugging Face Daily Papers36

    DiffusionOPSD:扩散模型中的同策略自蒸馏框架

    研究提出 DiffusionOPSD 同策略自蒸馏框架,将图像级奖励引导转化为去噪中间预测的显式监督目标,在 SD 3.5-M 和 Z-Image-Turbo 上于 20 个奖励匹配设置中的 19 个取得最佳最终留出分数,最高超越最强对比方法 44.0%。相比 DiffusionNFT,训练 GPU 时长在 SD 3.5-M 上减少 40%、在 Z-Image-Turbo 上减少 63%。

  4. Hugging Face Daily Papers45

    Meta^n:通过涌现深度实现递归自我改进

    Meta^n 提出一种保持元操作 Ω 固定、对其自身产物递归的自我改进方法,深度由收敛而非预设决定,并用进化档案搜索层链。在两个骨干模型上,Meta^n 在全部八个基准系列上超越此前的自我改进智能体,在 ARC-AGI-2 上是唯一得分高于零的方法。消融实验显示递归收益主要来自各层传递给下一层的条件信息,且随深度涌现出未被提示词规定的层角色。

  5. Hugging Face Daily Papers43

    LongRCA Bench:诊断长时程智能体失败中的责任角色与根因

    研究者推出 LongRCA Bench,包含来自五个来源的 1,140 条完整失败轨迹,全部人工标注责任角色与最早决定性根因步骤,参考根因距任务完成中位数为 48 步,28.4% 的轨迹后续步骤超过 100 步。在 DeepSeek-V4-Flash 上,五个基线中最强者仅达 13.2% 根因步骤精确准确率;提出的免训练方法 RCTA 将这一指标提升至 24.1%,责任角色准确率达 51.1%。

  6. Hugging Face Daily Papers50

    论文提出前缀不变性审计方法,在 Zamba2 和 Nemotron-H 中定位因果性缺陷

    研究提出一种前缀不变性审计方法,只需两次前向传播、无需训练或梯度,即可给出逐层分数定位因果性断裂位置。在八个 checkpoint 的 192 次注入故障试验中,掩码检查未检出任何一例,该审计将 192/192 全部定位到确切层。对 transformers 分块扫描代码的静态与动态分析还在 Zamba2 和 Nemotron-H 中发现同一跨块轴错误,并通过参考实现修复。

  7. Claude Code GitHub Releases41

    Claude Code v2.1.246 发布

    Claude Code 发布 v2.1.246,为 `/permissions` 新增 Auto mode 标签页,用于查看和编辑 auto mode 分类器规则,并在回合耗时行末尾显示完成时间。该版本还修复了全屏模式缩放后空白、超长单行 diff 导致转录卡顿、后台会话启动失败等问题,并修正 MCP 工具参数在空 schema 下被当作 JSON 字符串发送的错误。

  8. Hugging Face Daily Papers44

    AstroPT 研究:用星系图像揭示 LLM 概念涌现顺序

    研究者用训练于数百万张星系图像的 Transformer 模型 AstroPT 作为校准测试平台,发现星系属性的涌现顺序固定且与已知难度一致:直接写入像素的波段星等训练早期即可解码,红移和比恒星形成率等推断量则出现更晚、位于更深层。该顺序不受测试的训练目标影响,随模型容量在幅度上扩展但顺序不变,线性探针方向还能恢复星系属性间已知的物理结构。

8月25日周二
  1. Hugging Face Daily Papers43

    量化感知修复 QAH:从 GPT-OSS 120B 压缩到 60B MXFP4 的 4-bit LLM 恢复方案

    研究团队提出量化感知修复(QAH),将 4-bit 学生模型直接从原始未压缩模型蒸馏,替代默认的量化感知训练(QAT)。在 GPT-OSS 120B 到 60B 再到 MXFP4 的流水线上,QAH 学生模型在 9 项基准中的 7 项追平或超过其 bfloat16 源模型,权重内存约为原来的 1/4,参数量为教师模型的一半,并以 Hypernova-60B 开源发布。

  2. Hugging Face Daily Papers36

    AutoResearch:让洞察进入、让幻觉退出

    AutoResearch 是一个两阶段自主研究系统,将想法生成与想法执行打通:生成阶段融合新兴研究信号与领域知识,用多模型生成和交叉评审产出可验证的研究计划;执行阶段由智能体拆解实验并做独立证据评审。在 RSICD 基准上,其生成的想法将平均 Recall 从 32.84 提升至 34.69,审计确认的问题事件仅 5 起,其他自主研究系统为 11-27 起。

  3. Hugging Face Daily Papers30

    HQKAN:面向隐私感知联邦生物信号学习的混合量子启发式 Kolmogorov-Arnold 网络

    研究对比了混合量子启发式 Kolmogorov-Arnold 网络(HQKAN)与 MLP 在联邦平均(FedAvg)下进行心电信号分类的效果。在 MIT-BIH 五分类任务上,HQKAN 可训练参数减少 37.35%、通信成本降低 24.89%;在 INCART 三分类任务上分别减少 44.81% 和 36.41%,同时多数聚合指标与少数类指标均有提升。

  4. Hugging Face Daily Papers51

    EchoWM:可进入的全模态世界模型,联合生成 720p 视频与音频

    EchoWM 是一个全模态世界模型,面向可进入的生成式媒体,在连续导航下联合生成 720p 视频、环境声音、音乐和语音。它围绕摄像机意图组织交互,把离散指令与连续位姿映射到统一的米制尺度相对 6-DoF 轨迹,并通过数据引擎、渐进训练和自回归后训练支持长时程生成。公开世界模型基准上的评测显示其轨迹跟随与视觉质量较强,可支持第一人称和第三人称交互,并保持环境声音与语音的同步。

  5. Hugging Face Daily Papers37

    Block3D:基于分块扩散的高效文本到 3D 生成

    Block3D 是一种分块扩散框架,将离散形状 token 序列切分为连续块,自回归逐块生成并联合去噪块内所有 token,同时引入置信度引导的块内修正来缓解误差累积。在 TRELLIS-500K 的留出集上,Block3D 将平均端到端生成时间从 25.71 秒降至 4.99 秒,相比微调后的自回归基线实现 5.15 倍加速,且不牺牲几何保真度。

  6. Hugging Face Daily Papers39

    MobilePA-Bench:面向复杂真实任务的移动规划智能体基准测试

    MobilePA-Bench 是一个交互式、有状态、以工具调用为核心的移动规划智能体基准,运行在可执行沙箱中,覆盖 13 个功能领域和 212 个真实移动工具。除基础工具使用外,它还从子智能体协作、记忆使用和技能使用三个维度评估规划智能体。实验显示,当前前沿 LLM 在严格工具顺序、权限限制和运行时错误下表现明显下降。

  7. Hugging Face Daily Papers30

    通过概念缩放与密集监督释放图像编辑潜力

    针对图像编辑中编辑概念粒度关注不足与稀疏监督导致训练低效的问题,研究者构建了包含超 1,000 个细粒度编辑概念的分层分类体系,并通过改进的合成框架搭建了 1,200 万高质量编辑对数据集 ConceptEdit-12M。同时提出密集监督训练策略,将多个互不干扰的概念合成到单张图像对中,显著提升训练效率与模型性能,并推出细粒度评测套件 ConceptEdit-Bench。

  8. Hugging Face Daily Papers49

    ReWorld:具备长时记忆的交互式世界模型

    ReWorld 是一个交互式世界模型,通过混合注意力窗口与随机头路由分离控制与记忆,推理时用固定预算的 KV cache 加姿态索引地标库实现长时记忆。它经 LoRA 分布匹配蒸馏将采样压缩至 4 步,可实时流式生成 704x1280 视频。在 64 秒往返 rollout 中,其 12 chunk 固定缓存仍能重建起始视角,旋转误差 11.95°。