跳到正文

开发者平台

项目更新、模型与开源社区动态

当前显示全部 AI 相关新闻
按账号或来源筛选(5)
1,080 条AI 相关新闻 · 最新在前
8月28日周五
  1. Hugging Face Daily Papers48

    GameWAM:面向视频游戏的世界动作模型

    GameWAM 是首个面向原生闭环游戏与 GUI 控制的世界动作模型(WAM),通过并行视觉与动作生成过程同时预测未来视觉观测和可执行的键盘鼠标轨迹。它按动作步预测游戏/GUI 模式,并用 block-cycle 控制协调预测、执行与上下文以支持长时程交互,实验中以更少的原生动作执行次数取得有竞争力的任务成功率。研究还发现低频动作源印记(LASI)这一生成控制的源敏感失效模式。

  2. Hugging Face Daily Papers41

    基于智能体推理的多镜头长视频一致性编辑框架 MMLVE-Agent

    研究团队提出 MMLVE 任务与 MMLVE-Agent 框架,用 LLM 与 VLM 协同实现镜头级视频解耦和指令解析,解决长视频多指令编辑中的实体碎片化与编辑幻觉问题。团队同时构建了 MMLVE-Bench 数据集及三项评测指标,实验显示该框架优于 Seedance 2.0 等闭源 SOTA 方案,消除了编辑幻觉并保持跨镜头一致性与时空过渡。

  3. Hugging Face Daily Papers48

    PAWBench:视频生成模型距离概率对齐的世界建模还有多远?

    研究提出 PAWBench 基准与 PAWEval 评估协议,将概率对齐形式化为世界模型的分布级判据,用重复生成视频的经验分布检验模型能否还原同一初始观测与动作下的行为概率分布。在 50 个场景、11 个现有系统上,没有模型能同时稳定匹配参考概率并覆盖有效行为范围。研究还测试了语言提示词、初始噪声采样与模型训练能否重塑模型的预测分布。

  4. Hugging Face Daily Papers36

    Self-OPD:无需教师模型的流匹配模型同策略蒸馏

    Self-OPD 提出一种无需教师模型的流匹配模型同策略蒸馏框架,将学生模型自身的探索转化为逐步监督信号。该方法在每个时间步将确定性下一状态预测分支为 K 个随机 SDE 候选,用 ODE 采样器展开并与确定性自参考基线比较奖励,得到归一化优势,再以全分支 pull-push 目标优化速度场。在单一与混合奖励基准上,Self-OPD 无需任务专用教师即优于此前的 RL 与 OPD 方法。

  5. Hugging Face Daily Papers30

    什么才是好的智能体数据?ACE 视角下的 LLM 智能体数据生成

    一篇 arXiv 论文提出用两级框架梳理 LLM 智能体的数据生成:把智能体数据表示为(环境、任务信号、交互实现、可选验证器)的因子化对象,并按主要锚点与依赖结构归类生成范式。作者进一步提出 Accuracy-Complexity-divErsity(ACE)视角,将生成视为受约束的分布设计,分别对应可行支撑、相对学习者的难度与覆盖冗余控制。

  6. Hugging Face Daily Papers41

    UrbanGround:MLLM 智能体如何在真实尺度城市中从局部感知走向空间行动

    研究者提出 UrbanGround,一个基于香港全境 3D 地理空间数据构建的城市沙盒,让 MLLM 智能体通过第一人称观察和交互地图执行从局部问答到长程导航的任务。测试显示,智能体在视觉识别和短距离空间推理上具备可用的原子能力,但方向感和行人感知移动仍不可靠。核心失败出现在长时程探索中:局部能力无法组合成持续的目标导向行为,错误不断累积且缺乏有效纠正。

8月27日周四
8月26日周三
  1. Hugging Face Daily Papers41

    CyberFactory:用真实漏洞实例扩展网络安全能力,并发布 Aegis 模型

    开源框架 CyberFactory 将 CVE 等公开漏洞产物转化为可执行、可验证的任务实例,覆盖 PoC 生成、漏洞修补与 CyberQA,并用可复用的漏洞分析技能引导教师模型完成源码审查与证据验证。基于其合成的智能体轨迹训练出的 Aegis 模型在 CyberGym 上一小时预算下 Pass@1 达 52.4%,较 Qwen 3.5 基座提升 22.8 分,且推理时无需该技能。

  2. Hugging Face Daily Papers37

    LAWA:用潜在动作作为意图,为世界动作模型实现高效未来想象

    LAWA 是一种世界动作模型(WAM)架构,用紧凑的潜在动作表示未来意图,在推理时无需生成未来观测即可完成未来想象。在 RoboCasa 上,LAWA 在少样本和全量数据设置下分别取得 65.6% 和 80.8% 的平均成功率,较匹配的 Fast-WAM 基线提升 9.6 和 4.5 个百分点,同时推理延迟比匹配的 Joint-WAM 变体低 42.9%。

  3. Hugging Face Daily Papers27

    从看到做:智能眼镜作为第一人称智能平台综述

    一篇综述首次用统一框架系统研究智能眼镜,将其定义为连接人类感知、持久上下文与数字或物理动作的第一人称智能平台。文章提出 L0-L5 能力框架,覆盖采集、反应式感知、情境辅助、持久状态、受治理动作与具身耦合,并沿八项可验证硬件能力轴刻画设备。核心挑战不在模型能否单独识别、回答、记忆或行动,而在于完整系统能否维持可靠、时序有效、可纠正且可治理的感知-状态-交互-动作闭环。

  4. Hugging Face Daily Papers35

    无需训练的长度自适应解码:Entropy-Valley 提升掩码扩散机器翻译

    研究者提出 Entropy-Valley(EV),一种无需训练的长度选择器,通过全掩码前向传播的平均预测熵为候选目标画布打分,选出骨干模型最易填充的长度。相比基于训练语料长度统计的基线,EV 在 En→Zh、Zh→En、En→De 上分别恢复了参考目标长度所带来 COMET-22 增益的 64.9%、65.3% 和 33.0%。

  5. Hugging Face Daily Papers32

    OPDVR:用可验证奖励改造 on-policy 蒸馏,无需额外超参数

    研究者提出 OPDVR,将 on-policy 蒸馏(OPD)与可验证奖励强化学习(RLVR)无缝结合且不引入任何额外超参数。该方法先基于轨迹正确性重构采样 token OPD 的隐式奖励,再用 ReLU 门控让正确轨迹获得非负奖励、错误轨迹获得非正奖励,从而把采样 token OPD 变成标准 RLVR 方法,可直接搭配 GRPO 等策略梯度算法。

  6. Hugging Face Daily Papers36

    DiffusionOPSD:扩散模型中的同策略自蒸馏框架

    研究提出 DiffusionOPSD 同策略自蒸馏框架,将图像级奖励引导转化为去噪中间预测的显式监督目标,在 SD 3.5-M 和 Z-Image-Turbo 上于 20 个奖励匹配设置中的 19 个取得最佳最终留出分数,最高超越最强对比方法 44.0%。相比 DiffusionNFT,训练 GPU 时长在 SD 3.5-M 上减少 40%、在 Z-Image-Turbo 上减少 63%。

  7. Hugging Face Daily Papers45

    Meta^n:通过涌现深度实现递归自我改进

    Meta^n 提出一种保持元操作 Ω 固定、对其自身产物递归的自我改进方法,深度由收敛而非预设决定,并用进化档案搜索层链。在两个骨干模型上,Meta^n 在全部八个基准系列上超越此前的自我改进智能体,在 ARC-AGI-2 上是唯一得分高于零的方法。消融实验显示递归收益主要来自各层传递给下一层的条件信息,且随深度涌现出未被提示词规定的层角色。

  8. Hugging Face Daily Papers43

    LongRCA Bench:诊断长时程智能体失败中的责任角色与根因

    研究者推出 LongRCA Bench,包含来自五个来源的 1,140 条完整失败轨迹,全部人工标注责任角色与最早决定性根因步骤,参考根因距任务完成中位数为 48 步,28.4% 的轨迹后续步骤超过 100 步。在 DeepSeek-V4-Flash 上,五个基线中最强者仅达 13.2% 根因步骤精确准确率;提出的免训练方法 RCTA 将这一指标提升至 24.1%,责任角色准确率达 51.1%。

  9. Hugging Face Daily Papers50

    论文提出前缀不变性审计方法,在 Zamba2 和 Nemotron-H 中定位因果性缺陷

    研究提出一种前缀不变性审计方法,只需两次前向传播、无需训练或梯度,即可给出逐层分数定位因果性断裂位置。在八个 checkpoint 的 192 次注入故障试验中,掩码检查未检出任何一例,该审计将 192/192 全部定位到确切层。对 transformers 分块扫描代码的静态与动态分析还在 Zamba2 和 Nemotron-H 中发现同一跨块轴错误,并通过参考实现修复。