跳到正文

开发者平台

项目更新、模型与开源社区动态

当前显示全部 AI 相关新闻
按账号或来源筛选(6)
1,685 条AI 相关新闻 · 最新在前
8月31日周一
8月29日周六
  1. Hugging Face Daily Papers35

    CritICL:利用小模型失败模式实现推理时弱到强泛化

    CritICL 是一种推理时框架,将同族弱模型的失败模式转化为基于批判的上下文示例来提升强模型推理能力,包含动态预测输入相关失败模式并检索批判的 CritICL-dynamic 和使用全局失败模式画像的 CritICL-static 两个变体。实验显示其持续优于标准上下文学习,性能与测试时扩展方法相当或更优,同时生成次数和 token 成本显著更低。

8月28日周五
  1. Hugging Face Daily Papers30

    评估许可证意味着什么?Inspect Evals 中基于提交绑定的主张相对推理普查

    研究冻结了一个大型评估集合,尝试重放其历史主张,发现多数评估单元因重放所需证据未被绑定而中止。在可重放的部分,不同主张在不同分辨率下保持稳定。作者将这一原本隐式的推理步骤显式化并可执行,论文共 36 页,源码归档中包含可移植的复现包。

  2. Hugging Face Daily Papers39

    EditaLive:面向直播的实时角色视频编辑框架

    EditaLive 是一个面向直播场景的实时角色视频编辑框架,基于预训练图像动画模型 Wan-Animate,通过 CharEdit-50K 数据集将其改造为指令式人物视频编辑模型。该框架把离线双向生成改为因果流式生成,并用对齐自 rollout 蒸馏压缩为两步采样器,配合固定 RoPE、align forcing 和首帧保留稀疏注意力,在保持面部表情一致的同时实现低延迟实时流式推理。

  3. Hugging Face Daily Papers48

    GameWAM:面向视频游戏的世界动作模型

    GameWAM 是首个面向原生闭环游戏与 GUI 控制的世界动作模型(WAM),通过并行视觉与动作生成过程同时预测未来视觉观测和可执行的键盘鼠标轨迹。它按动作步预测游戏/GUI 模式,并用 block-cycle 控制协调预测、执行与上下文以支持长时程交互,实验中以更少的原生动作执行次数取得有竞争力的任务成功率。研究还发现低频动作源印记(LASI)这一生成控制的源敏感失效模式。

  4. Hugging Face Daily Papers41

    基于智能体推理的多镜头长视频一致性编辑框架 MMLVE-Agent

    研究团队提出 MMLVE 任务与 MMLVE-Agent 框架,用 LLM 与 VLM 协同实现镜头级视频解耦和指令解析,解决长视频多指令编辑中的实体碎片化与编辑幻觉问题。团队同时构建了 MMLVE-Bench 数据集及三项评测指标,实验显示该框架优于 Seedance 2.0 等闭源 SOTA 方案,消除了编辑幻觉并保持跨镜头一致性与时空过渡。

  5. Hugging Face Daily Papers48

    PAWBench:视频生成模型距离概率对齐的世界建模还有多远?

    研究提出 PAWBench 基准与 PAWEval 评估协议,将概率对齐形式化为世界模型的分布级判据,用重复生成视频的经验分布检验模型能否还原同一初始观测与动作下的行为概率分布。在 50 个场景、11 个现有系统上,没有模型能同时稳定匹配参考概率并覆盖有效行为范围。研究还测试了语言提示词、初始噪声采样与模型训练能否重塑模型的预测分布。

  6. Hugging Face Daily Papers36

    Self-OPD:无需教师模型的流匹配模型同策略蒸馏

    Self-OPD 提出一种无需教师模型的流匹配模型同策略蒸馏框架,将学生模型自身的探索转化为逐步监督信号。该方法在每个时间步将确定性下一状态预测分支为 K 个随机 SDE 候选,用 ODE 采样器展开并与确定性自参考基线比较奖励,得到归一化优势,再以全分支 pull-push 目标优化速度场。在单一与混合奖励基准上,Self-OPD 无需任务专用教师即优于此前的 RL 与 OPD 方法。

  7. Hugging Face Daily Papers30

    什么才是好的智能体数据?ACE 视角下的 LLM 智能体数据生成

    一篇 arXiv 论文提出用两级框架梳理 LLM 智能体的数据生成:把智能体数据表示为(环境、任务信号、交互实现、可选验证器)的因子化对象,并按主要锚点与依赖结构归类生成范式。作者进一步提出 Accuracy-Complexity-divErsity(ACE)视角,将生成视为受约束的分布设计,分别对应可行支撑、相对学习者的难度与覆盖冗余控制。

  8. Hugging Face Daily Papers41

    UrbanGround:MLLM 智能体如何在真实尺度城市中从局部感知走向空间行动

    研究者提出 UrbanGround,一个基于香港全境 3D 地理空间数据构建的城市沙盒,让 MLLM 智能体通过第一人称观察和交互地图执行从局部问答到长程导航的任务。测试显示,智能体在视觉识别和短距离空间推理上具备可用的原子能力,但方向感和行人感知移动仍不可靠。核心失败出现在长时程探索中:局部能力无法组合成持续的目标导向行为,错误不断累积且缺乏有效纠正。

8月27日周四
8月26日周三
  1. Hugging Face Daily Papers41

    CyberFactory:用真实漏洞实例扩展网络安全能力,并发布 Aegis 模型

    开源框架 CyberFactory 将 CVE 等公开漏洞产物转化为可执行、可验证的任务实例,覆盖 PoC 生成、漏洞修补与 CyberQA,并用可复用的漏洞分析技能引导教师模型完成源码审查与证据验证。基于其合成的智能体轨迹训练出的 Aegis 模型在 CyberGym 上一小时预算下 Pass@1 达 52.4%,较 Qwen 3.5 基座提升 22.8 分,且推理时无需该技能。

  2. Hugging Face Daily Papers37

    LAWA:用潜在动作作为意图,为世界动作模型实现高效未来想象

    LAWA 是一种世界动作模型(WAM)架构,用紧凑的潜在动作表示未来意图,在推理时无需生成未来观测即可完成未来想象。在 RoboCasa 上,LAWA 在少样本和全量数据设置下分别取得 65.6% 和 80.8% 的平均成功率,较匹配的 Fast-WAM 基线提升 9.6 和 4.5 个百分点,同时推理延迟比匹配的 Joint-WAM 变体低 42.9%。

  3. Hugging Face Daily Papers27

    从看到做:智能眼镜作为第一人称智能平台综述

    一篇综述首次用统一框架系统研究智能眼镜,将其定义为连接人类感知、持久上下文与数字或物理动作的第一人称智能平台。文章提出 L0-L5 能力框架,覆盖采集、反应式感知、情境辅助、持久状态、受治理动作与具身耦合,并沿八项可验证硬件能力轴刻画设备。核心挑战不在模型能否单独识别、回答、记忆或行动,而在于完整系统能否维持可靠、时序有效、可纠正且可治理的感知-状态-交互-动作闭环。