跳到正文

开发者平台

项目更新、模型与开源社区动态

当前显示全部 AI 相关新闻
按账号或来源筛选(5)
1,080 条AI 相关新闻 · 最新在前
9月1日周二
8月31日周一
  1. Hugging Face Daily Papers31

    CRPO:跨语言排序偏好优化,用英文偏好数据提升多语言对齐

    研究者提出跨语言排序偏好优化框架 CRPO,利用英语偏好知识提升目标语言的偏好对齐,在目标语言与英语的平行偏好对上构建层次结构,联合优化语内与语间偏好。基于 LambdaLoss,CRPO 用多候选回答间的相对排序信号替代二元比较优化。在五种不同资源规模语言上的实验显示,CRPO 在指令遵循和知识利用上均持续优于标准方法,并显著提升奖励边际与理想回答的对数概率。代码已开源。

  2. Hugging Face Daily Papers31

    智能体式制品构建综述:系统、评估、原则与机会

    一篇综述将"智能体式制品构建"定义为AI系统实质性构建或修改交付物、且中间观察结果能改变后续工作的有状态过程,并梳理了截至2026年8月20日的259项工作,其中230个系统符合该定义、29个为评测基准。文章比较六类制品,指出构建难点不仅取决于模态,还取决于决策耦合程度与失败是否在可修复时可见,并提出承诺与责任显式化、将反馈转为定向修复等原则。

  3. Hugging Face Daily Papers36

    Ring Forcing:为自回归视频扩散模型构建精准长期记忆

    研究者提出 Ring Forcing,一个自回归视频扩散框架,通过环状训练策略强制模型从久远历史中检索信息,以兼顾历史一致性与生成多样性。该方法结合压缩与时间步组合策略,在固定序列长度下将有效历史跨度扩展至分钟级,并引入稀疏 RoPE 机制实现可扩展的记忆适配。实验显示其在分钟级连贯性和物体恒存性上显著优于现有最优方法。

  4. Hugging Face Daily Papers32

    用于持续学习的快速权重注意力机制 Fast Weight Attention

    研究提出在读写后自回归语义下推导快速权重记忆的归一化一阶更新,用于平方误差回归与负内积目标。该框架包含 Falcon-1(标量 NLMS 更新)、Falcon-2(逐列扩展)和 Falcon-3(滑动窗口小批量更新),以及对应的内积变体 Falcon-1A/2A/3A,并提供循环、掩码并行与分块并行形式及数值稳定的正衰减重归一化。代表性变体在语言建模中保持竞争力,并在变长数字加法上改善长度外推。

  5. Hugging Face Daily Papers33

    LayerRecall:面向长视频生成长程一致性的状态条件记忆路由器

    LayerRecall 是一种状态条件、按层选择的记忆路由器,将相关历史 K/V 状态仅注入骨干网络中记忆敏感的层,其余位置保留局部注意力。配套提出的 Cross-Horizon Prediction Matching(CHPM)用长上下文参考在预测空间监督有界记忆路由器,减少对高质量长视频和记忆分配标签的依赖。

  6. Hugging Face Daily Papers43

    EASEL:多模态智能体灵巧视觉工具使用基准,25 个模型系统性受挫

    研究者提出 EASEL 基准,以参考图引导的逐步绘画作为灵巧视觉工具使用的主要代理任务,并包含区域标注、手写和路径规划等语义任务。评测 25 个模型显示,重建相似度普遍停留在 0.40-0.54 的低水平,轨迹诊断暴露闭环不稳定问题,模型通常早期饱和或达峰后退化。

  7. Hugging Face Daily Papers40

    J-Zero:从零数据实现 Challenger–Solver–Judge 协同自进化

    J-Zero 是一个统一的 Challenger–Solver–Judge 自进化框架,无需人工标注数据即可在可验证与不可验证领域同时自我提升。Challenger 与 Solver 通过对抗交互共同进化,Judge 则利用预先已知排序的偏好对进行协同适配。J-Zero 在可验证领域平均超越基线 4.2 分、不可验证领域 8.0 分,并可持续改进至少十轮,而基线两轮后即退化。

  8. Hugging Face Daily Papers38

    视频生成模型如何成为几何学习器:GeoNeXt 用下一帧预测统一深度与法线估计

    GeoNeXt 将预训练视频生成模型改造为统一的几何估计框架,把深度和表面法线估计重构为下一帧预测任务,实现图像与几何目标的联合建模。该方法在多个数据集上零样本单目深度和表面法线估计中超越此前的任务专用与统一生成模型,且训练数据量大幅减少。其性能可媲美使用 100 倍以上数据训练的判别式 SOTA 方法,并在若干 benchmark 上表现突出。

  9. Hugging Face Daily Papers41

    ContextPilot:用细粒度强化学习教智能体主动管理上下文

    ContextPilot 是一个面向长程智能体推理的主动上下文管理框架,通过加入规划、长期记忆和软上下文卸载工具扩展了原有工具集,并提出用上下文与熵变化定位关键编辑决策、从分支轨迹估计动作级优势的 RL 方法。在长上下文问答和深度搜索任务上,它以更紧凑的工作上下文持续超越现有基线,代码已开源,论文被 EMNLP 2026 主会接收。

  10. Hugging Face Daily Papers44

    ElephantBench:探测 LLM 在长尾分歧知识下的认知短视

    研究者提出 ElephantBench,一个包含 1,094 道题目的闭卷知识探针,通过可审计的图流程从低曝光网络语料中挖掘自然分歧并转为多答案 QA 记录。在 32 个模型上,最强模型也仅在 52.4% 的题目上同时召回两种说法,其余题目几乎都只答出一种而遗漏另一种。扩大模型规模和增加推理时推理可提升召回,但无法消除这种不完整性。

  11. Hugging Face Daily Papers46

    Code-as-World:用可执行世界表示做物理推理的智能体发现框架

    研究者提出 Code-as-World,将物理世界的组成、动态演化与视觉外观表达为可执行代码,并通过受溯因推理启发的智能体循环完成假设的提出、执行、渲染、验证与迭代精化。基于该框架训练的 Code-as-World-VL 在 QuantiPhy 上取得 SOTA,超过多家领先闭源模型,验证了可执行世界表示作为可扩展物理智能基础的潜力。

8月29日周六
  1. Hugging Face Daily Papers35

    CritICL:利用小模型失败模式实现推理时弱到强泛化

    CritICL 是一种推理时框架,将同族弱模型的失败模式转化为基于批判的上下文示例来提升强模型推理能力,包含动态预测输入相关失败模式并检索批判的 CritICL-dynamic 和使用全局失败模式画像的 CritICL-static 两个变体。实验显示其持续优于标准上下文学习,性能与测试时扩展方法相当或更优,同时生成次数和 token 成本显著更低。

8月28日周五
  1. Hugging Face Daily Papers30

    评估许可证意味着什么?Inspect Evals 中基于提交绑定的主张相对推理普查

    研究冻结了一个大型评估集合,尝试重放其历史主张,发现多数评估单元因重放所需证据未被绑定而中止。在可重放的部分,不同主张在不同分辨率下保持稳定。作者将这一原本隐式的推理步骤显式化并可执行,论文共 36 页,源码归档中包含可移植的复现包。

  2. Hugging Face Daily Papers39

    EditaLive:面向直播的实时角色视频编辑框架

    EditaLive 是一个面向直播场景的实时角色视频编辑框架,基于预训练图像动画模型 Wan-Animate,通过 CharEdit-50K 数据集将其改造为指令式人物视频编辑模型。该框架把离线双向生成改为因果流式生成,并用对齐自 rollout 蒸馏压缩为两步采样器,配合固定 RoPE、align forcing 和首帧保留稀疏注意力,在保持面部表情一致的同时实现低延迟实时流式推理。