跳到正文

Hugging Face Daily Papers

huggingface.co · 开发者平台

当前显示全部 AI 相关新闻
切换来源
809 条AI 相关新闻 · 最新在前
9月3日周四
  1. Hugging Face Daily Papers50

    研究提出 ASPIRE 基准,测试模型能否从模糊目标中自我进化

    研究团队提出 ASPIRE 基准,考察模型能否仅凭一句自然语言能力目标完成自我进化,下游评测任务对智能体保持隐藏。智能体需自行选择数据与更新方法、构建训练和验证信号并决定何时评测,基准同时支持模型权重与 agent-harness 两条进化路径,并在覆盖六个目标的 520 条隐藏专家题目上评测。

  2. Hugging Face Daily Papers44

    Kirin:从野外视频生成动物动作

    研究团队提出 Kirin 框架,可从野外动物视频重建 3D 动作、大规模学习动作先验并生成可直接用于动画资产的真实动作。团队基于大量野外视频构建了 AiM3D,这是首个面向四足动物、提供对齐视频-文本-动作三元组的大规模数据集。其视觉引导动作生成模型以文本和图像为条件,结合现成图像到 3D 模型自动绑定并驱动 3D 网格,生成可直接渲染的动画动物。

  3. Hugging Face Daily Papers44

    Pixel Linguist II:像素文本表示学习的设计基础

    研究通过系统性消融实验确定鲁棒视觉文本表示学习的四个关键要素:可变图像分辨率与渲染字号、自然图文对、布局感知渲染、两阶段多语言课程。据此训练的 Pixel Linguist II 采用原生分辨率与实时渲染,在 2.8 亿训练样本上完成多语言课程训练,在英文、跨语言及多语言 Visual STS 与 ViDoRe 上取得新的 SOTA,并在 80% 视觉 token 压缩下保持稳健。

  4. Hugging Face Daily Papers40

    Cliff:从第一个错误中学习过程奖励

    针对 RLVR 依赖粗粒度结果奖励、对中间推理过程指导不足的问题,研究者提出奖励塑形策略 Cliff,用现成 LLM 作为教师识别每条 rollout 中的第一个错误,将轨迹拆分为正确前缀与错误后缀,并转化为 token 级优势。在 12 个场景的实验中,Cliff 持续提升推理表现,分别超过 on-policy distillation 15%、标准 GRPO 7%,即使教师模型能力一般也有效。

  5. Hugging Face Daily Papers41

    PaperCompiler:通过仓库级规格编译实现忠实的论文到代码生成

    PaperCompiler 将论文证据编译为显式的仓库级实现规格,保留来源溯源并区分论文支持、推断、外部委托和未解决信息,规格中编码非退化要求、归属分配、跨文件依赖和文件级约束。在 Paper2CodeBench 上,其基于参考的忠实度相对提升 13.8%(从 3.64 到 4.15),高严重度评估批评从 13.2% 降至 6.1%。

  6. Hugging Face Daily Papers69

    SolarWM:为长时程视频世界模型提供开放数据与可扩展训练

    论文提出 SolarWM,一个完全开放的视频世界模型基础,覆盖从数据准备到长时程推理的全流程。其数据引擎把 10 个数据集的 143 万条片段统一为帧对齐格式,并在共享接口下基于 Wan2.2、LTX-2.5 和 MiniMax-H3 实例化四个 5B 至 33B 模型。模型仅用 5 秒序列训练即可支持分钟到小时的实时交互 rollout,数据、流程、配方、权重与框架均已开放。

  7. Hugging Face Daily Papers40

    CoGR:用强化学习让生成式检索器查询侧与物品侧协同进化

    CoGR 是一个让 LLM 在查询侧和物品侧直接生成关键词表示的检索框架,关键词通过倒排索引匹配,兼容现有检索基础设施。它采用两阶段训练:先监督微调建立对齐的关键词空间,再用 GRPO 交替优化两侧生成器,物品侧使用反事实边际奖励。在内部 APP Marketplace 数据集和公开 WANDS 基准上,CoGR 的 F1 分别比最强基线提升 10.9% 和 36.1%。

  8. Hugging Face Daily Papers48

    LLM 智能体持久记忆存在内生授权洗白风险,EAL-Bench 揭示最高 50.2% 虚假授权

    研究提出"内生授权洗白"概念:LLM 智能体的持久记忆若错误记录权限变更,可在无外部攻击下凭虚假授权执行未授权操作。新基准 EAL-Bench 测试显示,增量记忆更新下写入方为最高 50.2% 的未授权请求创建虚假权限,执行方在 98.6% 的试验中照此行动。要求权限有有效源事件背书、用有界事件溯源追踪权限变更可大幅降低洗白,但也会拒绝更多合法操作,形成安全与效用的权衡。

  9. Hugging Face Daily Papers51

    RealSWE:真实用户请求下的编码智能体组合式评测基准

    RealSWE 提出由 SWE-bench Verified 与 Pro 衍生的 381 个多变量任务族,用于评测真实用户请求风格下的编码智能体。对真实提示词与基准问题的对比显示,只含问题陈述的请求占真实提示词的 88%,在基准问题中仅占 7%;87% 的真实提示词为随意书写,而 94% 的基准问题为正式书写。

  10. Hugging Face Daily Papers45

    研究发现:中等训练阶段的知识蒸馏更利于推理而非事实记忆,提出 Switch Distillation 方法

    基于 logit 的知识蒸馏在中训练阶段会拖慢事实记忆的习得,但推理能力仍持续提升,原因是教师模型对程序性数据更有信心、而学生模型更早掌握低熵事实知识。为此提出的 Switch Distillation 以教师预测熵为路由信号,仅在教师有信心的 token 上蒸馏,其余回退到交叉熵。

  11. Hugging Face Daily Papers40

    通过非结构化数据自适应结构化实现 Token 高效的数据推理智能体

    研究者提出 agentic data cracking,让智能体在推理过程中顺带将非结构化数据自适应、推测性地结构化,从而减少重复打开文档的开销。在 FanOutQA 上每道测试题仅扩展一个相关问题,该方法在保持准确率的同时将成本降低 53%;而理想预结构化存储的推理成本可低 28 倍。

  12. Hugging Face Daily Papers37

    腾讯混元联合北电、北大发布 DramaChain Bench:首个覆盖短剧生成全链路的端到端评测基准

    腾讯混元联合北京电影学院、北京大学等发布 DramaChain Bench,这是首个覆盖剧本、分镜、关键帧、镜头级视频到成片全链路的短剧生成评测基准。该基准基于 DramaChain Dimensions 的 5 个评估轴、63 个叶子维度构建,由 3 位专业标注员对 5,785 个条目独立打分,产出 17,488 条有效评分和 255,925 条可追溯归因记录。

9月2日周三
  1. Hugging Face Daily Papers47

    AI 自我改进的递归临界性:论文提出 R_AI 判据

    一项研究提出递归再生数 R_AI,用于判断 AI 研发反馈是否会在开发周期中自我放大:R_AI>1 时改进效果跨周期累积,R_AI<1 时则逐周期衰减。该转变取决于 AI 研发反馈回路的结构,而非某个特定的模型能力水平,因此系统可能在加速显现之前就已进入自我放大状态。模型还显示,跨机构共享的改进可使整个研发生态具备自我放大性,即便单个参与者并非如此。

  2. Hugging Face Daily Papers30

    Pera:面向持久智能体的以感知为中心架构

    研究者提出以感知为中心的持久智能体架构 Pera,将语言智能体从解决用户指定的有限任务,转向在长期场景中提供持续服务。Pera 围绕感知与控制组件,持续捕捉任务执行、内部上下文和环境变化中的服务相关信号,并据此构建生命周期任务,驱动服务流程持续运行与自适应。该工作用 Pera 回溯梳理近期研究、开展案例研究,并提出构建更强持久智能体的前瞻性见解。

  3. Hugging Face Daily Papers49

    Qwen-Drive-1.0:面向自动驾驶的视觉语言基础模型首步

    阿里发布 Qwen-Drive-1.0,一个面向自动驾驶的视觉语言基础模型,在统一框架内整合 3D 感知、视觉问答与运动规划。模型保留预训练 VLM 架构,通过外部 BEV 感知头联合执行 3D 目标检测、语义占用预测和 BEV 地图分割,并由规划专家生成未来自车轨迹。实验显示其在保持通用视觉语言能力的同时具备较强 3D 感知与驾驶场景理解,开环、伪闭环和闭环评测中运动规划表现具竞争力。

  4. Hugging Face Daily Papers52

    UI-Venus-2 技术报告:统一闭环框架的通用 GUI 智能体

    UI-Venus-2 是一个通用基础 GUI 智能体,通过统一的闭环推理动作框架在移动、网页和桌面环境运行。为贴近实际部署,论文从环境、任务和验证三个维度扩展:环境覆盖 170 多个多语言移动应用与原生桌面操作系统,任务侧用深度研究流程生成基于功能的指令,验证侧采用 trace-level 与 sample-level 评估器,结合视觉关键点和多模型投票提供可靠 RL 信号。

  5. Hugging Face Daily Papers39

    H3-World:把 33B MiniMax-H3 视频生成器变成交互式世界模型

    H3-World 将 33B MiniMax-H3 视频生成器改造为交互式世界模型,把自然语言指令转化为精确的、时间对齐的角色与镜头控制,且不引入专门的动作模块。它通过时间注意力路由限制每条指令的作用区间以减少控制泄漏,仅用 8,000 个游戏样本、10,000 步 LoRA 优化和 0.199% 可训练参数即实现有效控制,并保持生成质量、可泛化到未见场景。

  6. Hugging Face Daily Papers41

    Control-Data Flow Separation:多智能体 LLM 的稳定提示词优化方法

    针对多智能体 LLM 系统中提示词同时承担内容生成与执行协议两种角色、优化时易破坏路由与格式协议的问题,研究者提出 control-data flow separation,将执行关键的控制逻辑表示为带类型、可验证的程序对象,任务相关语言则保留为可优化的数据流。在合成推理、协作评审生成和保险评级三类工作流中,该框架实现 100% 最终协议有效性,并持续提升任务表现。

  7. Hugging Face Daily Papers42

    DroneCATS 基准评估多模态 LLM 作为无人机控制通用视觉-语言-动作智能体

    研究者提出 DroneCATS-Agent 架构与 DroneCATS 基准,将 MLLM 直接放入无人机控制回路,动作空间仅由提示词声明,无需微调或函数调用。评测覆盖接近可见目标、跟踪移动目标、搜索视野外目标及多无人机编队指挥四项能力,模型规模下探至 2B 参数。结果显示小型开源模型常比前沿模型更可靠地进入成功半径,却因过早或未声明到达而失败,多机指挥中还会盲目复制单一坐标。

  8. Hugging Face Daily Papers41

    原生统一多模态模型中的理解-生成协同:从表征、任务到系统

    研究在无预训练视觉先验的原生统一多模态模型中发现,理解与生成在表征层面可互相提供有用信号,但强制走同一计算路径会导致一方主导。任务解耦架构在保留语义交互的同时专门化冲突的视觉计算,可避免这种不对称退化。系统层面,端到端统一多模态模型在同时需要图像理解与生成的复杂任务上优于匹配的规划器-执行器流水线。