跳到正文

Hugging Face Daily Papers

huggingface.co · 开发者平台

当前显示全部 AI 相关新闻
切换来源
766 条AI 相关新闻 · 最新在前
8月25日周二
  1. Hugging Face Daily Papers51

    EchoWM:可进入的全模态世界模型,联合生成 720p 视频与音频

    EchoWM 是一个全模态世界模型,面向可进入的生成式媒体,在连续导航下联合生成 720p 视频、环境声音、音乐和语音。它围绕摄像机意图组织交互,把离散指令与连续位姿映射到统一的米制尺度相对 6-DoF 轨迹,并通过数据引擎、渐进训练和自回归后训练支持长时程生成。公开世界模型基准上的评测显示其轨迹跟随与视觉质量较强,可支持第一人称和第三人称交互,并保持环境声音与语音的同步。

  2. Hugging Face Daily Papers37

    Block3D:基于分块扩散的高效文本到 3D 生成

    Block3D 是一种分块扩散框架,将离散形状 token 序列切分为连续块,自回归逐块生成并联合去噪块内所有 token,同时引入置信度引导的块内修正来缓解误差累积。在 TRELLIS-500K 的留出集上,Block3D 将平均端到端生成时间从 25.71 秒降至 4.99 秒,相比微调后的自回归基线实现 5.15 倍加速,且不牺牲几何保真度。

  3. Hugging Face Daily Papers39

    MobilePA-Bench:面向复杂真实任务的移动规划智能体基准测试

    MobilePA-Bench 是一个交互式、有状态、以工具调用为核心的移动规划智能体基准,运行在可执行沙箱中,覆盖 13 个功能领域和 212 个真实移动工具。除基础工具使用外,它还从子智能体协作、记忆使用和技能使用三个维度评估规划智能体。实验显示,当前前沿 LLM 在严格工具顺序、权限限制和运行时错误下表现明显下降。

  4. Hugging Face Daily Papers30

    通过概念缩放与密集监督释放图像编辑潜力

    针对图像编辑中编辑概念粒度关注不足与稀疏监督导致训练低效的问题,研究者构建了包含超 1,000 个细粒度编辑概念的分层分类体系,并通过改进的合成框架搭建了 1,200 万高质量编辑对数据集 ConceptEdit-12M。同时提出密集监督训练策略,将多个互不干扰的概念合成到单张图像对中,显著提升训练效率与模型性能,并推出细粒度评测套件 ConceptEdit-Bench。

  5. Hugging Face Daily Papers49

    ReWorld:具备长时记忆的交互式世界模型

    ReWorld 是一个交互式世界模型,通过混合注意力窗口与随机头路由分离控制与记忆,推理时用固定预算的 KV cache 加姿态索引地标库实现长时记忆。它经 LoRA 分布匹配蒸馏将采样压缩至 4 步,可实时流式生成 704x1280 视频。在 64 秒往返 rollout 中,其 12 chunk 固定缓存仍能重建起始视角,旋转误差 11.95°。

  6. Hugging Face Daily Papers35

    TLive-Omni:面向电商直播的全模态理解模型

    研究团队提出 TLive-Omni,一个面向电商直播场景的全模态理解模型,可将图像、视频、音频和文本映射到统一表示空间。该模型引入 Per-vGrid 时间戳 token 组织方式实现音视频时间对齐,并采用三阶段监督训练加 Faithful-RFT 强化微调,在电商直播基准上表现强劲,同时在通用基准上保持良好泛化能力。

  7. Hugging Face Daily Papers41

    WorldMind:面向状态感知 NPC 行为的解耦游戏世界模型

    WorldMind 是首个面向游戏世界模型的解耦式状态感知 NPC 行为框架,将交互式世界建模拆分为理解、决策、控制与生成四层,并通过闭环重连让 NPC 行为锚定在不断演化的游戏状态上。团队同时发布 BOSS-140K 数据集及可规模化自动采集的智能体,实验显示其能可靠重建紧凑状态并完成基于机制的规划,在约 70% 的成对比较中因 NPC 行为更具战术性与连贯性而优于基线。

  8. Hugging Face Daily Papers34

    PhysCaP:用物理信息探索为 Code-as-Policy 智能体打基础

    PhysCaP 是一个面向机器人操作的物理信息 Code-as-Policy 智能体,通过引入物理信息探索层,让智能体以交互方式主动获取信息。它包含无需训练的属性提取模块,仅凭机器人本体感知即可估计物体质量与刚度,并采用 Planner 与 Prioritizer 双智能体设计平衡探索成本与信息效率。

8月24日周一
  1. Hugging Face Daily Papers44

    Hydra-0:面向通用世界建模与控制的动作流

    Hydra-0 是一个以动作流为条件的通用世界模型,将机器人动作表示为像素运动,从而跨本体、任务、环境和视频生成骨干学习动作后果。其最佳配置相比动作条件基线将机器人运动误差降低 90.4%、物体运动误差降低 60.2%,并在 RoboLab 基准上实现重放与参考成功率之间 r=0.96 的 Pearson 相关性。

  2. Hugging Face Daily Papers44

    PV-SST:同行投票 LLM 智能体压力测试发现信息流引发词汇趋同,但分布式来源无可靠匹配曝光优势

    研究者提出 PV-SST 同行投票社交平台测试床,用 448 次试验、112 个模型×话题×种子区块检验 LLM 智能体群体行为。相比仅给话题的对照组,按同行点赞排序的往轮帖子信息流提升了最终轮词汇相似度(核心面板 +0.0082 TF-IDF 余弦,p=0.000105;更大变体 +0.0109,p=0.000001),但该对比混合了曝光与排序,无法单独识别排序效应。

  3. Hugging Face Daily Papers38

    ParaTempo:用时间置信度实现高效并行推理

    ParaTempo 是一个免训练的异步并行推理框架,以分支局部的"时间置信度"(对答案空间收敛程度的度量)驱动全部控制流程:低置信度分支被剪枝、持续收敛的分支提前退役、释放的算力用于派生新分支,置信度加权投票集中后全局停止生成。在数学与科学推理基准上,该方法平均延迟降低 21.8-32.2%,token 总用量减少 18.1-30.3%,同时保持有竞争力的准确率。代码与数据集已公开。

  4. Hugging Face Daily Papers29

    基础模型时代的人本智能:一篇综述

    一篇综述提出全谱系人类上下文分类法,将人本智能划分为六个相互关联的层级:作为可观察主体(视觉外观与空间几何)、作为动态行动者(运动动力学与交互建模)、作为情境智能体(世界模拟与具身能动)。文章梳理了该领域的数据家族、计算架构范式与代表性训练和推理优化策略,并系统整理了相关数据集、benchmark 与评测指标,同时讨论了可扩展、可信、物理落地且可部署的开放挑战与方向。

  5. Hugging Face Daily Papers31

    EviRank:面向多模态图像重排序的结构化相关性证据

    EviRank 将多模态图像重排序重构为语义约束满足问题,把纯文本、纯图像或组合查询解析为统一证据包:覆盖实体、属性、关系等六类语义槽位的类型化标准,并标注为必需、禁止或可忽略。该方法在文本到图像、图像到图像和组合图像检索五个基准上取得 SOTA,且无需训练;其蒸馏出的轻量学生模型以显著更低成本保留教师模型 90% 以上能力。

  6. Hugging Face Daily Papers36

    每枚硬币都有两面:大语言模型在线策略蒸馏中泛化性的双重本质

    一项受控研究发现,在线策略蒸馏(OPD)传递的是教师的推理行为而非具体答案,训练难度几乎不影响效果,连教师从未解决的问题也有用。迁移效果强烈依赖师生同源关系:同源组合能让学生在跨语言、推理范围甚至其他领域上接近教师,跨源组合则基本只拟合训练分布。这种广泛影响是双刃剑——按领域路由提示词无法限制各教师的影响,多教师组合会在能力间形成依赖混合比例的跷跷板效应。

  7. Hugging Face Daily Papers39

    OmniAssistBench:面向 Omni-LLM 的助手式交互基准

    研究者推出 OmniAssistBench,用于评测 Omni-LLM 作为实时视频助手的交互能力,通过逆向拆解互联网视频构建多轮交互数据,耗时超 1000 专家人时。测试中 Gemini-3-Pro 得 66.4 分(满分 100),开源 Qwen3-Omni-Instruct 得 51.2 分。模型普遍能理解用户输入,但在手势等视觉提示、多轮历史上下文保持和延迟到目标事件再响应上仍频繁出错。

  8. Hugging Face Daily Papers33

    RecVerse:面向电商用户购物行为忠实模拟的 GUI 智能体

    针对 LLM/VLM 用户模拟器难以复现真实购物会话的问题,研究者提出 GUI 智能体 RecVerse,通过截图感知页面并生成多轮轨迹。它采用工作记忆、情景记忆与偏好记忆构成的分层记忆机制,并以轨迹级 RL 目标对齐真实用户的动作分布与购物意图。团队同时发布交互式电商 GUI 轨迹数据集 USB,实验显示 RecVerse 在行为保真度与意图一致性上显著优于现有基线。