跳到正文

开发者平台

项目更新、模型与开源社区动态

当前显示全部 AI 相关新闻
按账号或来源筛选(3)
981 条AI 相关新闻 · 最新在前
10月2日周五
  1. Hugging Face Daily Papers44

    InterEvolve:人形机器人移动操作中奖励程序的测试时进化

    InterEvolve 提出一种测试时进化方法,让人形机器人控制器无需重新训练即可通过重编程现有技能解决新任务。它用 LLM 智能体在上下文中修订奖励程序结构,并由数值优化器调整常数,在并行仿真中验证候选程序。实验表明,InterEvolve 进化出的程序释放了 FB 模型未被充分利用的移动操作能力,进化技能可在物理 Unitree G1 上自主运行。

  2. Hugging Face Daily Papers33

    InFlowOp:无标签的流内多智能体工作流优化方法

    研究者提出 InFlowOp,用一套无标签成本为多智能体工作流的每个决策定价,在任务分解粒度与智能体分配上双向求解,并在执行中按同一成本以最低代价修正故障。同时发布 Braid 基准,其任务需多智能体协作才能完成。在多个领域与骨干模型上,InFlowOp 较单智能体基线最高提升 +11.97%,流内优化带来 +9.64%。

  3. Hugging Face Daily Papers44

    Argo-Bench:评估数据智能体在企业级工作流中的表现

    Argo-Bench 是一个包含 210 个数据科学与分析任务的评估框架,模拟纽约市外卖平台,导出为 235 张表、75 亿行的 ERP 仓库,智能体需先重建事实再执行封禁欺诈账号、分配骑手激励预算等操作,评分依据模拟器中的后果。14 个前沿与开源模型中最强者在仅 34.8% 的任务上得分达 95 以上,平均 59.5 分。

  4. Hugging Face Daily Papers40

    PoS:用显式信念状态增强长时程 LLM 智能体

    研究者提出推理时框架 PoS,为 LLM 智能体构建并持续维护显式信念状态作为决策上下文,每个信念结合当前世界状态估计与未解决的任务需求。PoS 通过一致性校验和任务进度监控检测“Belief Trapping”,并按陷阱模式与未满足需求类型进行恢复。在四个覆盖执行与诊断的基准上,PoS 在三种 LLM 主干下均取得最高整体表现,消融实验验证了一致性校验与恢复机制的作用。

  5. Hugging Face Daily Papers35

    RPTune:面向 LLM 商品目录搜索的学习式上下文整理

    RPTune 是一个端到端框架,将学习式目录整理与 LLM 后训练结合,用自动生成的目录监督信号提升商品搜索。其编码器-重组器整理器依据下游 LLM 反馈对商品排序和剪枝,整理后的目录再通过上下文相对奖励改进后训练。在 7 个真实商家的评测中,上下文整理带来最高 31.4 个百分点的准确率提升,后训练平均再提升 10.3 个百分点。

  6. Hugging Face Daily Papers36

    4Director:用刚性 3D 几何控制视频世界模型

    4Director 是一个以显式 4D 场景表示为条件的视频世界模型,将每个物体从输入图像重建为规范网格,并按每帧一个刚性变换驱动其运动。它把受控场景渲染为深度视频,再通过 Motion Adapter 合成视角一致的外观、光照与非刚性动态。团队构建了含 20,774 个片段的 RealCOD-Rigid 数据集,并提出 IG-IoU 指标,实验显示其在视觉质量与相机、物体控制上均优于此前方法。

  7. Hugging Face Daily Papers47

    AutoGUIWorld:用图像生成器作为 GUI 智能体的视觉世界模型

    AutoGUIWorld 是一个数据生成框架,结合图像生成器的视觉先验与规划器的任务知识,无需部署或运行软件环境即可合成 GUI 交互轨迹。它从操作系统上下文、视觉外观和界面状态的结构化规格中采样初始场景,生成 79,266 条覆盖 Ubuntu、Windows、macOS 和 Chrome 的空间标注步级训练样本。

  8. Hugging Face Daily Papers35

    HC-DLM:分层连续扩散语言模型

    研究者提出分层连续扩散语言模型(HC-DLM),将离散 token 生成与连续隐变量轨迹耦合在单一去噪过程中,训练目标由 token 似然的变分下界推导而来。该模型以隐变量作为唯一持久生成状态,每步从中读出 token 并反馈作为下一步隐变量更新的脚手架。在 Sudoku、Countdown 和 LM1B 上,同等模型规模下 HC-DLM 在谜题准确率和生成困惑度上均优于离散与连续扩散基线。

  9. Hugging Face Daily Papers39

    Pivot-SD:面向掩码扩散语言模型的高效自蒸馏框架

    Pivot-SD 是一个面向掩码扩散语言模型(dLM)的离线自蒸馏框架,仅监督去噪过程中影响最大的高影响承诺(pivots),用信息增益指标筛选这些 pivots。它仅用 200 个问题和每个 4 次 rollout,就在数学与代码基准上让 LLaDA-8B-Instruct 超过全序列 SFT 和同等预算的扩散 RL 基线。该工作入选 EMNLP 2026 主会 Oral。

  10. Hugging Face Daily Papers57

    arXiv 论文揭示 LLM Agent 在搜索决策中偏好特定来源并探讨缓解方法

    arXiv:2610.03195 研究 12 个 Agent 模型在三个领域端到端搜索中的来源偏好,发现各模型都偏好某些来源且结论大体一致。来自偏好来源、但少满足一条要求的商品约三分之二情况下被选中,反向情形则几乎不会;隐藏来源信息或补充缺失信息、加入反偏见提示词可减弱这种偏好。

  11. Hugging Face Daily Papers39

    MetaRubric:面向评分标准强化学习的奖励学习

    MetaRubric 通过交替进行证据感知的策略优化与响应引导的评分标准自适应,解决评分标准强化学习中的"空洞得分"问题——即评分模型在响应缺少所需信息时仍给出高分。该方法在多个基座模型上将 PubMedQA 准确率较静态评判 GRPO 提升 6.00–20.40 个百分点,并在 HealthBench-Hard 及两个多模态医学基准上取得进一步增益。

  12. Hugging Face Daily Papers37

    NAVA-WAM:从视频中学习原生动作先验的世界动作模型

    NAVA-WAM 提出原生动作先验学习,可直接从纯观察视频预训练动作策略,无需间接的表示到控制迁移或独立的潜在动作模型。训练分两阶段:先在观察视频上通过未来视频流匹配监督优化 Action-DiT,再用带动作标注的演示进行视频-动作联合流匹配后训练,非对称注意力支持高效纯动作推理。实验显示其在分布内和分布外场景均持续优于先前方法,并展现出较强的动作标注效率和真实机器人泛化能力。

  13. Hugging Face Daily Papers46

    EyeRobot 2.0:无需腕部相机的主动凝视精准操作

    EyeRobot 2.0 提出用主动凝视实现仅靠单个立体相机的精细双手操作,通过转动两个视点将 3D 注视点居中,并以中央凹方式分配更多视觉 token。该系统在 7 个真实和 6 个仿真任务上采集遥操作数据,完成超 1000 次真机和 1800 次仿真试验,真实成功率比被动立体视觉高 40%、仿真高 20%,在腕部相机被遮挡时成功率 48% 对 22% 实现翻倍以上。

  14. Hugging Face Daily Papers39

    FOVEATED:用聚焦视图提升非结构化知识编辑中的原子事实召回

    针对非结构化知识编辑中"上下文依赖"导致的原子事实召回失败问题,研究者提出即插即用框架 FOVEATED,通过随机偏移前文 key 的 RoPE 位置构造聚焦视图,编辑时施加扰动、推理时移除,不改变模型原生位置编码。该方法在 5 种知识编辑器、2 个 LLM 主干和 3 个基准上取得一致提升。

  15. Hugging Face Daily Papers42

    高效推理训练并不总是损害 CoT 忠实性与可监控性

    研究用固定生成预算、单样本长度目标和组相对长度奖励三种方式对多种模型进行微调,发现高效推理训练对 CoT 忠实性和可监控性的影响不同:忠实性在多数设置下下降,主要因为模型一致性变差;可监控性更稳健,即使 CoT 大幅缩短,模型仍会承认输入干预对答案的影响。

  16. Hugging Face Daily Papers45

    Queen:会下棋并解释走法的 4B 参数语言模型

    研究者推出 Queen,一个 4B 参数的国际象棋语言模型,能在达到典型特级大师水平的同时解释自己的走法和计划。它通过编码器-解码器架构与迭代蒸馏算法训练,经七轮迭代 Elo 从 1782 提升至 2697,涨超 900 分,在棋力和谜题准确率上大幅超越所有前沿模型,参数量却少三个数量级。基于 LM 的评估显示其解释流畅,连贯性接近 GPT-5.6-Sol(high)。

  17. Hugging Face Daily Papers41

    HyperBrowseComp:面向网页浏览智能体的多语言多模态压力测试基准

    HyperBrowseComp 是一个多语言多模态网页浏览基准,包含 423 道由母语者人工编写并验证的问题,覆盖 13 种语言。问题要求定位冷门证据、追踪多步线索或检查视频、扫描文档、图像、地图等异构来源,并通过无联网模型评估过滤掉简单题。研究在统一智能体协议下用厂商原生搜索和共享外部检索工具评测多个模型,并对部分问题开展人类评估。

  18. Hugging Face Daily Papers39

    4DCodeBench:用代码生成评测智能体的动态场景逆图形学能力

    4DCodeBench 是一个通过代码生成评测 4D 逆图形学的基准,要求智能体从视频中重建动态场景并输出可执行的图形程序。该基准涵盖形变、流体流动、断裂等多种物理现象的真实与合成场景,对前沿模型的大规模评测显示,强大的静态重建能力尚不能转化为对复杂动态的可靠重建。