跳到正文

开发者平台

项目更新、模型与开源社区动态

当前显示全部 AI 相关新闻
按账号或来源筛选(5)
1,024 条AI 相关新闻 · 最新在前
9月24日周四
  1. Hugging Face Daily Papers41

    基于检索的开放式评估在哪里失败?从长篇医学答案事实性验证自动归纳分类体系

    研究针对基于检索的医学事实性评估,基于 MedExpert 开放式数据集和 3 个封闭式数据集构建了两套分类体系,将失败拆解为检索阶段五个质量维度的错误与验证器推理的六个连续步骤。团队用 LLM-as-Judge 自动归纳模式,在 4 种检索方法和 6 个前沿验证模型上压力测试,发现扩大模型规模、增加推理投入、扩展权威网络来源和医学微调均无法消除这些失败模式。

9月23日周三
  1. Hugging Face Daily Papers41

    NowWAM:用去噪替代未来预测的机器人控制生成式适配

    研究提出 NowWAM,一种无需未来目标的协同训练方法,直接对当前观测去噪并从同一视觉流预测机器人动作,将生成式目标与动作表征耦合。在 LIBERO-Plus 上,NowWAM 搭配 FLUX2-Klein 达到 87.7%,较未来目标协同训练基线提升 6.1 分,训练视觉 token 从 784 减至 392,单步时间从 2.85 s 降至 1.63 s,提速 1.8 倍。

  2. Claude Code GitHub Releases74

    Claude Code v2.1.280 发布,Claude Opus 5.5 成为默认 Opus 模型

    Claude Code v2.1.280 加入 Claude Opus 5.5(claude-opus-5-5)作为默认 Opus 模型,1M 上下文,$4/$20 per Mtok,cache reads $0.20/Mtok;Pro 和 Team Standard 计划默认模型由 Sonnet 改为 Opus。

    推荐理由:发布日志列出 Opus 5.5 成为默认模型及其定价上下文,并包含大量修复与 VSCode 新对话框,读者可对照更新自己的工作流。

9月22日周二
  1. Hugging Face Daily Papers40

    OSWorld-Pro:面向计算机使用智能体的过程式评测基准

    OSWorld-Pro 是一个面向计算机使用智能体(CUA)的过程式评测基准,包含 300 多个任务、2800 多个子目标,基于 67000 多条人工标注,用人类对齐的 LLM-Judge 评估子目标完成情况。该基准对 SOTA 模型仍有挑战,Claude Opus 5 仅得 75.7%,低于其在 OSWorld 上的 83.4%。研究还识别出子目标无关操作、点击类错误等过程性失败模式。

9月19日周六
9月18日周五
9月17日周四
9月16日周三
9月15日周二
  1. Hugging Face Daily Papers40

    ReactHuman:面向具身多模态 LLM 类人反应式决策的物理基准

    研究者推出 ReactHuman,首个面向具身多模态 LLM 类人反应式决策的物理基准,让模型充当仿真人形机器人的大脑应对突发家庭危险,覆盖 17 类事件、超 1000 个可逐位复现场景,真值来自 240 Hz 刚体仿真。评测 7 个代表性 MLLM 显示,模型约每 3 个危险就处理错 1 个,依赖固定倾向而非观察场景、轻信外观而非运动,且这些失败不随模型规模缩小。

9月14日周一
  1. Hugging Face Daily Papers39

    无大纲学习:任务无关的环境预处理

    研究提出"任务无关的环境预处理"设定:LLM 智能体在测试前、不知下游任务分布的情况下,自主探索陌生环境并产出可复用产物供冻结的求解器使用。在六个异构基准上,配备归档的 meta-agent 变体在五个基准取得最高 Avg@3 奖励,固定语料处理在最大语料基准上仍最优;更大的研究预算并未稳定提升下游奖励,但研究产物可减少达到既定分数所需的测试时采样次数。

  2. Hugging Face Daily Papers33

    TRACE:面向高效 GUI 智能体的轨迹鲁棒准入与证据排序框架

    TRACE 是一个免训练的 GUI 智能体视觉 token 剪枝框架,通过布局交互先验、指令相关性与特征新颖度对视觉证据排序,并预留预算保留原生视觉 token 以修复空间覆盖。其嵌套 token 顺序与单调 KV 收缩机制让保留证据可随预算单调缩减并在整条轨迹中复用,避免重复视觉编码。在六个 GUI benchmark 和多种模型上验证了紧预算下的有效性,源码将开源。

  3. Hugging Face Daily Papers31

    有限反馈下基于 LLM 专家的在线学习

    研究在反馈预算有限(m ≪ T)的在线场景下,将提示词自适应路由到多个 LLM 专家以最大化回答质量,并建模为含 K 个专家动作、d 维提示词特征的 bandit 问题。所提算法在全信息设定下达到 Õ(dT/√m) 的 regret,在 bandit 设定下达到 Õ(dT√(K/m))。实验表明其能从有限反馈中高效学到跨多种 LLM 的高质量路由策略。