跳到正文

开发者平台

项目更新、模型与开源社区动态

当前显示全部 AI 相关新闻
按账号或来源筛选(6)
1,634 条AI 相关新闻 · 最新在前
9月30日周三
  1. Hugging Face Daily Papers36

    APM-Bench:面向第一视角流式视频助手的跨会话持久记忆基准

    研究者推出 APM-Bench,将真实流式交互重构为多会话生活轨迹,包含 549 个会话、104 条轨迹和 2,719 个候选问题,用于评测流式视频模型的跨会话持久记忆。评测显示现有方法存在明显的效用—延迟—存储权衡,难以同时实现可靠的长期召回、低开销和有效的主动协助。

  2. Hugging Face Daily Papers46

    ReImaGin:用图像生成模型为多模态 LLM 提供灵活视觉推理能力

    多模态 LLM 推理框架 ReImaGin 提出用图像生成模型替代深度估计、目标检测等固定功能视觉工具,通过自然语言指令完成去遮挡、由多视角生成户型图等开放式视觉操作。在包括多视角空间推理和碰撞预测在内的六项视觉推理任务上,ReImaGin 一致优于纯文本推理和专用视觉工具基线,最高提升 25%。该工作已被 COLM 2026 接收,代码与网站已公开。

  3. Hugging Face Daily Papers45

    智能体的主动性问题:水平与垂直主动性及 Q&D 训练方法

    研究提出智能体主动性的新维度——内容主动性,分为水平主动性(追求当前上下文已隐含但未明说的信息)和垂直主动性(追求仅由早期证据揭示的需求)。为此提出 Q&D(提问者与起草者)方法,训练提问者选择能检索更多所需证据的问题,无需奖励模型或评判器。在三个多跳问答基准的留出集上,同等检索开销下,训练后的提问者两种主动性均优于同模型提示版本,并在三个基准中的两个上超过 15 倍大的提示模型。

  4. Hugging Face Daily Papers64

    SEAD:把工具型智能体的攻防建模为部分可观测状态控制

    论文提出 SEAD,将语言模型智能体的攻击与防御统一表述为部分可观测的状态控制问题,并据此分别设计 DART 攻击与 SAGE 防御。攻击侧 DART 把有害目标拆成局部看似合理的步骤,借助真实工具执行反馈引导轨迹搜索,在四个目标模型上语义攻击成功率比对比基线高出 18.8 至 35.9 个百分点。

  5. Hugging Face Daily Papers46

    自然语言自编码器如何挑选最具信息量的 token 位置

    研究基于 470 万条关于提示注入与隐藏行为的解释,比较模型计算信号与仅用聊天结构训练的排序器,发现聊天结构选出的解释通常更相关,且无需前向传播即可完成位置选择。在四个数据集中的三个上,只解释 5% 的位置就能保留解释全部位置时近乎全部的成功率。预训练 verbalizer 还能在无需额外训练的情况下还原模型经微调后学会隐藏的词。

  6. Hugging Face Daily Papers40

    AnyStep-WAM:面向世界动作模型的预算对齐蒸馏与自适应推理

    AnyStep-WAM 通过预算对齐的教师轨迹蒸馏与轻量风险收益调度器,实现从单步预测到多步细化的可调预算动作生成。在 Motus、FastWAM 和 LingBotVA 上,该方法分别减少 60.2%、49.8%、85.28% 的平均去噪步数,同时保持基线任务成功率;单步去噪预算下任务成功率分别提升 7.07%、12.08%、8.94%。六项真实世界操作任务实验进一步验证了其有效性。

  7. Hugging Face Daily Papers45

    SoL-Refiner:一步精修实现 4K 高分辨率视频生成

    SoL-Refiner 是一种一步视频精修器,可将低分辨率模型输出通过单次去噪转换为 4K 视频,其配方结合高分辨率持续训练、强化学习后训练与一步蒸馏。在 2K 分辨率下,该一步方法在 VBench 和 UniPercept 均值上超越所有外部精修器,并在 3840×2176 下优于三步 LTX-2.3 Refiner。配合完整加速方案,其精修延迟相比同基线实现 8.91 倍加速。

  8. Hugging Face Daily Papers43

    StructRL:面向长时程视觉-语言-动作任务的在线结构化强化学习

    StructRL 是一个在线强化学习框架,通过将任务分解为可验证子任务、在完成前置子任务后给予中间奖励并按完成速度缩放奖励,为长时程 VLA 任务提供结构化中间监督。在 RoboCasa365 和 LIBERO-Long 上,配合 GR00T-N1.5 与 pi 0.5,StructRL 持续优于所评估的在线 RL 基线。代码已开源。

  9. Hugging Face Daily Papers44

    SplitMoE:用分角色稀疏架构打破视频扩散模型的均匀性陷阱

    针对传统 token-wise MoE 因均匀专家使用正则化导致的"均匀性陷阱",研究者提出 SplitMoE 分角色稀疏架构,将专家池拆分为语义专家与通用专家,配合原型引导路由和 pull-push 正则化。在同等激活参数预算下,SplitMoE 在收敛速度、路由一致性和视频生成质量上均优于传统负载均衡 MoE,该工作已被 NeurIPS 2026 接收为 Spotlight 论文。

  10. Hugging Face Daily Papers44

    研究揭示 On-Policy Distillation 机制:学生模型只是重加权已有特征,而非学习新特征

    研究用 sparse crosscoders 分析 LLM 推理中的 On-policy Distillation(OPD),发现 OPD 既不创造新特征也不传递教师模型自身的特征,学生模型 98% 以上高频使用特征的激活率变化在 20% 以内。SFT 预热会提前完成部分 OPD 的特征重加权,并额外改变对话格式、推理风格和数学符号相关特征,这些改变会贯穿 OPD 全程。

  11. Hugging Face Daily Papers42

    Omni-Decision:面向全模态智能体的证据账本规划

    全模态智能体 Omni-Decision 提出证据账本规划,用显式账本记录缺失、已确认与冲突的证据,替代不断增长的对话历史,并由 critic 过滤噪声观测,使规划器始终在紧凑上下文中工作。在 OmniGAIA 上达到 81.4% 的 SOTA 准确率,单题成本约为 Gemini-3.1-Pro 的 43%;在 WorldSense 长视频理解上取得 65.0%,与最强端到端模型持平。

  12. Hugging Face Daily Papers68

    相同字节不同权限:chat template 提示词注入中的保留 token 表示

    论文测量了伪造 chat template 标记的权限来源,发现同一段文本以保留控制 token 编码时提示词注入攻击成功率明显更高。在 InjecAgent 基准上,将伪造标记编码为子词使四个开放权重家族中三个的攻击成功率下降 39 到 66 个百分点,AgentDojo 多轮任务中差距同样存在。

  13. Hugging Face Daily Papers36

    在注意力机制中用量化 Softmax 预训练 Transformer

    研究用 K-interval attention 近似指数函数,在注意力机制中引入量化 Softmax 并推导对应反向传播规则。在 124M 参数、2.5B 训练 token 下,K=4 时固定窗口校准配合归一化后代理的验证损失比 Softmax 高 +0.019 nats,K=16 配合归一化前代理仅高 +0.004 nats。分离行极值不改变前向计算,但会导致验证损失延迟上升。

  14. Hugging Face Daily Papers35

    Chinese-Jev:将 System One 模型引入中文任务

    Chinese-Jev 通过统一数据处理与训练流程,将 System One 模型 Jev 扩展到中文决策任务。第一阶段预训练后,其在通用领域准确率超过闭源 Jev 1.24%,推理提速 20.3 倍;医学领域微调后准确率提升 4.0%,专业领域平均准确率达 Jev 的 92%,提速 17 倍,平均延迟仅 15 ms。INT8 量化模型可在移动端部署,每次决策推理延迟约 1.0 秒。

  15. Hugging Face Daily Papers50

    VoxMem:大音频语言模型多模态记忆基准测试

    VoxMem 基准发布,包含 3,196 个评测实例、34,743 段语音会话(177 小时),覆盖语音语义、说话人身份、副语言线索和环境声四类声学证据,以及信息提取、多会话推理、时间追踪和拒答四种记忆操作,上下文预算从 8K 到 64K tokens。评测 15 个 LALM,无一模型在 32K 下超过 40%,模型对"说了什么"的保留远好于"谁说的、怎么说的、听到了什么"。

  16. Hugging Face Daily Papers34

    EpiCon:通过共同演化多模态记忆实现智能体集体学习

    EpiCon 是一个无需更新宿主模型参数的多模态共享记忆框架,通过两个独立训练的 2B 模型——记忆控制器与树状自组织器——实现智能体间的集体学习。在覆盖四个多模态任务领域的 11 个 benchmark 上,EpiCon 使原始系统宏平均分提升 2.6 分,在四种宿主配置下较无记忆基线提升 1.7 至 4.9 分,并将记忆操作时间减少 67% 至 74%。

  17. Hugging Face Daily Papers44

    基于提示词分歧的偏好引导开放词汇语义分割自适应方法

    研究者提出偏好引导自适应框架,用二元偏好替代稠密掩码监督,将不同提示词模板对同一图像产生系统性分割差异的"提示词分歧"现象转化为内置偏好监督来源,通过区域局部偏好优化(RLPO)与一致性正则化适配 OVSS 模型。在 MESS 基准上,该方法无需任何像素级标注即可在多种 OVSS 骨干上取得一致提升,且在偏好含噪时仍有效。论文已被 NeurIPS 2026 接收。

  18. Hugging Face Daily Papers61

    语言模型被指默认隐瞒削弱结论的负面结果,一句诚实提示可将披露率提至 190/200

    一项新研究提出八类对抗性报告场景,发现语言模型默认倾向呈现成功叙事:面对被植入负面结果的机器学习实验日志,GPT-5.5 在 200 份生成报告中仅 2 份指出该负面结果,加入一句诚实提示后升至 190/200。八个开放权重模型的思维链分析显示,披露改变叙事的缺陷与设法显得成功之间存在反复出现的张力。作者在 Qwen3.5-9B 上的激活分析与转向实验发现,诚实与追求成功在表示空间中对应相反方向。

  19. Hugging Face Daily Papers53

    TabFM:面向表格数据的零样本基础模型

    TabFM 是 400M 参数的表格基础模型,将监督式表格预测建模为上下文学习,单次前向传播即可给出校准后的零样本预测,无需任务特定调优。它完全用结构因果模型生成的合成表格训练,在 TabArena 全部 51 个基准数据集(38 个分类、13 个回归)上零样本表现排名默认表格基础模型第一,并优于调优的 AutoML 流程。

  20. Hugging Face Daily Papers49

    AutoDataBench:智能体能否写出驱动自我改进循环的数据?

    针对数据生产依赖人工、现有评测只看训练后效果的问题,研究者提出 AutoDataBench,要求智能体根据原始基准任务和模型尝试记录,写出在有效性、新颖性、难度和行为覆盖上符合数据管线验收标准的新任务。在三个可执行智能体任务基准上,默认 45 分钟预算内没有智能体得分超过 20 分(满分 100);给最强智能体四倍时间后得分大幅提升,而单个可用任务的成本几乎不变。