跳到正文

#论文/研究

今日 30 条
今天10月2日周五
  1. Hugging Face Daily Papers43

    视频大模型时序推理为何在输出层“褪色”:TAI 方法无需训练即可增强时序表征

    视频大语言模型(VideoLLMs)的时序推理能力在中间层达到峰值,却随层数加深逐渐衰减至输出层,导致反转帧序后预测结果往往不变。研究者据此提出 Temporal Activation Injection(TAI),在峰值层提取时序表征并注入后续层,无需训练即可在三个 VideoLLM 和四个基准上稳定提升时序推理,且对非时序任务影响极小。该研究已被 NeurIPS 2026 接收。

  2. Hugging Face Daily Papers38

    AgSpec:突破检索式推测解码在编码智能体流水线中的极限

    AgSpec 框架为编码智能体流水线补齐检索式推测解码缺失的语料库与草稿长度策略,从会话、工作区和全局语料检索,并按智能体离线画像设定草稿长度上限、在线自适应调整。在两个仓库级多智能体编码基准上,AgSpec 在多数设置下优于五种检索式草稿器及 EAGLE-3,批大小 1 和 16 时生成吞吐量较自回归解码分别提升最高 4.37 倍和 4.76 倍。

  3. Hugging Face Daily Papers47

    Omni-Embed-Mini:通过密集蒸馏绑定多模态而不遗忘文本

    Omni-Embed-Mini 以 0.9B 参数将文本、语音、音频、图像、视频和富文本文档映射到统一余弦空间,且不更新任何文本侧参数。其核心思路是无需独立嵌入模型作为教师,直接以冻结骨干网络对密集级联标题的嵌入作为目标,配合 Matryoshka SigLIP 对比损失与在线混合难负例挖掘器完成对齐。

  4. Hugging Face Daily Papers44

    InterEvolve:人形机器人移动操作中奖励程序的测试时进化

    InterEvolve 提出一种测试时进化方法,让人形机器人控制器无需重新训练即可通过重编程现有技能解决新任务。它用 LLM 智能体在上下文中修订奖励程序结构,并由数值优化器调整常数,在并行仿真中验证候选程序。实验表明,InterEvolve 进化出的程序释放了 FB 模型未被充分利用的移动操作能力,进化技能可在物理 Unitree G1 上自主运行。

  5. Hugging Face Daily Papers33

    InFlowOp:无标签的流内多智能体工作流优化方法

    研究者提出 InFlowOp,用一套无标签成本为多智能体工作流的每个决策定价,在任务分解粒度与智能体分配上双向求解,并在执行中按同一成本以最低代价修正故障。同时发布 Braid 基准,其任务需多智能体协作才能完成。在多个领域与骨干模型上,InFlowOp 较单智能体基线最高提升 +11.97%,流内优化带来 +9.64%。

  6. Hugging Face Daily Papers44

    Argo-Bench:评估数据智能体在企业级工作流中的表现

    Argo-Bench 是一个包含 210 个数据科学与分析任务的评估框架,模拟纽约市外卖平台,导出为 235 张表、75 亿行的 ERP 仓库,智能体需先重建事实再执行封禁欺诈账号、分配骑手激励预算等操作,评分依据模拟器中的后果。14 个前沿与开源模型中最强者在仅 34.8% 的任务上得分达 95 以上,平均 59.5 分。

  7. Hugging Face Daily Papers40

    PoS:用显式信念状态增强长时程 LLM 智能体

    研究者提出推理时框架 PoS,为 LLM 智能体构建并持续维护显式信念状态作为决策上下文,每个信念结合当前世界状态估计与未解决的任务需求。PoS 通过一致性校验和任务进度监控检测“Belief Trapping”,并按陷阱模式与未满足需求类型进行恢复。在四个覆盖执行与诊断的基准上,PoS 在三种 LLM 主干下均取得最高整体表现,消融实验验证了一致性校验与恢复机制的作用。

  8. Hugging Face Daily Papers35

    RPTune:面向 LLM 商品目录搜索的学习式上下文整理

    RPTune 是一个端到端框架,将学习式目录整理与 LLM 后训练结合,用自动生成的目录监督信号提升商品搜索。其编码器-重组器整理器依据下游 LLM 反馈对商品排序和剪枝,整理后的目录再通过上下文相对奖励改进后训练。在 7 个真实商家的评测中,上下文整理带来最高 31.4 个百分点的准确率提升,后训练平均再提升 10.3 个百分点。

  9. Hugging Face Daily Papers36

    4Director:用刚性 3D 几何控制视频世界模型

    4Director 是一个以显式 4D 场景表示为条件的视频世界模型,将每个物体从输入图像重建为规范网格,并按每帧一个刚性变换驱动其运动。它把受控场景渲染为深度视频,再通过 Motion Adapter 合成视角一致的外观、光照与非刚性动态。团队构建了含 20,774 个片段的 RealCOD-Rigid 数据集,并提出 IG-IoU 指标,实验显示其在视觉质量与相机、物体控制上均优于此前方法。

  10. IT Home43

    AI 伦理研究:DeepSeek V4-Flash 对男女一视同仁,Claude Sonnet 4.6 与 GPT-5.5 却区别对待

    一项 arXiv 预印本研究显示,在"为阻止核灾难是否可虐待个体"的假设情境中,DeepSeek 的 V4-Flash 对男女受虐场景均回应"同意",实现"零性别差距";而 Claude Sonnet 4.6 与 GPT-5.5 对女性受虐"强烈反对"、对男性受虐却"中等程度同意"。论文作者认为,这种差异可能源于训练数据中的社会刻板印象或对齐过程中对特定价值观的强化。

  11. elvis48

    AgentWorld 将 3 到 20 个不同角色的 LLM 智能体放入游戏沙盒,执行 50+ 轮的长程任务,智能体无法看到彼此内部状态,只能通过消息和共享计划协调。Gemini 3 Flash 任务成功率最高,为 52.0%;协调类任务最难,成功率仅 12%,常见失败包括沟通中断、角色混淆和共享计划丢失。论文显示,多智能体团队中不到三分之一的行动真正有助于完成任务。

  12. Hugging Face Daily Papers47

    AutoGUIWorld:用图像生成器作为 GUI 智能体的视觉世界模型

    AutoGUIWorld 是一个数据生成框架,结合图像生成器的视觉先验与规划器的任务知识,无需部署或运行软件环境即可合成 GUI 交互轨迹。它从操作系统上下文、视觉外观和界面状态的结构化规格中采样初始场景,生成 79,266 条覆盖 Ubuntu、Windows、macOS 和 Chrome 的空间标注步级训练样本。

  13. Hugging Face Daily Papers35

    HC-DLM:分层连续扩散语言模型

    研究者提出分层连续扩散语言模型(HC-DLM),将离散 token 生成与连续隐变量轨迹耦合在单一去噪过程中,训练目标由 token 似然的变分下界推导而来。该模型以隐变量作为唯一持久生成状态,每步从中读出 token 并反馈作为下一步隐变量更新的脚手架。在 Sudoku、Countdown 和 LM1B 上,同等模型规模下 HC-DLM 在谜题准确率和生成困惑度上均优于离散与连续扩散基线。

  14. Ars Technica · AI68

    AI 系统以 16 块 GPU 击败史上最强 Stratego 选手

    来自 CMU、MIT、NYU 和 Stanford 的团队开发 AI 系统Ataraxos,以 15 胜 1 负 4 平击败公认史上最强 Stratego 选手 Pim Niemeijer,训练仅用 16 块 GPU 和几千美元。Stratego 是隐藏信息量大且时间跨度长的非完全信息游戏,此前连 DeepMind 也没能造出稳定战胜顶尖人类的机器。

10月1日周四
9月30日周三