跳到正文

#多模态

今日 7 条
今天10月2日周五
  1. Hugging Face Daily Papers40

    Latent-Foresight:为潜在世界模型端到端学习可预测表征

    Latent-Foresight 提出一种端到端框架,联合学习潜在 tokenizer 与基于流的生成动力学模型,显式塑造表征以支持时间可预测性。实验表明,该方法能学习到时间上更连贯的潜在表征,在多项未来场景理解任务与预测时域上持续优于两阶段基线,并省去独立训练阶段(含高分辨率适配)。实现代码与模型权重已开源。

  2. Hugging Face Daily Papers42

    LOCI:面向流式世界模型的空间线性记忆架构

    LOCI 是一种混合空间记忆架构,在部分 Transformer 块中保留键值缓存,其余块则结合基于投影相机几何的循环线性注意力记忆,使视角同时参与记忆寻址与内容存储。在 MIND 基准与真实轨迹上,LOCI 比代表性世界模型及同配置全 softmax 模型更忠实地重现重访内容;保留完整历史时,同等长度下峰值内存降低约 30%。在有限记忆预算下,它还能以恒定内存流式处理长视频。

  3. Hugging Face Daily Papers43

    视频大模型时序推理为何在输出层“褪色”:TAI 方法无需训练即可增强时序表征

    视频大语言模型(VideoLLMs)的时序推理能力在中间层达到峰值,却随层数加深逐渐衰减至输出层,导致反转帧序后预测结果往往不变。研究者据此提出 Temporal Activation Injection(TAI),在峰值层提取时序表征并注入后续层,无需训练即可在三个 VideoLLM 和四个基准上稳定提升时序推理,且对非时序任务影响极小。该研究已被 NeurIPS 2026 接收。

  4. Hugging Face Daily Papers47

    Omni-Embed-Mini:通过密集蒸馏绑定多模态而不遗忘文本

    Omni-Embed-Mini 以 0.9B 参数将文本、语音、音频、图像、视频和富文本文档映射到统一余弦空间,且不更新任何文本侧参数。其核心思路是无需独立嵌入模型作为教师,直接以冻结骨干网络对密集级联标题的嵌入作为目标,配合 Matryoshka SigLIP 对比损失与在线混合难负例挖掘器完成对齐。

9月30日周三
  1. Hugging Face Daily Papers35

    PEARL:基于推理与反思的个性化图像生成,提出首个用户历史个性化图像生成基准

    研究者提出首个基于用户历史的个性化图像生成统一基准,包含个性化场景生成与个性化创意生成两项任务,以及覆盖目标保真度、视觉质量、用户可区分性、语义对齐和任务效用的多轴评估协议。同时提出 PEARL,将多模态推理器与冻结的图像生成器耦合为交错的“推理-反思”循环,并用差分数据奖励优化,在两项任务上平均提升 15% 的个性化指标。

  2. Hugging Face Daily Papers33

    PhysVista:通过感知-推理-评估闭环基准测试VLM的物理智能

    PhysVista提出一个闭环认知框架基准,联合评估视觉语言模型的物理状态感知、物理动态推理与物理合理性判断,并区分事件级与尺度级推理。该基准同时纳入真实世界与AI生成视频,覆盖多样领域与新兴生成场景。对多种VLM的实验显示,模型在物理推理与合理性评估上存在显著局限,视觉识别与真实物理理解之间仍有明显差距。该研究被NeurIPS 2026主会议接收。

  3. Hugging Face Daily Papers39

    LEAP:面向长音视频感知的学习式分块证据检索框架

    LEAP 通过将录音切分为固定时长块、用轻量定位阶段为每块候选窗口打分,再把高分窗口汇聚后单次有界重编码作答,使答案输入与峰值上下文不随录音时长增长。在多个 AVQA 基准上,LEAP 较 Qwen3-Omni-30B-A3B 基线提升 4.5-16.8%,迁移到 MiniCPM-o 4.5 后超出其已发表结果 3.1-13.0%。

  4. Hugging Face Daily Papers32

    SpatialCORE:让大型视觉语言模型基于置信度进行空间推理

    SpatialCORE 是一个后训练框架,将模型对生成式 grounding 的自身置信度转化为空间推理的学习信号,通过自调节空间奖励按坐标 token 置信度加权每个预测边界框的匹配质量,并用答案门控将 grounding 优化与最终答案正确性绑定。该框架在多个基准上取得开源及专用空间推理模型中的 SOTA 结果,并可零样本迁移到未见数据分布,源代码已公开。

  5. Hugging Face Daily Papers34

    MemLife:面向长期第一视角视频记忆的整理与推理系统

    MemLife 是一个多模态记忆系统,通过构建实体锚定的第一人称文本片段,并用时间索引的智能体读取器进行检索,在无需训练、查询时不访问原始视频的情况下,于四个长时程基准上比最强免训练基线提升 4.6–12.0%。配套的 MemOpt 强化学习框架优化记忆写入器,使 MemLife 再提升 2.7–5.0%,且增益可跨写入器与读取器骨干及不同记忆系统泛化。

9月29日周二
  1. Hugging Face Daily Papers35

    音频-视觉大语言模型中的“问题接力”机制与 SECRET 去幻觉方法

    音频-视觉大语言模型(AVLLM)存在源混淆接地幻觉,即未使用模态的线索会诱发所需模态不支持的回答。路径干预与表征分析揭示“问题接力”机制是成因,据此提出的免训练方法 SECRET 通过对比不同模态路径干预诱发的问题表征,将问题状态引向所需源证据。

  2. Hugging Face Daily Papers40

    LoopVL:循环视觉智能

    LoopVL 将 Loop Transformer 扩展到视觉语言模型,通过 Module-Loop 与 Model-Loop 计算,用共享模块迭代更新统一的视觉语言状态。该模型从零开始经语言预训练、多模态训练和后训练,在多模态理解与视觉推理基准上超过同规模及更大规模的非循环模型。研究还观察到 LoopVL 出现"视觉顿悟时刻",即视觉注意力随循环次数发生显著转移。

9月28日周一
9月24日周四
9月15日周二
9月4日周五
  1. Google Research64

    Google Research 联合 HHMI Janelia 发布完整雄性果蝇大脑连接组

    Google Research 与 HHMI Janelia、MRC 分子生物学实验室及剑桥大学等合作,在 Cell 发表雄性果蝇大脑和中央神经系统的完整连接组,包含超 166,000 个神经元和 1.25 亿个突触连接,是迄今按神经元数量计最大的脑图谱。

    推荐理由:由参与方介绍完整雄性果蝇连接组,读者可了解其规模、AI 重建方法及对后续脑映射研究的用途。

8月28日周五
8月27日周四
8月26日周三
  1. Google Research44

    Google 研究 AgentHands:为 XR 中的智能体对话生成同步手势

    Google 在 CHI 2026 发布研究原型 AgentHands,可将 LLM 的推理输出映射为 XR 中与语音同步的手势,让 AI 智能体在 3D 空间里用手演示而非仅靠语言描述。系统包含环境感知、手势事件库、手势嵌入推理和 XR 同步执行四个模块,手势按左右手、空间锚定、时序动效等维度分类。在 N=12 的用户研究中,AgentHands 相比纯语音基线在空间指向上取得显著提升。

8月21日周五
8月17日周一
8月13日周四
  1. Microsoft Research41

    MindTopo:微软推出评估多模态模型拓扑推理能力的新基准

    微软研究院发布 MindTopo 基准,用于评估多模态大语言模型在连通性、封闭、顺序、分离和绳结五类拓扑关系上的推理与规划能力。测试显示,当前专有与开源模型在静态识别上表现明显优于交互式规划,且均远低于人类水平,失败多出现在规划阶段而非感知阶段。图像与视频生成工具仅在单帧内保留结构关系时有用,跨多步操作仍不可靠。

8月12日周三
7月28日周二
7月15日周三
4月21日周二
1月10日周六
  1. Berkeley AI Research47

    伯克利提出信息驱动成像系统设计框架,登 NeurIPS 2025

    伯克利 AI 研究团队提出一种基于互信息的成像系统评估与优化框架,可直接从含噪测量中估计信息量,在彩色摄影、射电天文、无透镜成像和显微成像四个领域预测下游解码性能。该方法在 NeurIPS 2025 论文中展示,优化出的设计可媲美端到端 SOTA 方法,同时占用更少内存和算力,且无需任务专用解码器。