Latent-Foresight:为潜在世界模型端到端学习可预测表征
Latent-Foresight 提出一种端到端框架,联合学习潜在 tokenizer 与基于流的生成动力学模型,显式塑造表征以支持时间可预测性。实验表明,该方法能学习到时间上更连贯的潜在表征,在多项未来场景理解任务与预测时域上持续优于两阶段基线,并省去独立训练阶段(含高分辨率适配)。实现代码与模型权重已开源。
Latent-Foresight 提出一种端到端框架,联合学习潜在 tokenizer 与基于流的生成动力学模型,显式塑造表征以支持时间可预测性。实验表明,该方法能学习到时间上更连贯的潜在表征,在多项未来场景理解任务与预测时域上持续优于两阶段基线,并省去独立训练阶段(含高分辨率适配)。实现代码与模型权重已开源。
LOCI 是一种混合空间记忆架构,在部分 Transformer 块中保留键值缓存,其余块则结合基于投影相机几何的循环线性注意力记忆,使视角同时参与记忆寻址与内容存储。在 MIND 基准与真实轨迹上,LOCI 比代表性世界模型及同配置全 softmax 模型更忠实地重现重访内容;保留完整历史时,同等长度下峰值内存降低约 30%。在有限记忆预算下,它还能以恒定内存流式处理长视频。
OneStreamer提出通过共享的主动生成过程,联合学习查询无关的证据记录与任务响应,其主动分层字幕记忆(PHCM)生成带时间锚定的局部细节字幕与已完成事件摘要,在不回溯历史视觉特征的情况下提供可复用的事实上下文。
视频大语言模型(VideoLLMs)的时序推理能力在中间层达到峰值,却随层数加深逐渐衰减至输出层,导致反转帧序后预测结果往往不变。研究者据此提出 Temporal Activation Injection(TAI),在峰值层提取时序表征并注入后续层,无需训练即可在三个 VideoLLM 和四个基准上稳定提升时序推理,且对非时序任务影响极小。该研究已被 NeurIPS 2026 接收。
Omni-Embed-Mini 以 0.9B 参数将文本、语音、音频、图像、视频和富文本文档映射到统一余弦空间,且不更新任何文本侧参数。其核心思路是无需独立嵌入模型作为教师,直接以冻结骨干网络对密集级联标题的嵌入作为目标,配合 Matryoshka SigLIP 对比损失与在线混合难负例挖掘器完成对齐。
World Observer 通过联合生成一个 actor 视角与一个或多个全景 observer,让离开 actor 视野的物体在 observer 中持续演化,从而在重新进入视野时保留其状态与动态。
OmniSeek 是一个将 Omni-LLM 转变为具备原生工具调用能力的多轮推理智能体的框架,能动态决定看或听以及对应的时间窗口,将检索到的音视频片段回填上下文以支持后续推理。
研究者提出多模态唇形同步评判模型 Align Then Reason(ATR),先在帧级唇部表征与候选台词的音素单元间建立单调对齐,再基于对齐结果推理内容与时间是否匹配。
研究者提出首个基于用户历史的个性化图像生成统一基准,包含个性化场景生成与个性化创意生成两项任务,以及覆盖目标保真度、视觉质量、用户可区分性、语义对齐和任务效用的多轴评估协议。同时提出 PEARL,将多模态推理器与冻结的图像生成器耦合为交错的“推理-反思”循环,并用差分数据奖励优化,在两项任务上平均提升 15% 的个性化指标。
PhysVista提出一个闭环认知框架基准,联合评估视觉语言模型的物理状态感知、物理动态推理与物理合理性判断,并区分事件级与尺度级推理。该基准同时纳入真实世界与AI生成视频,覆盖多样领域与新兴生成场景。对多种VLM的实验显示,模型在物理推理与合理性评估上存在显著局限,视觉识别与真实物理理解之间仍有明显差距。该研究被NeurIPS 2026主会议接收。
LEAP 通过将录音切分为固定时长块、用轻量定位阶段为每块候选窗口打分,再把高分窗口汇聚后单次有界重编码作答,使答案输入与峰值上下文不随录音时长增长。在多个 AVQA 基准上,LEAP 较 Qwen3-Omni-30B-A3B 基线提升 4.5-16.8%,迁移到 MiniCPM-o 4.5 后超出其已发表结果 3.1-13.0%。
针对 LVLM 用 CoT 做空间推理时每步必须锁定单个 token、易造成过早离散化并传播错误的问题,研究者提出 Soft Spatial Reasoning 后训练框架,通过混合 token 嵌入形成连续软状态,让多个候选延续共同影响下一步推理。
Multimodal Flow 提出一种全连续的多模态生成模型,将文本块与图像组织为有序连续 hyperchunks,通过共享 chunk-causal flow backbone 和 Flow Matching 学习统一向量场。
Hugging Face 推出 Open TTS Leaderboard,用客观指标评估开源多语言 TTS 和语音克隆模型。指标包括基于 Qwen3 ASR 的 WER/CER、H200 上的 RTFx 和 TTFA 流式延迟、WavLM 嵌入的说话人相似度(SIM),把评估周期从数周缩短到数小时。
SpatialCORE 是一个后训练框架,将模型对生成式 grounding 的自身置信度转化为空间推理的学习信号,通过自调节空间奖励按坐标 token 置信度加权每个预测边界框的匹配质量,并用答案门控将 grounding 优化与最终答案正确性绑定。该框架在多个基准上取得开源及专用空间推理模型中的 SOTA 结果,并可零样本迁移到未见数据分布,源代码已公开。
MemLife 是一个多模态记忆系统,通过构建实体锚定的第一人称文本片段,并用时间索引的智能体读取器进行检索,在无需训练、查询时不访问原始视频的情况下,于四个长时程基准上比最强免训练基线提升 4.6–12.0%。配套的 MemOpt 强化学习框架优化记忆写入器,使 MemLife 再提升 2.7–5.0%,且增益可跨写入器与读取器骨干及不同记忆系统泛化。
EgoTools 发布,成为首个面向第一视角工具使用理解的综合套件,包含 100 小时带同步音频、密集标注与 3D 信息的 EgoTools-Data 语料库,以及覆盖感知、几何、流程与因果推理四条轨道的 1,000 对 QA 基准 EgoTools-Bench。
研究提出 MIST(Misleading-Image Stress Test),用 200 句可作比喻或字面理解的英文句子,分别配对齐图像、误导图像或无图像,要求仅凭句子作答。
PixelUMM 是一个无需编码器的统一多模态模型,直接在像素空间完成图像与视频的理解和生成,将图像表示为空间 patch、视频表示为时空 tubelet,通过单层线性投影接入共享多模态主干。
音频-视觉大语言模型(AVLLM)存在源混淆接地幻觉,即未使用模态的线索会诱发所需模态不支持的回答。路径干预与表征分析揭示“问题接力”机制是成因,据此提出的免训练方法 SECRET 通过对比不同模态路径干预诱发的问题表征,将问题状态引向所需源证据。
LoopVL 将 Loop Transformer 扩展到视觉语言模型,通过 Module-Loop 与 Model-Loop 计算,用共享模块迭代更新统一的视觉语言状态。该模型从零开始经语言预训练、多模态训练和后训练,在多模态理解与视觉推理基准上超过同规模及更大规模的非循环模型。研究还观察到 LoopVL 出现"视觉顿悟时刻",即视觉注意力随循环次数发生显著转移。
针对音视频联合扩散模型的多奖励强化学习,研究者提出 Adaptive Reward Routing,在 DiffusionNFT 前向过程 RL 中同时自适应调整更新位置与奖励组合。
一篇综述将联合生成、跨模态生成与联合编辑统一形式化为音视频对分布上的三类问题,并提出沿五个设计轴比较方法的分类体系。该工作称首次系统梳理联合音视频编辑,将其划分为九类编辑、涵盖 28 种编辑类型,并整理了各设定的方法、数据集与指标。
针对潜空间视觉推理(LVR)中潜 token 对图像扰动响应微弱、缺乏显式监督的"潜证据信用缺口",研究者提出 ReaLVR,通过对比正确答案与模型生成的错误答案、匹配与不匹配的视觉证据,为模型自身的潜推理轨迹提供视觉证据监督。
AI 能看出你把宜家家具装错了吗?我们的新基准——家具组装基准(FAB)——把说明书和一张组装到一半的家具照片交给模型,让它们找出错误。 最高分在短短 10 个月内从 28% 升到了 80%。
Google Research 与 HHMI Janelia、MRC 分子生物学实验室及剑桥大学等合作,在 Cell 发表雄性果蝇大脑和中央神经系统的完整连接组,包含超 166,000 个神经元和 1.25 亿个突触连接,是迄今按神经元数量计最大的脑图谱。
推荐理由:由参与方介绍完整雄性果蝇连接组,读者可了解其规模、AI 重建方法及对后续脑映射研究的用途。
Voice Arena 与 Hugging Face 在 Open ASR Leaderboard 推出 Monsoon en-IN 和 Monsoon hi-IN 两套评测集,共 4 个 split、4,888 名说话人、约 17 小时对话语音,印地语成为多语言标签页里第一个南亚语言。
Google 发布 GlucoFM,一个基于双流设计的自监督基础模型,将血糖的慢速基线趋势与短期波动分离,并保留时间与缺失信息。模型在 109,066 小时无标注 CGM 数据上预训练,覆盖四个队列、七项临床任务共 14 组评估,平均 PR-AUC 比最强 GluFormer 变体高 5.8 个百分点。
Google 在 CHI 2026 发布研究原型 AgentHands,可将 LLM 的推理输出映射为 XR 中与语音同步的手势,让 AI 智能体在 3D 空间里用手演示而非仅靠语言描述。系统包含环境感知、手势事件库、手势嵌入推理和 XR 同步执行四个模块,手势按左右手、空间锚定、时序动效等维度分类。在 N=12 的用户研究中,AgentHands 相比纯语音基线在空间指向上取得显著提升。
Google Research 提出 Mobility-Embedded POIs(ME-POIs)框架,将匿名聚合的移动性模式与文本描述结合,为地点生成同时编码身份与动态功能的嵌入向量。
Hugging Face 提出三项测试量化 ASR 模型的基准优化(benchmaxxing)行为,评估 11 个开源模型后发现多个高分模型会复现 VoxPopuli 和 LibriSpeech 的错误参考转写。
推荐理由:原文给出三种可量化的探针方法,让读者能据此区分语音模型的真实转写能力与针对基准的拟合行为。
Google Research 提出 PhotoScan,一种从标准 2D 手机照片估算体脂率、A/G 比和 V/S 比等三维身体成分指标的深度学习框架,在 677 人 PhotoBIA 队列 5 折交叉验证中 BF% 平均 MAE 为 2.15,优于 BIA 的 2.91。
微软研究院发布 MindTopo 基准,用于评估多模态大语言模型在连通性、封闭、顺序、分离和绳结五类拓扑关系上的推理与规划能力。测试显示,当前专有与开源模型在静态识别上表现明显优于交互式规划,且均远低于人类水平,失败多出现在规划阶段而非感知阶段。图像与视频生成工具仅在单帧内保留结构关系时有用,跨多步操作仍不可靠。
Microsoft Research 发布研究模型 CARE-X,统一支持胸部 X 光报告生成、疾病分类、定位和校准诊断预测,基于 SigLIP2-so400M 与 Phi-4-mini-instruct (3.8B),采用三阶段 SFT 加 DAPO 强化学习训练。
Hugging Face 团队推出 Real World VoiceEQ 基准,评估语音交互的人类化质量,覆盖 40 多个专有和开源语音模型、15+ 维度和 60 多项指标,涉及 ASR、TTS、S2S 和语音理解。
Sierra 开源 μ-Bench,包含来自 250 通真实客服电话的 4,270 条人工标注语音,覆盖英语、西班牙语、土耳其语、越南语和普通话,评测 Deepgram Nova-3、Google Chirp-3、Azure Speech、ElevenLabs Scribe v2 和 OpenAI GPT-4o Mini Transcribe。
伯克利 AI 研究团队提出一种基于互信息的成像系统评估与优化框架,可直接从含噪测量中估计信息量,在彩色摄影、射电天文、无透镜成像和显微成像四个领域预测下游解码性能。该方法在 NeurIPS 2025 论文中展示,优化出的设计可媲美端到端 SOTA 方法,同时占用更少内存和算力,且无需任务专用解码器。