长视频 MLLM 视觉 token 分配的控制研究:选择、压缩与再投资
一项控制变量研究比较了长视频 MLLM 中视觉 token 的分配策略,发现帧选择是影响最大的环节:在 LongVideoBench 的小时级分桶上,8 帧查询选择比 16 帧均匀采样高 6.9 分,而数十年前的稀疏近似算法 Orthogonal Matching Pursuit 在三个基准上追平或接近所有专用选择器。
huggingface.co · 开发者平台
一项控制变量研究比较了长视频 MLLM 中视觉 token 的分配策略,发现帧选择是影响最大的环节:在 LongVideoBench 的小时级分桶上,8 帧查询选择比 16 帧均匀采样高 6.9 分,而数十年前的稀疏近似算法 Orthogonal Matching Pursuit 在三个基准上追平或接近所有专用选择器。
研究者提出 AutoTraceGT,首个将社会科学扎根理论自动化应用于智能体轨迹分析的多智能体流水线,通过开放式、轴心式与理论式编码迭代至饱和,为每个任务生成定制化行为分类体系。在六个轨迹语料库上,其生成的编码手册覆盖人工标注分类体系中 73%-91% 的失败模式,并发现后者遗漏的新模式。该编码手册作为演绎特征空间时,在下游失败预测任务上优于零样本和少样本 LLM 基线。
Scal3R 将在线 3D 重建重构为多参考相对位姿查询,用约占 1% 参数量的轻量可学习 token 经非对称注意力注入完全冻结的骨干网络,查询相对多个历史关键帧的位姿。
研究者提出"compile by training",将自然语言规格编译为可复用的神经函数:编译时由教师模型生成任务样本,训练一个紧凑解释器的小型适配器,成品无需教师模型即可运行,并可像普通软件一样存储、版本化和组合。
研究将随机梯度流(SGF)建模为渗流过程,发现嵌套架构对称性迫使子网络以离散块形式合并,而非单边连接,这种结构转变在宏观序参量上表现为方差尖峰。作者进一步给出 Adam 和 AdamW 在重尾梯度噪声下捕获论证成立的充分条件,并在训练好的 Transformer 上进行了测量。
研究者提出 CORD(Calibrator-Output Repair for Top-1 Decision Preservation),首个通过修复完整校准概率向量来强制保持 top-1 预测不变的事后校准适配器。
研究者提出 PACE 数据集,用于评估模型能否识别以自我中心知识或事件形式存在的潜在约束,从而判断看似合理的用户请求是否不当。PACE 将基于明确人设的用户请求与自我中心 KB 事实配对,要求模型整合上下文证据判断请求是否冲突。同时提出多智能体框架 PaceMaker,通过查询改写、多跳图遍历和冲突感知过滤协调检索关键证据,在 PACE 上的证据检索质量和冲突决策准确率均持续优于现有方法。
针对自主后训练中"过往更新经验在父模型变化后是否仍可复用"的问题,研究者提出 Boundary-Calibrated Intervention Transfer(BCIT),在改变权重的训练前先校验经验适用条件,对存在硬冲突的候选直接否决,必要时通过有界训练试验获取当前状态证据。
LatentStream 将流式视频理解的记忆机制从"存储-检索"转为"检索-内化",通过查询无关的分层流式记忆、分层潜在记忆演化和置信度引导的渐进优化三个组件,把历史证据内化为定长潜在记忆。该框架在现有在线与离线视频基准上取得新的 SOTA 结果。
Puffin-World 是一个统一多模态架构,无需外部离线模块即可整合物理理解、空间模拟与 3D 世界生成和重建,联合建模物理(重力场与纬度)、几何(深度)、外观(图像)三种原生世界状态,并引入统一 Omni-Camera 表示。团队构建了含 1500 万视觉-语言-相机三元组和 100 万条轨迹的 Puffin-16M 数据集,并已开源代码、模型与数据集。
论文提出 Random Attention,一种不计算任何分数、在每个注意力头内均匀随机淘汰 KV cache 的方法。在四个模型和六个推理任务上,它的任务表现持平最强基线,用 vLLM 部署时吞吐比该方法高 32-43%。
FlashRender 是一个少步生成式渲染框架,可在数秒内沿目标相机轨迹对源视频进行重拍。它提出 Representation Transformation and Alignment(RETA),将源视频隐表示与冻结视觉几何模型的目标视频特征对齐,实现采样步数一致的相机控制,再结合 MeanFlow 目标微调与 on-policy flow map 蒸馏。
WorldReward 是一个基于 VLM 的成对偏好奖励模型,统一评估相机条件世界模型的动作一致性与视觉质量,将成对视频拆解为动作对齐片段并投票聚合出视频级偏好。
针对联合音视频生成模型难以控制镜头切换与对白时间的问题,研究者提出 Temporal Context Routing(TCR),将脚本时间映射到视频与音频共享的时间轴上,并把提示词引导路由到对应位置。
研究发现,单条 query 的 one-shot OPD 训练可持续数百步提升,并恢复全量数据 OPD 的大部分收益。单条 query 的状态覆盖率达 71.5%,16 条语义不同的 query 可达 98.9% 并追平全量训练。OPD 因此是数据过饱和但算法受限,学生模型吸收监督的速度才是瓶颈。
针对 GPT-Image-2、Nano-Banana 等扩散模型只能输出扁平位图、文字易错且无法分层后编辑的问题,研究者提出 Editable Visual Design 新范式。
研究者提出 CORE,通过将交叉注意力重排序器的组合判断蒸馏进 MLLM 嵌入模型,来提升其组合检索能力。方法合成覆盖五个组合匹配层级的候选列表,并用 Rank-KL 目标训练嵌入模型复现重排序器的细粒度排序。
Principia 是一个通过配对物体间关系一致性来评测视频模型牛顿物理推理的基准,涵盖重力、弹性、摩擦、转动惯量、抛体、动量、单摆和弹簧振子八种现象,并使用与相机标定无关的一致性评分。在六个主流视频生成模型的数千次生成结果中,没有模型得分超过 0.42,而它们在同一批评测中 VBench 得分约 0.8。视觉语言模型检测关系物理违规的最佳准确率仅为 67%,多数接近随机水平。
研究者提出"环境演化"方法,通过离策略方式逐步提升环境难度并按代调度生成,为终端智能体训练持续提供学习信号。在 Qwen3.6-27B 和 Qwen3.6-35B-A3B 上经长程 RL 训练,二者在 Terminal-Bench 2.1 上分别提升 14.4 和 18.0 个百分点。
Terminal-Universe 框架可将终端智能体轨迹重建为可复用环境,并在此基础上合成新任务与持续交互,应用于公开轨迹后产出 37.3k 个任务充分的环境。用该语料对 Qwen3.5-27B 做监督微调,Terminal-Bench 2.1 单轮成绩提升 11.9 分,EvoCode-Bench v2 MT@4 多轮成绩提升 13.8 分。
LatentPress 将对话历史和长文档写入连续 memory tokens,由冻结解码器直接通过输入嵌入接口读取,推理时无需重建文本。
LLaDA-Image 是一个统一框架,将 6B DiT 从零训练与基于 LLaDA2.0-Mini 扩散语言模型骨干的冻结视觉语言理解模块配对。其生成管线包含 220M 样本,采用无参数 RMSNorm 与 Muon 优化器,蒸馏版 LLaDA-Image-Turbo 可在 2-4 步采样内完成推理。
研究团队构建 Minima,对 Qwen3.8-27B(48 层 GDN、16 层注意力)全部 496 个线性层(含 GDN)采用 NVFP4 W4A4 量化。
一项系统性实证研究探索了对话推荐系统(CRS)的零数据自举:无需任何领域内对话语料,仅从商品评论、元数据和用户-物品交互等非对话信号生成合成对话监督数据。
研究者提出 Sparse Readout Prism(SRP),仅用 unembedding 矩阵权重分解 readout,将任意 token logit 或 logit 差异表示为稀疏 readout 特征贡献之和,从而独立于拟合语料分析 lens 读数。
研究者提出 WHALE(Weight-Harness Alternating LEarning),交替进行模型权重更新与 harness 搜索,两阶段分别采用在线拒绝采样微调和 Meta-Harness。
研究用 Qwen3-1.7B 等小模型替代 7B 以上大模型做评分标准(rubric)评判,构建了 PointRubric 和 RaR-Science-Static 两个逐点评测数据集,比较生成式判定、Yes/No Logprob 边际和 Probe 评判三种方式。
Debias-SparseGPT 是一种训练后剪枝方法,通过基于人口统计学对比输入定义的二阶项引入表征去偏,在 25%、50% 和结构化 2:4 稀疏度下均比 SparseGPT 减少剪枝引入的偏差,同时保持模型困惑度和零样本准确率。在最严格的 2:4 结构化稀疏下,用长上下文、内容丰富的样本增强校准集可进一步提升下游性能与公平性。该工作已被 EMNLP 2026 接收。
研究用语言模型表示从企业信息环境中推断企业间互动结构:每家企业表示为新闻文章嵌入向量的分布,通过目标锚定的 Wasserstein barycentric 重构为每家企业选出能重建其信息足迹的加权企业组合。
研究提出用企业级分布特征替代跨资产收益协方差,为投资组合风险提供单边上界证明,加权成对松弛在可检验条件下凸且只需边际波动率尺度。在2018-2022年52家公司面板上,基于Qwen3-Embedding-8B新闻表征构建的配置在四个预设上限组合群体中处于样本内方差第0.69至1.33百分位,等风险加权则处于第21.1至28.6百分位。
FoldingAgent 是一个智能体框架,能直接从折纸演示视频中推断出显式的参数化折叠程序。它基于预训练 VLM,配备模拟几何变换、验证物理合理性、检索比对视觉内容及自评估预测的工具,并定义了几何与参数化折叠动作构成的参数空间,可顺序操作并重新规划动作以缓解多步折叠的累积误差。
NeoMME 是一族 260M 和 800M 参数的多模态多语言双向编码器,用单个双向 Transformer 编码器直接处理多语言文本和原始图像 patch,支持 16,384 token 上下文,可编码最多两张标准 4K UHD 图像。
研究者提出一种知识门控任务构建协议,将任务指令与包含私有约定、参考表和工具算子的紧凑 artefact 分离,通过构建溯源、字节一致指令、泄漏审计和可执行见证让任务对 artefact 的依赖可测试。
研究者提出 LLAMIA-Bench,包含六项协作国际象棋任务,用于检验 LLM 与非语言智能体协作时"语言化"是否构成瓶颈。他们提出潜在状态内化方法,将子智能体的连续表示直接投影为 LLM 的 state token。
研究者提出 KBMR,首个专为知识型视觉问答(KB-VQA)设计的基于 MLLM 的嵌入检索器,将图像映射到更能保留概念身份的语义空间。针对 Wikipedia 规模检索中的噪声监督,KBMR 引入基于 MLLM 的语义判别器生成连续实体一致性权重,并据此设计连续语义蒸馏目标。
研究者提出 Autoregressive Mosaics(AM-Bench)基准,用翻译任务和布局任务区分纯文本 LLM 是真正具备 2D 空间布局内部表征,还是仅能把空间描述转成代码。
ZipTok3D 是一种面向极短 token 序列高保真重建的 3D 分词器,通过嵌套 dropout 训练让每个保留前缀都能重建完整物体,并用参数共享的 Transformer 块迭代解码。
腾讯元宝团队提出 SnapBench,首个针对 snap-and-ask 多模态检索的成对鲁棒性基准,包含 1,145 条查询、9,085 个图库条目和 53 种受控损坏条件,并评测了 16 个多模态检索器。
VibeVoice-ASR-Streaming 技术报告提出一种基于 LLM 的端到端流式说话人归属 ASR 方法,将固定大小音频块、少量前瞻音频与历史文本交错输入,无需独立说话人分离阶段即可在语音到达时输出谁说了什么。7B 模型在五个评测集上取得最低平均 WER/CER,说话人归属在 13 项评测设置中有 12 项最佳或并列最佳。团队同时开源 1.5B 与 7B 模型权重及推理代码。
CRISP 是一种面向长上下文 LLM 推理的输入自适应稀疏预填充方法,用结构代理 C_struct 替代 JSD 路由,并基于噪声底设置 sink-aware 阈值以消除选择阶段的 O(n) 背景噪声。