GAS:以生成作为辅助监督,通过解耦嵌入预测零推理开销提升视觉理解
GAS 是一个生成引导的训练框架,将视觉生成重新定义为表征学习的辅助监督,采用解耦的 Mixture-of-Transformers(MoT)架构适配 Next Embedding Prediction(NEP)作为跨模态生成范式。
huggingface.co · 开发者平台
GAS 是一个生成引导的训练框架,将视觉生成重新定义为表征学习的辅助监督,采用解耦的 Mixture-of-Transformers(MoT)架构适配 Next Embedding Prediction(NEP)作为跨模态生成范式。
Marionette 是一种交互游戏世界模型,用两阶段自回归动力学模型预测 276 维显式 3D 世界状态,再由零参数图形桥计算世界空间几何与遮挡,最后用控制条件视频扩散模型合成 RGB 画面。
Intern-S2-Mobius 是一个将知识与推理解耦的基础模型,架构由全局共享的 Memory(FFN)存储知识向量、多个 Reasoner(Self-Attn)迭代完成组合推理,两者以隐藏状态作为缓存和载体反复交互。
研究者提出多模态模型差分框架 MMDiff,通过训练多模态 SAE 并对比基础 LM 与多模态适配版本的 SAE,识别多模态训练改变的特征,实现特征隔离、任务特定特征检测与特征级控制。
研究者提出 Latent On-Policy Self-Distillation(LOPD),将自教师的特权上下文本身变为可端到端学习的连续 latent token,而非依赖人工指定的答案、反馈或技能。
研究发现,在固定 tokens-per-parameter(TPP)比例下,领域数据的最优重复次数随模型规模增大而轻微上升;不同领域中,最优重复次数与该领域最终验证损失呈强负相关,验证损失越低的领域越能从更多重复中获益,而唯一领域数据量与最优重复次数的关系较弱。这表明用相同 TPP 的小型代理模型调出的重复次数,可为更大模型提供实用估计。
Dion3 是 Muon 优化器的改进版本,通过 Gram Newton-Schulz 算法、CuteDSL 内核和 megabatching 策略,在保持或改善 Muon 损失表现的同时将优化器步时最高降低 6 倍。该版本还修改了更新规则,每步仅对动量矩阵的部分行做正交化,速度和性能均优于此前的压缩版 Dion。Dion3 已通过 dion 包发布,可作为 Muon 的直接替代品使用。
研究者提出图像编辑基准 CPI-Bench,包含 CPI-General-Bench、CPI-Practical-Bench 和 CPI-Intelligent-Bench 三个子集,分别覆盖多图编辑、真实用户高频场景与高难度推理编辑。
SPARGen 是一个统一多模态框架,将 3D 重建、稠密对应和空间推理统一建模为指令条件下的生成任务,通过将结构化与语言输出序列化为 token 序列、并以图像对齐形式生成稠密几何场,让空间监督共同塑造原生多模态生成模型内的共享表示。在 3D 重建、对应和空间推理的多项基准上,SPARGen 在单一原生多模态生成框架内对异构空间任务取得了有竞争力的表现。
研究发现,带可验证奖励的在线策略强化学习(RLVR)会在提升当前目标的同时,让后续目标所需的成功行为变得难以采样。在 Qwen3-8B-Base 的 IFEval 上,pass@1 上升 6.5 个百分点,而 best@32 下降 9.8 个百分点,且该分化在两个模型家族和多个 IF 基准上均出现。这类变化集中在回答最前面的几个 token,RLVR 主要是在重排基座策略已有的开头方式。
HumanTracker 是一个面向人形动作追踪的评测基准,包含约 153 小时、由多位专业表演者采集的光学动作轨迹,按四类动作家族组织并配有文本标签用于细粒度诊断。团队同时提出偏好对齐指标 HumanScore,基于 12K 动作对(含 24K 段动作)训练,能比运动学指标更好地预测人类偏好,并暴露脚滑、触地时机错误等接触与稳定性问题。该工作已被 ECCV 2026 接收。
研究者推出 MobileMem,一个面向端侧长期记忆的基准与框架,基于一年期移动端体验数据构建。它通过知识驱动的合成流程,从用户-App 会话中生成连贯且时间一致的长期轨迹,提供文本与多模态两种设置,覆盖多跳与时序推理、知识更新和隐式偏好推断。MobileMem 让智能体记住过去、理解当下并适应未来,将记忆从信息检索推进到体验智能。
研究者提出免训练框架 CLR(Claim-Level Reliability Assessment),将测试时算力从额外采样转向针对性验证,通过把推理轨迹压缩为决策关键声明并寻找反驳证据来抑制错误共识。
论文提出 RA-Bench 基准,用于检测 AI 生成的真实危机事件视频,包含 17,886 条视频,其中 1,830 条真实视频锚点覆盖 10 类社会风险,16,056 条生成片段来自 4 个开源和 5 个闭源生成器。