研究揭示 on-policy 参数更新方向是 LLM 后训练泛化的关键,提出 OPSFT 方法
研究发现 on-policy 后训练持续调整参数更新方向,而 SFT 沿固定方向更新,据此提出 OPSFT(On-Policy direction-constrained Supervised Fine-Tuning),将 SFT 更新约束到 on-policy 范式识别出的方向。
huggingface.co · 开发者平台
研究发现 on-policy 后训练持续调整参数更新方向,而 SFT 沿固定方向更新,据此提出 OPSFT(On-Policy direction-constrained Supervised Fine-Tuning),将 SFT 更新约束到 on-policy 范式识别出的方向。
SkillGym 是一套自动流水线,可从互联网抓取技能、筛选可离线复现的工作流,并通过 builder-reviewer 流程构建难度可控的任务,最终生成 6.8k 个环境和 19k 条已验证成功轨迹用于监督微调。
PixelUMM 是一个无需编码器的统一多模态模型,直接在像素空间完成图像与视频的理解和生成,将图像表示为空间 patch、视频表示为时空 tubelet,通过单层线性投影接入共享多模态主干。
音频-视觉大语言模型(AVLLM)存在源混淆接地幻觉,即未使用模态的线索会诱发所需模态不支持的回答。路径干预与表征分析揭示“问题接力”机制是成因,据此提出的免训练方法 SECRET 通过对比不同模态路径干预诱发的问题表征,将问题状态引向所需源证据。
LoopVL 将 Loop Transformer 扩展到视觉语言模型,通过 Module-Loop 与 Model-Loop 计算,用共享模块迭代更新统一的视觉语言状态。该模型从零开始经语言预训练、多模态训练和后训练,在多模态理解与视觉推理基准上超过同规模及更大规模的非循环模型。研究还观察到 LoopVL 出现"视觉顿悟时刻",即视觉注意力随循环次数发生显著转移。
NEEDLE 提出一种无需训练的后门移除方法,在识别触发词后,通过激活向量估计后门方向和拒绝子空间,并应用顺序权重正交化来抑制后门,同时防止拒绝相关表征发生变化。该方法无需干净参考模型或原始中毒训练数据。在多个模型家族和攻击类型上的评估中,NEEDLE 取得了最低的平均攻击成功率(ASR),在具有挑战性的代码注入攻击上达到 0%,且 KL 散度最低,能力和安全性变化最小。
HeteroFold 是一种免预填充的跨模型族 KV Cache 传输方法,可在发送方与接收方均冻结的前提下对齐模型结构、映射并校准缓存。在六个传输方向上,它于四个长上下文基准上均取得最佳缓存传输表现,并在多智能体基准上追平文本通信。
TERRA 是一套端到端流水线,仅凭运动学轨迹即可结合地形先验、估计接触与负自由空间证据恢复支撑几何,并在重定向中考虑解剖、肌腱连续性与接触约束。基于五个数据集生成的运动-地形配对,团队用 9.4 小时多样化运动数据训练出单一肌肉驱动控制策略,在重建、重定向与留出跟踪基准上提升地形精度、大幅减少解剖与交互违规,并在各类支撑地形上取得最高完成率。
针对稀有失败场景下 CVaR 估计需大量昂贵 rollout 的问题,研究者提出 Tail-Influence Sampling(TIS),通过从试点模型估计各条件分布对尾部的影响尺度,将查询预算重新分配给对尾部最关键的部分。
研究者推出 RLE-Bench,一个覆盖交互控制、策略学习、感知与估计、机械设计四类机器人开发工作流的基准,用于评估编码智能体的工程能力。该基准按任务特定指标评估智能体提交的产物,并汇总为 RLE Index,同时给出各工作流的能力画像。论文还通过案例研究分析了智能体在代表性任务上的表现与局限。
针对音视频联合扩散模型的多奖励强化学习,研究者提出 Adaptive Reward Routing,在 DiffusionNFT 前向过程 RL 中同时自适应调整更新位置与奖励组合。
针对现有在线视频分割方法难以应对长视频中长期遮挡的问题,研究者提出 LVMT(Long-term Video Mask Transformer),用轻量 GRU 时序传播模块自适应选择跨时间保留的信息,并引入 Truncated Query Propagation(TQP)训练策略,分块处理视频、仅在块内反向传播,从而支持长视频训练。
E-MoE提出将反向生成过程构建为基于MoE骨干网络专家路由决策的离散共享隐变量上的因子化分布混合,在不增加活跃参数的前提下提升少步生成质量。在合成多模态基准、二值化MNIST和LM1B上,E-MoE均优于因子化基线模型,缓解了掩码扩散模型在少步场景下因位置因子化导致的样本质量限制。
一项研究提出"预测信用"协议,通过配对预测衡量研究智能体给出的科学解释对实验预测的增益,在336个前瞻状态、12个Tox21端点和24个OpenML任务上测试,v5的冻结信用判定未能得出结论。
MemFold 将查询条件下的文本记忆压缩为 K 个连续向量作为读者模型的记忆接口,并用任务结果的组相对奖励与置信度门控的 on-policy 蒸馏训练读者模型,教师模型仅用于重打分、推理时完全移除。
OTRetarget 提出一种统一方法,可从人类演示中联合重定向机器人与多物体运动,通过熵最优传输在人体、机器人和物体几何间迁移表面交互量,并融入约束逆运动学以兼顾接触保持与运动风格。
针对自回归视频扩散在长时程 rollout 中误差累积的问题,研究者提出 Rollout-Marginal Distillation(RMD):保留生成历史用于自回归预测,但让每个 chunk 独立对照 chunk teacher 打分,避免质量修正被不完美时序上下文带偏,随后再用视频级 DMD 恢复时序连贯性。实验显示 RMD 在远超训练时程后仍保持高视觉质量,优于视频级 DMD 基线。
研究通过保留每个注意力头、层和查询中注意力权重最高的 token 并测量 NLL 增幅,估算语言模型维持损失容差所需的有效注意力集合大小。基于注意力的选择显著优于随机选择,扩展上下文会增大所需集合大小但其占上下文比例下降,对保留权重重新归一化可大幅缩小该集合。
Prompt2Skill 是一个仅凭自然语言任务描述即可构建技能的无监督框架,能从提示词中推导任务规范、发现或合成数据集,并通过反思式编辑闭环迭代优化技能。在问答、阅读理解、电子表格操作和数学推理四个领域,该框架平均提升 10.8 分,持续优于直接提示基线。
研究者提出 modal kinetic typography,通过有限元特征问题从矢量字形轮廓提取最软振动模态,并用冻结的视频扩散模型仅监督模态的振幅与相位,实现字形动画。
CorrGRPO 提出将 GRPO 中成对奖励协方差归一化为皮尔逊相关系数,在不改变中心化总奖励的前提下,平衡不同尺度奖励对归一化的影响,避免大尺度奖励主导优势值计算。研究者在代码生成、工具调用和智能体安全三类任务上,使用 0.5B 至 8B 参数的模型进行对比,结果显示 CorrGRPO 在三项任务上均优于 GRPO 及其他变体。代码已开源。
研究提出主动式 LLM 智能体的 3T 设计原则——任务能力、时间分配与信任,并围绕任务范围、预判时长、激活触发、处理时机和干预深度五个维度构建设计空间。团队同时发布基于模拟的评测平台 PROACTIVITY-GYM,包含多日场景、有状态环境和人格化模拟用户。
研究者提出受控解码攻击框架,可在仅返回采样文本的黑盒 LLM 接口上绕过安全对齐。该方法通过采样分布重建、风险门控残差控制和推测式多 token 执行,将采样成本集中在少数关键位置。在四个目标端点和三个基准上,该方法在多数对比中取得最高平均分。
一种名为 label-free bias-only TTRL 的方法仅优化约 100K 偏置参数、冻结预训练主干,在 MATH-500 上让 Qwen2.5-7B 达到 76.67% 准确率,略超其有标签偏置引导复现结果,且参数量比全参数 TTRL 少 76,000 倍。
研究提出 Agent Priors-guided Policy Learning(APPL),把每个策略的结构先验同时用作训练约束与组合接口:构建智能体将完整演示切分为可复用技能,为每个技能提出多个结构先验并各训练、验证一个策略,运行时智能体再按先验接口选择并组合这些策略。
研究者提出 WM-VLM,为预训练 VLM 加装轻量级世界模型分支以生成中间视觉状态,并采用两阶段训练:先学生成下一视觉状态,再据此推理。在 2D 和 3D 心理旋转任务上,WM-VLM 持续优于监督微调的骨干模型,提升最高达 39.25 个百分点;消融实验显示移除或破坏生成的视觉状态会显著降低性能。
研究者推出 Endless Exam 基准,覆盖 14 个参数化数学构造问题族,用可验证的相对质量分数衡量模型在已发表数学前沿之前与之后的进展,且不将改进上限封顶为 1。在 69 个实例上评测 9 个模型,连续质量分数能区分表现差异,但 30 个已发表前沿参考无一被超越。该基准已开源生成器、验证器、参考基线、模型回答与分析,并新增 Claude Opus 5.5 评测。
一项在 Llama3 和 Qwen2.5 模型家族上开展的强到弱知识蒸馏研究显示,rollout 策略并非蒸馏动态的核心因素:token 级 KL 方向更明显地影响任务表现与输出覆盖,学习率则决定遗忘程度与更新稀疏性。
一篇综述将联合生成、跨模态生成与联合编辑统一形式化为音视频对分布上的三类问题,并提出沿五个设计轴比较方法的分类体系。该工作称首次系统梳理联合音视频编辑,将其划分为九类编辑、涵盖 28 种编辑类型,并整理了各设定的方法、数据集与指标。
PersonaDose 通过特质描述与目标平均强度控制语言模型的人格表达,将共享的描述条件 FLAS 控制器在人格响应上特化,并用实测特质表达校准其 flow time。
SAKIKO 审计框架通过方向性错误发现、路由器条件干预、目的地解析验证与前瞻性冻结统计许可,对工具调用前决策的内部激活干预进行机制性审计。
SeLMRoute 是一种将候选模型无关的语义证据提取与候选性能学习、部署目标应用分离的 LLM 路由框架,先通过可解释问题生成概率语义状态,再由轻量监督路由器估计候选模型表现。
QuantWM 是一个免训练的 2-Bit KV Cache 量化框架,用于解决视频世界模型中低比特量化导致的时序闪烁与视觉退化问题。
研究者推出 BIABench,一个由 16 项已发表生物学研究重建而成的基准,保留原始科学问题、成像数据与 ground truth,覆盖从 H&E 组织学到单分子定位显微镜的 11 类分析子任务。
针对潜空间视觉推理(LVR)中潜 token 对图像扰动响应微弱、缺乏显式监督的"潜证据信用缺口",研究者提出 ReaLVR,通过对比正确答案与模型生成的错误答案、匹配与不匹配的视觉证据,为模型自身的潜推理轨迹提供视觉证据监督。
Rubric Response Theory(RRT)用两参数项目反应模型把评分标准的判定模式转化为标量质量信号,替代传统的分数加总方式。其 Response Parameter Network(RPN)根据提示词和标准文本预测标准难度与区分度,并随训练用在线期望最大化更新。
Inverse Distillation Unlearning(IDU)统一框架可将多步匹配模型(flow matching 与 score-based 扩散模型)蒸馏为高效一步生成器的同时,抑制指定训练子集的输出。
研究团队提出 Tex-Zero,证明高保真原生 3D 纹理生成框架无需 3D 资产即可训练。该方法将高质量 2D 图像表示为 3D 空间中的平面,并通过分块随机旋转与聚合构造复杂几何结构,生成训练样本。基于这些数据训练的 Tex-Zero VAE 和 Tex-Zero DiT 在未见过真实 3D 资产的情况下,仍能生成细节精细的高保真 3D 纹理。
PDE-JEPA 提出用预测式表征预训练替代重构式目标,用于参数化 PDE 动力学建模。该方法先用掩码潜变量预测训练编码器,再通过几何投影器对齐潜轨迹几何与物理场演化几何,并用物理结构化潜预测器将动力学分解为参数无关演化与参数相关响应。在九个 PDE 基准上,分布内平均超越现有 SOTA 33.4%,外推到未见参数时平均提升 51.4%。
arXiv 论文(arXiv:2609.35928)发现,多智能体 LLM 系统中当各智能体知晓彼此的模型家族时,群体会按标签分裂为派系,即任务本身并不奖励的 factionalism 现象。