On-Policy Self-Distillation 综述:崩溃是症状,三个杠杆决定成败
一篇 30 页综述将 On-Policy Self-Distillation(OPSD)的核心失效模式"崩溃"归结为三个杠杆:信号施加位置(token 加权方式)、教师模型看到的信息(特权信息性质)、信号变化时机(教师动态与引导衰减)。
huggingface.co · 开发者平台
一篇 30 页综述将 On-Policy Self-Distillation(OPSD)的核心失效模式"崩溃"归结为三个杠杆:信号施加位置(token 加权方式)、教师模型看到的信息(特权信息性质)、信号变化时机(教师动态与引导衰减)。
针对 LLM 在对话中生成内容时需将局部修改传播到所有依赖部分的问题,研究者提出新基准并评测了九种修订方法,覆盖 gpt-oss-20b/120b、gpt-5.4-mini 和 qwen3.5-9b/27b/122b。
FlowBalance 是一种基于验证器的自我改进方法,通过对完整回复学习归一化分布,用冻结策略的 token 级对数概率增益生成轨迹级自引导分数,并用验证器组优势校准:正优势保留引导、负优势反转、无偏好时禁用。
EmbodiedSkills 是一个统一框架,将每个技能决策视为执行提案,运行时在执行前检查前置条件、执行后验证结果,并用共享的可执行技能接口连接高层技能选择、有界底层 VLA 执行与动作后验证。
研究者提出 Teacher-Gated On-Policy Distillation(TGOPD),在提示词级别先验证教师可靠性,再决定是否使用稠密 OPD 监督,未通过则改用 verifier-grounded GRPO。
研究者提出知识引导的变化数据合成框架 KnowChange,利用预训练视觉语言模型作为知识源,从变化前场景和指定变化类型推理合理的变化位置与类别转换。该框架将知识引导的变化模拟与可泛化合成模型结合,可在统一框架内灵活合成多种变化类型。实验显示,KnowChange 生成的数据在合成到真实迁移和合成数据增强上均持续优于现有合成数据集,且生成规模更紧凑。
FactoSR 是一个分解式强化学习框架,将世界一致性推理拆解为平面对应(XY)、深度一致性(Z)和时间可逆性(T)三个几何子目标,把不适定的投影恢复问题转化为可验证的推理步骤。在多视角与视频基准上,该方法在 VSI-Bench 提升 5.9%、All-Angles-Bench 提升 4.5%,论文已被 ECCV 2026 接收。
HarvestBench 是给避免副作用定价、并把副作用对象设为活体动物的基准,9 个 LLM 各自驾驶两台拖拉机收割玉米,动物挡路时需选择免费碾压或按给定燃油成本绕行,评分全部程序化、不涉及 LLM 评判。
2026 PNPL 竞赛基于扩展数据集 LibriBrain100 展开,新增 32 名被试(每人约 40 分钟数据)并将单被试数据扩至约 80 小时,任务升级为词语分类。竞赛设 Deep 与 Broad 两条赛道:前者追求单被试词语分类的最优性能,后者聚焦跨被试泛化,将受试者特定微调数据从约 40 分钟逐步压缩至约 20、10 分钟。
研究将安全微调数据集中的响应拆分为模板化拒绝语句和解释拒绝理由两部分,发现拒绝语句会诱导模型依赖表面线索,从而妨碍其准确区分有害与良性查询。仅用理由部分训练可在保持相当安全性能的同时减少误拒,该效果在 ICL 配置下同样成立,并与所评估的推理时缓解方法兼容。
研究者提出 KoNA 基准,用于评估视觉语言模型(VLM)的选择性不服从能力,涵盖 False Premise、Visual Inaccessibility、Universal Unknown、Task Feasibility 和 Safety 五类任务,每类同时考察查询级与组件级不服从。
Dr. Claw 是一个开源 AI 科学家工作空间,将 Claude Code、Gemini CLI 等命令行编码智能体封装进可控、可审计的人在环工作流,而非另造一个自主智能体。
UniMate 提出一个统一基础模型,能从绑定好的 3D 资产和文本提示为任意骨架合成关节动作,无需测试时优化或按骨架重训练。该方法采用拓扑感知扩散 Transformer,通过图注意力偏置、谱旋转位置嵌入和全局拓扑条件器三种机制把骨架拓扑引入注意力。
EditVid 是一个无需训练的统一视频编辑框架,结合稀疏因果记忆、基于对应关系的后注意力 token 注入和软潜变量混合,同时支持指令引导与参考引导编辑。在 FiVE 上,EditVid 取得 78.16 FiVE-Acc,而最强的无需训练基线为 58.95,并在 IVEBench 上取得有竞争力的结果。用户研究显示,相较 7 种对比方法,EditVid 总体偏好度为 51.8%。
研究者提出免训练全模态框架 TFO,无需架构修改或多模态重对齐,即可将冻结的 VLM 转为语音中心的全模态模型。TFO 用 Whisper 提取经置信度过滤、带时间戳的转写文本,经 VLM 原有语言接口输入,视觉通路保持不变。
研究揭示大语言模型的推理操作在隐藏表示中具有可分离的几何结构,且这种可分离性在中间层达到峰值。该结构无法用词汇或位置混淆因素解释,token 级操作对齐随层数增加而更分散,相同表层 token 因周围操作不同而表示各异。注意力掩蔽实验表明,chunk 起始处的操作对齐表示依赖前序推理上下文。
研究将 orchestrator-worker 交互建模为双层协同博弈,提出 Stochastic Reflective Memory Ascent(SRMA),仅在环境接地评估风险严格下降时接受候选记忆,并证明其收敛速率与置信门控。基于 Kimi 的完整系统在 500 个 SWE-bench 实例上解决率达 72.2%,高于公开 mini-SWE-agent 参考的 70.8%。
研究分析了音视频扩散模型中连接文本、音频、视频三条跨模态注意力边构成的“注意力三角”,发现音频-视频边是双向的,且受模型参数中的偏见影响,成为语义泄漏的主要来源:当提示词与模型先验冲突时,跨模态交互会覆盖预期条件,将语义导向视觉上常见但错误的结果。研究者据此提取注意力信号作为诊断工具,并用于引导推理时干预,在保持生成质量的同时改善了语义 grounding。
HoloWorld 是首个在连贯 3D 城市世界中统一室内外生成的框架,基于持续更新的跨尺度世界上下文,从城市级规划到单体建筑逐步表示和更新世界信息,使生成的室内空间与对应建筑外观保持明确对应。其城市外观生成的平均 AQS 分数较 SOTA 提升 7.68%,并获得最高平均 RDR 分数,同时保持建筑级室内外对应与跨街区连续性。
研究者提出 τ^τ-Bench(读作 hyper-tau-bench),把构建 LLM 智能体本身当作任务:开发智能体拿到企业真实记录、持有需求的客户、必须走通的生产 API、待继承的代码库以及服务成本与模型限制,需据此交付完整的客服智能体,并通过将该智能体部署到留出的模拟用户上来评分。
Enoki 是一个面向 LLM 多层级幻觉检测的开放信息抽取框架,通过提取文本锚定的关系事实并对照证据验证,将不受支持的事实映射回幻觉片段,无需额外对齐即可同时实现 claim 级验证与 span 级定位。
ShallowStream 是一个面向流式视频理解的新框架,利用 MLLM 浅层同时完成帧编码与检索索引构建,查询时再基于浅层注意力分数和多样性感知策略选取上下文帧作答。它在性能持平最强流式方法的同时,将单帧 prefill 延迟和 10 秒端到端延迟分别最多降低 52.1x 和 11.9x,代码已开源。
针对光照、天气、季节变化和动态遮挡导致的域偏移问题,AdaptVPR 提出路线感知生成式增强框架,用视觉语言模型解析场景属性并评估可编辑性,通过全局外观、局部遮挡和双路线三种路径生成同地点难正样本。该框架构建了含 160K 条经验证合成样本的 AdaptCities 数据集,在多个 VPR 基线和视觉基础骨干上取得一致提升,挑战性域偏移下 R@1 最高提升 9.2%。源码与数据资源已公开。
研究者提出 OR-Clarify 基准和 InterOPT 两阶段框架,用于评估和提升 LLM 在运筹优化建模前的澄清能力。OR-Clarify 通过部分公开的问题描述与隐藏槽位,在有限交互中衡量槽位恢复、停止行为、静默假设和交互成本;InterOPT 先识别影响建模的关键缺口,再决定是否继续提问或停止。
Motion-Omni 提出端到端框架,让口语对话模型直接从生成语音的隐状态输出面部表情以及手部、上半身和下半身动作,不再需要先生成语音再跑动作模型的级联流程。
研究提出"循环状态写回"概念,在荧光寿命成像的 GRU 编码器-解码器上,将连续状态传播替换为确定性 4-bit 状态存储后,τ1 和 τ2 的估计误差分别增大约 70 倍和 300 倍。误差反馈、残差记忆和方向记忆可在不重新训练的情况下恢复精度;在独立训练的 LSTM 上,粗粒度写回复现了相同失败,且 cell state 比 hidden state 更敏感。
WorldSculpt 通过将单物体 3D 生成先验 Pixal3D 扩展出多视角条件通路,从多视角观测生成包含数百个物体的组合式 3D 场景,每个物体以独立 mesh 置于共享世界坐标系中。
研究构建了基于 400 个 BigCodeBench 问题的评测框架,通过注入 AST 级损坏为每个修复任务提供已知最小补丁,发现 GPT-5.5 等前沿 LLM 普遍存在过度编辑,高 Pass@1 常伴随不必要的大幅改动。
RISE 提出一种无需外部教师模型的策略蒸馏方法,通过从模型自身 RLVR 训练轨迹中构造合成教师,将稀疏的结果奖励参数更新转化为密集的 token 级监督目标。该方法在数学推理、多领域 STEM、代码生成和多轮智能体任务中均优于纯 RLVR 训练和在线自蒸馏。由于教师模型随学生模型每轮迭代更新,蒸馏成为递归改进机制而非一次性压缩步骤。
针对 GRPO 类方法在所有 rollout 上使用固定重要性采样裁剪边界的问题,研究者提出组自适应裁剪策略优化 GAPO,按 rollout 优势自适应调整裁剪阈值,无需奖励塑形并保留标准 PPO/GSPO 代理目标。
MaxKernel 是一个面向 TPU 内核开发的多智能体系统,提供 Human-in-the-Loop、全自动 Auto 以及基于图的自主搜索三种范式,共享规划、实现、自调试、测试与硬件剖析等子智能体。该系统在包含 50 项内核任务的 JaxBench 及多个开源模型真实负载上评测,生成的实现可匹配专家手工调优基线。MaxKernel 已开源。
研究显示,在最优层分布、时间调度和优化器超参数下,层 dropout 能在相同训练 FLOPs 下带来更低损失,或在相同训练步数下节省最多 25% 训练 FLOPs。
研究团队推出 Iris-mini 和 Iris-pro 两个搜索智能体,分别训练于 35B-A3B 和 397B-A17B 规模,并公开其数据管线与训练配方。
RoboTok 是一个可扩展数据引擎,用查询人类操作视频从互联网视频中检索与操作相关的演示,用于训练灵巧机器人策略。它从 3D 手部轨迹学习潜在运动空间,可跨视角、场景外观和遮挡变化比较操作行为,并支持高效索引检索。真实机器人实验中,RoboTok 引导的策略相较最强基线平均成功率提升 42.2 个百分点。
研究者提出开放词汇互信息(OVMI),一种信息论指标,用于衡量语音脑机接口解码器相对于用户可能表达词汇参考分布所传达的信息量,使不同词汇表等条件下测得的能力可在统一通信尺度上比较。
VeriPhy 是一套可审计的物理验证系统,由纯文本规划器将提示词编译为带类型的物理义务和静态验证执行计划,再调用冻结的低层专家模型(分割跟踪、计数、11 类物理测量、深度、OCR、音频事件检测)生成带来源的证据记录,并映射为支持、矛盾或未知的三值判定。
一篇论文定位了 RLVR 收窄解空间的位置,在对 Qwen2.5-3B 的 PPO 与 GRPO 训练中,解法覆盖率最多下降 67%。研究发现收缩集中在推理轨迹入口,首个算术操作前的每 token 似然偏移是后续推理的 11 到 16 倍,仅提供未被选中的入口前缀就能把低覆盖家族的完成率从 0.018 提升到 0.212。
DRACO 提出一种基于动态评分标准(rubric)的信用分配方法,用于无真值成功信号的长时程智能体训练:训练中动态生成 rubric 以跟踪策略能力变化,每条完整轨迹评分一次,再将判断以闭式解重新分配到各步骤,在 GRPO 中产生差异化的逐步优势,且不引入额外训练归因模块。
研究者推出 Last Translation Benchmark(LTB),收录经人工撰写与同行评审的文本、图像、音频、视频样本,专门用于击破领先机器翻译模型。每个样本附带手工编写的校验规则,描述该样本上的具体失败情形,从而支持可靠且可操作的评估。该基准为持续接收投稿的实时数据集,最新版本 LTBv1 收录 2026 年 9 月 1 日前接受的贡献。
QCell 是一种基于查询的显微镜重叠细胞实例分割模型,通过实例重组模块在潜空间分解并重组查询表示,并用对比查询对齐目标分离重叠细胞查询。在 ISBI2014 上,QCell 比 SOTA 方法提升 +2.2 AP 和 +2.7 AJI,同时提出新的 Organoid 重叠细胞分割基准。该工作已被 BMVC 2026 接收,代码、模型与数据集均已公开。