面向扩散语言模型的表示空间 MMD 后训练方法
研究者提出一种扩散语言模型(DLM)后训练方法,在冻结预训练 DLM 的特征空间中最小化生成分布与参考分布的 MMD,通过保留各 token 位置的上下文特征,单次提取即可获得每条序列的多个观测。
项目更新、模型与开源社区动态
研究者提出一种扩散语言模型(DLM)后训练方法,在冻结预训练 DLM 的特征空间中最小化生成分布与参考分布的 MMD,通过保留各 token 位置的上下文特征,单次提取即可获得每条序列的多个观测。
TextReg 是一个正则化框架,通过正则化文本梯度实现软惩罚目标,结合 Dual-Evidence Gradient Purification、Semantic Edit Regularization 和 Regularization-Guided Prompt Update,缓解 LLM 提示词优化中的分布过拟合问题。
InterMimicGen 是一个自演化动作模仿框架,让机器人动作数据与跟踪策略相互促进:先将动捕人-物交互数据集重定向为人形机器人参考动作,再训练基于物理的通用跟踪器在仿真中执行,并通过数据飞轮对交互位置和身体执行方式做保持任务语义的小幅修改,仅保留仿真执行成功的变体用于下一轮迭代。
循环语言模型的每次循环都会增加训练、解码、prefill 和 RL 成本,而循环状态越接近不动点,到达它的路径就越不重要。研究改进了塑造不动点的两个训练组件——深度先验与输入注入:从预测反馈中学习先验并用熵项保持其宽度,用正交注入移除状态沿输入方向的分量。
论文研究训练数据如何在基础模型响应的起始 token 与后续推理行为之间建立关联。固定特定起始 token 提示即可让基础模型在数学和编码上逼近 RL 训练版本:".\n\nOkay" 将 Olmo-3-7B 的 MATH-500 pass@1 准确率从 42% 提升到 78%,"Alright," 将 Qwen3-14B 从 72% 提升到 87%。
针对 VLA 模型推理昂贵导致机器人走走停停的问题,研究者提出 RACE(Reliable Action-Chunk Extension)框架,通过辅助单步去噪预测子技能切换时机并以此条件化动作生成。
RealtimeWAM 是一种高效世界动作模型(WAM)变体,通过一步动作生成与异步推理解决多步动作去噪和专家间串行等待两大瓶颈。其提出的 TACD 借助冻结教师模型多步 rollout 端点监督实现精准一步动作生成,CEWP 则通过分块共享视频 KV cache 重叠两个专家。
研究评估二十款深度伪造检测器对抗近四年发布的十款生成器,准确率从99.5%降至76%,对抗扰动可将所有基线检测器降至2%以下。作者提出一种校准检测范式,输出真实性是否可合理否认的预测,可将误认证生成内容控制在1%以内。对3000张Reddit图像,2022年生成器无法复现1116张,2024年生成器仅55至79张无法复现。
研究者提出一种针对掩码扩散语言模型(dLLM)的定向偏见注入攻击,利用 PI 控制器在去噪过程中实时追踪目标答案概率并动态调整引导向量强度。
OmniConfess 是一种免训练的全模态幻觉缓解方法,通过在受控的单通道证据干预下对固定候选回复做 token 级重打分,生成结构化的“token 逐通道自白”,揭示回复依赖哪些证据,从而保留有依据内容、纠正由无关或矛盾证据驱动的表述。
研究者提出 ACG-Bench,一个面向双臂策略臂级组合泛化的基准,包含 8 个任务族、23 个任务-条件对,其中 17 个为未见过的组合,覆盖重排序、同步及跨任务组合。
Claude Code 发布 v2.1.291,修复了 2.1.290 中云会话可能丢失权限提示回答的回归问题,以及 2.1.288 中退出时可能丢失会话最后几条消息的回归问题。
Claude Code v2.1.290 发布,为 mod 的 turn.step hook 结果新增 serverToolUses 字段,记录 API 自身发起的工具调用及其 id、名称、输入与起止时间;plugin hooks 的 tool.check 事件新增 agentId,可区分子智能体与主会话的权限检查。
Claude Code 发布 v2.1.289,修复了复合 shell 命令嵌套部分的 deny/ask 规则在托管机器上无法覆盖用户安装 mod 审批的问题,并解决了短代码块含大量未闭合标签或深层嵌套 ${ 替换时终端卡死的问题。该版本还回退了 2.1.288 中可能导致更频繁登出的 claude auth status 改动,并新增 agent.spawn 等插件能力。
Code2Games 是一个智能体框架,基于同一游戏意图生成的 Blender 基础世界,通过共享的场景-玩法表示协调场景分析、玩法规划与游戏引擎定制,并将世界适配到 Unreal Engine 5,利用编译诊断、运行时反馈和玩法测试结果解决适配中的不一致。
ASCENT 提出一种在线智能体测试时训练方法,让 LLM 在部署过程中用自身执行轨迹更新权重,通过将验证过的轨迹作为特权信息自蒸馏进持久 LoRA 快速权重,无需外部参考解或更强教师模型。在 ALFWorld、WebShop 和 AppWorld 上,ASCENT 随经验积累提升任务成功率与交互效率,优于在线适应方法,并可迁移到未见场景。
MemAdapter 框架通过反事实归纳、上下文感知反思和基于证据的推理三个组件,自适应整合检索到的记忆,解决 LLM 智能体因长期记忆而产生的谄媚问题。该研究指出,即使记忆本身客观正确,也可能在不同语境下诱导谄媚行为,而现有方法仅通过过滤偏差记忆来缓解风险。在三个基准测试上,MemAdapter 持续提升了记忆可靠性,代码已开源。
Kandinsky 团队发布 Kandinsky 6.0 Video 系列扩散基础模型,含 3B 的 Lite 和 29B 的 Pro 两个版本,可生成 5 秒带 44 kHz 同步音频(含唇形同步)的视频,并通过内置超分辨率输出 1920×1080。
针对原生 2K 分辨率音视频联合生成模型训练中全注意力二次开销大、冗余 token 稀释学习信号的问题,研究者提出动态稀疏注意力框架 Prism。它将 token 序列组织为时空宏区,结合视频特征方差与音频到视频交叉注意力估计局部信息结构,为每个区动态分配块形状,并采用混合块选择策略确定逐 query 稀疏度。实验显示 Prism 相比全注意力实现 2.5 倍训练加速,且生成质量更优。
RobotUse 是一个机器人智能体框架,围绕物理动作的指定与修正来组织计算、上下文和决策:智能体可视化选择目标与位姿,后端负责几何、运动规划与控制,子智能体保留各子目标的详细交互并回传后续决策所需信息。
针对视觉-语言-动作(VLA)模型依赖"模态捷径"的问题,研究者提出 Perturbot 训练方法:通过任务保持的手腕视角扰动、加入决策相关描述丰富指令,并混入随机与失败轨迹片段并按其真实行为重新标注,在不改变推理的前提下让任务证据更易被使用、捷径不再充分。同时提出离线指标 GroundingFscore,用于诊断策略对模态捷径的依赖程度,与任务成功率互补,判断模型扩展是否健康。
针对 LoRA 持续学习中固定小学习率缺乏理论指导的问题,研究者提出 PaLoRA,通过自适应 SVD 截断压缩历史知识、将梯度投影到先前任务的零空间,并按秩感知方式自适应调节梯度步长。该方法在 50 任务的 ImageNet-A 和 ImageNet-R 基准上取得 4% 的准确率提升,长周期场景下表现尤为突出,论文已被 NeurIPS 2026 接收。
ALoDLM 通过 token 自适应潜在循环替代均匀计算,按 token 难度分配算力,在 1.7B 和 8B 两个参数规模、十一个基准上平均得分超过所有评测的扩散语言模型及对应 AR 基线。该方法将 token 级计算调度建模为潜在变量并推导条件 NELBO,同时保留快速并行解码,在优化推理引擎下取得更优的质量-效率权衡。
研究提出免训练单遍框架 LoHi,将密集低分辨率视频流与稀疏高分辨率图像帧通过 VLM 原生视频和图像通路结合,LoHi-Anchor 用编解码 I-frame 元数据选帧,LoHi-SemDiv 基于 CLIP 特征做查询相关性与视觉多样性选帧。
研究者推出 Ego2Act,一个面向目标导向操作的第一视角视频生成基准,包含 110 个真实世界任务的 2,640 段视频,覆盖不同物体杂乱度与多步复杂度。配套的 Ego2ActJudge 是无参考评估流程,在任务完成度和物理合理性上比相关基线更贴合人类共识。
Claude Code 发布 v2.1.288,新增 $.ui.selection() 返回全屏模式下最近选中的文本,并为无 GitHub CLI 的云会话内置 gh api。
一项研究记录了两个共享解码器与 tokenizer 的西班牙语安全模型在宽松工具调用指标上得分几乎相同(B4:0.660 vs 0.650),但逐字复现检查完全区分二者:661.6M 模型在 6/6 示例上生成有效工具调用,1,109M 模型在 0/6 上做到。
研究者构建了 ScholarCatalyst 基准,让 207 篇近期计算机科学论文的 184 位第一作者标注哪些候选论文推动了自己的项目,并据此提出检索任务。结果显示,Agentic 搜索(0.42 R@20)不如嵌入向量检索(0.48 R@20),即便基于 Claude Fable 5.1 的智能体也只达到 0.51 R@20。
Where-OPD 提出一种面向多模态大模型(MLLM)的在线策略自蒸馏方法,让教师模型获得文本形式的空间定位引导,从而定位并整合多个相关图像区域的证据,学生模型仅凭图像和问题复现该行为。
研究者提出免训练对比解码框架 LoopCD,通过对比最终预测与较早循环轮的中间表示来引导 token 选择,分为 logit 空间的 LoopCD-Logits 和隐状态空间的 LoopCD-Hidden 两种模式。
一项研究提出以稳定性为核心的泛化评估框架 SAGO,在单样本层面、多输入变体及多行为维度上衡量 LLM 对同一输入的行为变化,而非仅看基准准确率。结果显示,许多常用模型存在统计显著的泛化不稳定:没有模型能均匀泛化,行为轴捕捉到独立失败模式,跨数据集变化甚至可能逆转模型排名。该论文已被 NeurIPS 2026 的 TAE 研讨会接收。
Latent-Foresight 提出一种端到端框架,联合学习潜在 tokenizer 与基于流的生成动力学模型,显式塑造表征以支持时间可预测性。实验表明,该方法能学习到时间上更连贯的潜在表征,在多项未来场景理解任务与预测时域上持续优于两阶段基线,并省去独立训练阶段(含高分辨率适配)。实现代码与模型权重已开源。
LOCI 是一种混合空间记忆架构,在部分 Transformer 块中保留键值缓存,其余块则结合基于投影相机几何的循环线性注意力记忆,使视角同时参与记忆寻址与内容存储。在 MIND 基准与真实轨迹上,LOCI 比代表性世界模型及同配置全 softmax 模型更忠实地重现重访内容;保留完整历史时,同等长度下峰值内存降低约 30%。在有限记忆预算下,它还能以恒定内存流式处理长视频。
VTR-Bench 提出一套系统评测基准,专门评估视频生成模型的视觉文本渲染能力,包含 300 个覆盖广告、科学视频等五类场景的提示词,并开发了与人工对齐的自动化评测流程。
OneStreamer提出通过共享的主动生成过程,联合学习查询无关的证据记录与任务响应,其主动分层字幕记忆(PHCM)生成带时间锚定的局部细节字幕与已完成事件摘要,在不回溯历史视觉特征的情况下提供可复用的事实上下文。
研究团队提出交互式代码执行框架 PyRUA-Lean,将反馈驱动的基元组合与选择性观察相结合,减少视觉语言模型(VLM)智能体控制机器人时的 token 开销。
视频大语言模型(VideoLLMs)的时序推理能力在中间层达到峰值,却随层数加深逐渐衰减至输出层,导致反转帧序后预测结果往往不变。研究者据此提出 Temporal Activation Injection(TAI),在峰值层提取时序表征并注入后续层,无需训练即可在三个 VideoLLM 和四个基准上稳定提升时序推理,且对非时序任务影响极小。该研究已被 NeurIPS 2026 接收。
AgSpec 框架为编码智能体流水线补齐检索式推测解码缺失的语料库与草稿长度策略,从会话、工作区和全局语料检索,并按智能体离线画像设定草稿长度上限、在线自适应调整。在两个仓库级多智能体编码基准上,AgSpec 在多数设置下优于五种检索式草稿器及 EAGLE-3,批大小 1 和 16 时生成吞吐量较自回归解码分别提升最高 4.37 倍和 4.76 倍。
Omni-Embed-Mini 以 0.9B 参数将文本、语音、音频、图像、视频和富文本文档映射到统一余弦空间,且不更新任何文本侧参数。其核心思路是无需独立嵌入模型作为教师,直接以冻结骨干网络对密集级联标题的嵌入作为目标,配合 Matryoshka SigLIP 对比损失与在线混合难负例挖掘器完成对齐。
KaliBench 是一个面向 Kali Linux 上自然语言到 CLI 命令转换的细粒度基准与数据集,包含 8,504 对查询-命令,覆盖 1,642 个工具、23 个能力维度和 5 个安全阶段。