SILSA:用滑动窗口切片隐变量实现拓扑保持的高分辨率 3D 生成
SILSA 是一个拓扑感知的 3D 生成框架,用沿三个坐标轴的固定重叠切片隐变量替代昂贵的体素 token,实现单阶段 rectified-flow 生成。它通过 Slice VAE 与 Volumetric Anchor Lattice 协调多轴切片流,并引入切片级拓扑监督对齐 Betti 转变。
SILSA 是一个拓扑感知的 3D 生成框架,用沿三个坐标轴的固定重叠切片隐变量替代昂贵的体素 token,实现单阶段 rectified-flow 生成。它通过 Slice VAE 与 Volumetric Anchor Lattice 协调多轴切片流,并引入切片级拓扑监督对齐 Betti 转变。
AutoGUIWorld 是一个数据生成框架,结合图像生成器的视觉先验与规划器的任务知识,无需部署或运行软件环境即可合成 GUI 交互轨迹。它从操作系统上下文、视觉外观和界面状态的结构化规格中采样初始场景,生成 79,266 条覆盖 Ubuntu、Windows、macOS 和 Chrome 的空间标注步级训练样本。
研究者提出首个基于用户历史的个性化图像生成统一基准,包含个性化场景生成与个性化创意生成两项任务,以及覆盖目标保真度、视觉质量、用户可区分性、语义对齐和任务效用的多轴评估协议。同时提出 PEARL,将多模态推理器与冻结的图像生成器耦合为交错的“推理-反思”循环,并用差分数据奖励优化,在两项任务上平均提升 15% 的个性化指标。
PixelDense 提出用稠密预测模型替代纯语义编码器作为像素扩散的表征对齐目标,将 DINOv2 与 SAM2 归入语义投影流、Depth Anything v2 与 Metric3D v2 归入几何投影流,并加入权重空间正交惩罚使两流处于不相交子空间。
Google Research 提出 Diffusion Controller 框架,将扩散模型去噪过程重构为连续控制问题,用一个轻量"转向阻尼"网络在冻结基座模型的前提下动态调整生成轨迹。在 Stable Diffusion v1.4 上以 HPS-v2 评测,其完全解锁版本对基线模型取得 90% 胜率,并支持在无法访问内部权重的闭源模型上实现定制控制。
PixelUMM 是一个无需编码器的统一多模态模型,直接在像素空间完成图像与视频的理解和生成,将图像表示为空间 patch、视频表示为时空 tubelet,通过单层线性投影接入共享多模态主干。
研究团队提出 Tex-Zero,证明高保真原生 3D 纹理生成框架无需 3D 资产即可训练。该方法将高质量 2D 图像表示为 3D 空间中的平面,并通过分块随机旋转与聚合构造复杂几何结构,生成训练样本。基于这些数据训练的 Tex-Zero VAE 和 Tex-Zero DiT 在未见过真实 3D 资产的情况下,仍能生成细节精细的高保真 3D 纹理。
研究提出奖励加权传输蒸馏(RWTD),一种仅需生成样本和标量奖励评估的一步生成模型后训练方法,通过混合当前与参考分布的自适应目标,经特征空间最优传输与不动点回归实现。该方法将一步 SANA Sprint 1.6B 的 GenEval 分数从 0.73 提升至 0.80,偏好对齐实验显示其具备跨奖励泛化能力,能兼顾改进与组合能力保留。
Google Research 在 ICLR 2026 论文《On the Interpolation Effect of Score Smoothing in Diffusion Models》中解释了扩散模型的创造力来源:神经网络训练中的正则化会让学到的分数函数被"平滑",使去噪过程在训练数据点之间插值,从而生成新样本而非简单记忆。