RelightFormer:面向多视角物体重光照的前馈生成式 Transformer
RelightFormer 是一个前馈生成式 Transformer,可直接完成单视角与多视角图像重光照,无需显式估计材质等本征属性。它改造自视频基础模型,通过潜在光照模块以 cross-attention 注入目标环境贴图,并用置换不变位置编码处理无序多视角输入。
项目更新、模型与开源社区动态
RelightFormer 是一个前馈生成式 Transformer,可直接完成单视角与多视角图像重光照,无需显式估计材质等本征属性。它改造自视频基础模型,通过潜在光照模块以 cross-attention 注入目标环境贴图,并用置换不变位置编码处理无序多视角输入。
Cadence 是一款误差有界的有损压缩器,将 330M 参数的 Google TimesFM-3 与自适应算术编码器结合,保证每个样本满足 |x̂_t−x_t|≤τ。
研究者提出 SQS,一个通过贝叶斯变分学习同时进行剪枝与低比特量化的统一框架,采用 spike-and-slab 先验诱导稀疏性、用高斯混合模型(GMM)建模量化权重,并给出高效近似与变分方法的一致性理论结果。在 ResNet、BERT-base、Llama3.2 和 Qwen2.5 上的压缩实验显示,SQS 在性能下降相当的情况下压缩率高于现有方法。该论文已被 TMLR 接收。
研究用 ExpertCollab 多轮研究规划对话语料发现,Transformer 对对话伙伴专业水平的推断在早期层最易解码,到网络中点前已降至接近随机水平。反事实修补显示,在解码峰值层注入专业水平差异几乎不改变固定后期层读出,而在中点之后注入则几乎完全传播,差距超过一个数量级。这表明推断出的关系属性在被因果使用前早已被表征,界定了读取或引导伙伴条件行为的干预位置。
ReactVAU 是一个面向实时流式视频异常理解(VAU)的慢-快解耦框架,被 ECCV 2026 接收。它由基于 Spatial Grid Folding(SGF)的轻量快速检测模块、保护关键视觉线索的 Anomaly-Aware Persistent Memory(AAPM),以及仅在可疑事件时唤醒的重量级慢推理模块组成。
研究仅用机器改写指令、不改架构,为 Cosmos3 视觉-语言-动作策略加入希腊语。在 90 任务判别套件、每组 3 个种子的测试中,双语训练比对照组稳定高出 6.7-7.1 分,达到英语性能约五分之二;仅希腊语训练最多超出对照 2.7 分,无希腊语演示的多语言文本塔则停留在错误指令下限。策略还会过拟合译者的措辞,每任务用 7 种表述训练可将该损失约减半。
一项被 EMNLP 2026 主会接收的研究发现,1.7B 至 70B 的指令微调模型中存在一条隐藏状态线性方向,能区分可答问题与结构性无解的数学和代码提示,说明模型在生成前已表征出问题无解。
CoVeR 是一种无需训练、确定性的视觉 token 选择器,仅利用 token 坐标实现多视图 3D 场景的覆盖率剪枝。在三个 3D 推理基准上,它仅保留约 8% 的视觉 token 即可维持全量 token 93.5% 的性能,平均超越此前 SOTA 3.9 个百分点,并可作为即插即用模块适配四种 VLM。
研究团队提出 RoboSPA,一个面向 VLA 模型具身推理诊断的大规模机器人操作数据集与基准,聚焦细粒度空间推理与长程程序规划,覆盖 10 个任务类别、56 个基础任务,每个任务设五级难度共 280 个变体,采集 527K 条轨迹。
AuK 是一个开源基础模型,用自然语言指令和音频上下文这一统一接口完成语音生成与编辑,团队为此构建了约 3.03 billion 条指令-音频实例、1.95 million 小时有效监督,覆盖语音生成、内容编辑、增强与分离、副语言编辑和声学编辑五类任务。
TransNormal-2 是一个基于 FLUX.2 的整流流框架,采用单步确定性推理,通过几何感知像素空间损失和轻量级 Geometric Refinement Module(GRM)在 VAE 解码器两侧修正法线估计退化。
研究者提出 Procedural Graph,将智能体的程序性知识组织为(procedure, relation, procedure)三元组,在每步决策时定位活跃节点并由引导模型将子图转化为步骤级情境指引,从而偏置而非强制求解器的下一步动作。
研究者提出 Causal Visual Recurrent Reasoning(CVRR),从预训练视觉语言模型融入图像后的问题隐藏状态初始化循环计算,反复更新状态并重读同一固定视觉证据,解码前移除视觉状态与原始多模态 KV cache,使循环计算成为预测必需的图像条件路径。
针对自回归视频扩散模型蒸馏中 DMD 反向 KL 目标导致的模式坍缩、画面过饱和与过平滑问题,研究者提出 Mask Forcing 双噪声掩码 Rollout 策略,在自回归学生模型自 rollout 过程中沿空间和时间轴注入随机掩码,向噪声输入中引入更干净的信号。该方法无需真实视频数据或额外后训练阶段,即可提升多种自回归视频扩散蒸馏方法的视觉质量。
研究团队发布 Gander,一个基于 MiniCPM-o 4.5 构建的原生多模态全双工交互模型,采用异步智能体循环实现实时交互。Gander 采用 Cerebellum-Brain 协作框架:Cerebellum 负责实时交互,Brain 处理复杂推理与高层智能体任务,两者通过工具调用和智能体编排运行时持续交互。模型支持用户打断、主动反馈与追问,并已开源模型、代码和数据。
BeaconKV 是一种免训练的 KV cache 压缩方法,通过维护 beacon queries(全局查询簇的紧凑代表)来预判哪些 KV 对会被重新访问,从而避免存储完整查询历史。在四个开源大型推理模型和多个推理基准上,该方法最高实现 5.8 倍内存压缩,几乎保持完整缓存精度,吞吐量提升超过 4.3 倍。该工作已被 ICML 2026 接收。
研究者提出 TANGO,一个面向杂乱环境语言引导人形穿越的全身视觉-语言-动作框架,输入自然语言指令与自我中心 RGB 观测后直接预测 29-DoF 关节空间动作。
研究者提出 On-Policy Reverse Distillation(OPRD),通过在学生的 rollout 上评估教师相对参考策略的策略偏移,并沿该方向放大由 verifier 驱动的策略梯度分量,从而在保留策略优化驻点的同时加速学习、超越教师。
AgiBot Research Team 发布技术报告 GE-Act 2.0,这是一个世界动作模型,其可训练的生成组件和动作组件全部在操作数据上从头初始化,由控制导向自编码器 CoAE、单步视觉规划器 SVP 和逆动力学模型 IDM 组成,采用知识对齐选择性优化 KASO 联合训练。
研究者提出 Kalman Delta Networks(KDNs),一类显式追踪记忆不确定性以指导每次更新的线性注意力模型,将关联记忆建模为线性高斯状态空间模型,用 Kalman 增益平衡累积证据与新观测可靠性。
RadixArk 发布 Miles v0.1,一套覆盖完整后训练流程的生产级系统,已在 GitHub 开源并提供项目网站。系统基于 slime 的设计,rollout 引擎构建在 SGLang 上,训练器可选 NVIDIA Megatron-LM 与 PyTorch FSDP 两种后端,并提供三种权重同步传输方式适配不同部署拓扑。
研究以 Schwartz 基本人类价值观理论为框架,构建覆盖 20 种价值观的 26K 样本基准,检验 LLM 激活引导向量是否编码连贯的语义结构。
一篇综述提出按控制器对生成过程的直接控制范围划分智能体化视觉生成:L1 条件控制、L2 执行控制、L3 结果自适应控制、L4 经验自适应控制,L0 则指无控制器的固定生成器、编辑器、评估器、奖励模型、基准与流水线。该框架强调这些层级描述的是决策范围逐步扩大,而非模型规模、系统复杂度、输出质量、工具或角色数量或训练方法,并据此梳理图像、视频、编辑、3D、世界、幻灯片与用户界面生成中控制器能力的演进。
研究者提出反馈增强环境(FEEs),将智能体训练从"智能体侧预热"转向"环境侧适配",通过在回合内探索与回合间演化后期从动作引导转为观测增强来缓解长程任务的奖励稀疏问题。在 SciWorld 和 BFCL 基准上,FEEs 配合 Qwen3 各规模模型及 GRPO、GSPO、DAPO 等 RL 算法均稳定优于标准设置,并能降低熵波动、促进状态空间探索,使环境引导内化进策略权重。
一项研究基于两个生产系统约六个月的连续记录,测量自主大语言模型交易智能体的真实行为,其间包含 750 万次单模型调用、约 30 万次链上操作,以及 231,638 个多工具轮次产生的 14,596 笔成交。
研究团队发布 CosmoH2G 手部到夹爪迁移数据集,包含 1,254 个物体的 6,189 条演示轨迹,空间复杂度显著高于现有基准。该方法采用两阶段框架:第一阶段预测稀疏夹爪关键帧(初始与终止),第二阶段据此生成完整连续动作序列,并通过抓取启发式与运动学一致性对平移做后优化以缓解累积漂移。仿真与真机实验显示,该框架在复杂空间操作的手部到夹爪迁移上稳定精确,明显优于传统基线。
针对大规模长上下文 RL 后训练中投机解码的在线草稿协同训练难题,研究者提出端到端系统,解决标准因果上下文并行(CP)不支持分支注意力、目标特征跨流水线并行(PP)阶段两大障碍。
论文提出 MovieGrid 多网格后训练范式,将长视频分解为按时间排序的短片并排布在空间网格上联合建模,从而减少每条时间轴要处理的镜头数量。作者基于 1,000 个长视频构建 MGLV 数据集,产出 54K 网格视频及带角色标注的故事提示词。
SceneMosaic 框架结合图像先验与 VLM 智能体演化,在 SceneEval-100 上语义布局质量追平最强智能体基线,速度提升 24 倍,并大幅减少物理违规,获得最高人工评分。该方法将场景分解为独立局部单元分别演化,再通过笛卡尔积组合成全局场景,从而兼顾效率与物理有效性。代码已公开。
VidaForge 将视频数据配方表示为从原始视频到训练数据集的可执行五阶段工作流,并开源含 314 万个场景级片段、共 6475 小时的 VidaForge-3M 数据集。在 Wan 2.1 与 V-JEPA 2.1 的早期从零预训练对比中,覆盖更广的配方在下游基准上得分最高,而基于 loss 的评估则偏好不同配方。
NeoHorse-1 是面向递归自我改进(RSI)的智能体原生模型系列,通过异构模型池与智能路由记录每轮能力需求、服务层级和交互,并转化为保留交错推理、工具调用与 harness 上下文的训练样本。在覆盖 harness 智能体、工具使用、编程和指令遵循的 11 项基准上,后训练将 4B 模型宏平均从 58.94 提升至 64.87,9B 从 65.60 提升至 69.04。
研究团队发布 MOLE 开放基准,用 150 个 AI 运营账号、9 个有状态服务、30 个工作日和 12 类威胁,检验防守方能否在有限审查预算下从日常工作中识别内部威胁。
DriveZero 是一个把感知与动作分开预训练、再统一为相机端到端规划器的自动驾驶系统,无需任何人类轨迹监督。
一项针对双节点拆分 LLM 训练系统的安全案例研究显示,UCN 收到的帧中混有真实行与诱饵行,而损失函数忽略诱饵,使其梯度恰好为零,零值模式直接暴露了哪些行是真实数据。
因果基础模型(CFMs)是一类预训练神经网络,无需更新模型参数,即可通过上下文学习在全新数据集上估计平均处理效应等因果量。该工作为这一新兴方向提供实用入门,梳理因果推断与机器学习的必要背景,并附示例代码与 Jupyter notebooks。
研究提出"窄边界安全"问题与边界感知自蒸馏框架,结合受控主题生成、覆盖修复、分布内补偿数据和有害-良性配对数据,让同一基座模型可在同一话题内设定不同拒答边界。
研究者提出 Conformal Relevance 框架,通过上下文学习示例筛选与集成构建评分函数,在保持覆盖率的条件下提升简洁性,减少人工提示词工程。该框架在 7 项 NLP 任务上得到验证,并从理论上给出集成多样性提升最差句子评分的互补条件及饱和上界。论文为 EMNLP 2026 Findings,代码已开源。
SimpleMemVLA 提出一种无需专用记忆模块的 VLA,直接以 backbone 原生视频上下文作为记忆,将历史保留为带时间戳的视频格式,并通过生成子任务的隐藏状态把证据路由到 flow-matching 动作头。
Claude Code v2.1.266 修复了 2.1.265 引入的回归问题:环境变量 `CLAUDE_CODE_USE_GATEWAY` 在 2.1.265 中会单独强制 Cloud-gateway 登录。
Claude Code v2.1.265 发布,新增将 user.email 和 user.groups 纳入 Claude Desktop 与 Cowork 经 Claude apps gateway 发送的遥测数据,并支持 --plugin-dir 指向插件文件夹,运行中增删子文件夹可被识别。