RenderFormer-V2:用异构场景基元做神经渲染
RenderFormer-V2 是一个基于 Transformer 的统一神经渲染模型,无需逐场景训练或专用代码即可处理焦散、体积散射、环境光照、带纹理与位移的表面及分布外材质等光照传输效果。它延续两阶段设计,在视图无关阶段引入窗口注意力与渲染感知注意力汇以提升可扩展性,并支持环境贴图和参与介质等异构场景基元,采用独立于表面反射模型的材质编码。该工作已被 ECCV 2026 接收。
项目更新、模型与开源社区动态
RenderFormer-V2 是一个基于 Transformer 的统一神经渲染模型,无需逐场景训练或专用代码即可处理焦散、体积散射、环境光照、带纹理与位移的表面及分布外材质等光照传输效果。它延续两阶段设计,在视图无关阶段引入窗口注意力与渲染感知注意力汇以提升可扩展性,并支持环境贴图和参与介质等异构场景基元,采用独立于表面反射模型的材质编码。该工作已被 ECCV 2026 接收。
Claude Code v2.1.267 新增 maxEffortLevel 设置,可对包括 Bedrock、Vertex 和 Foundry 在内的所有 provider 统一限制 effort 等级,用户仍可选择更低等级。
研究者提出 NOAH,一个时间感知、任务无关的生成式 Transformer 模型,可表征并预测完整的多模态患者病程。该模型基于 MIMIC 数据集家族中 299,000 名患者、431,000 次就诊的逾 5.59 亿条临床事件构建,原生处理医学图像、时间序列与数值信号、分类事件及结构化与非结构化临床记录。
多模态大模型在细粒度图像差异识别上仍很脆弱。VDiff-Bench 包含 1,756 道四选一题目,覆盖位置、运动、颜色、噪声/分辨率、纹理、OCR/文本、光照等 10 类变化,并配有需区分真实变化与近似语义选项的难负样本。
一项企业分析研究让语言模型只负责理解问题,由确定性策略选择并运行预先批准的分析程序,同时返回结果与证据。在 440 次运行中,三个 8B 模型运行时生成 SQL 并选工具,330 次运行规划无一满足完整的答案加证据契约,而策略执行的 Qwen3-8B 分析器 110 次全部匹配。
研究者提出一种无需配对 3D 监督的前馈式 3D 编辑框架,通过生成先验蒸馏从基础模型向 3D 编辑模型迁移视觉、语义与几何知识。该方法借助可微渲染管线,在主编辑视图用图像编辑模型的 2D 视觉先验、在新视图用视觉语言模型的语义先验进行监督,并引入 3D 感知分布匹配正则化以缓解几何坍塌与多视图不一致。实验显示其在指令保真度与跨视图一致性上显著优于现有基线。
针对 Hugging Face 事件与一起公开 wiki 调查,研究者提出防御的操作单元应是可修订的“协同事件”,将观察到的传输、任务权限与响应历史关联起来。核心问题是前瞻性事件发现:在评估者给出归属之前,判断哪些动作属于同一事件。论文给出评估设计,在同等审查成本与误报负载下比较孤立动作、滚动窗口、已知群体与前瞻发现的事件,并检验通道关闭与状态隔离后的复发情况。
针对全双工语音模型文本生成、语音合成与音频播放异步导致"自认为说过"与"用户实际听到"不一致的问题,研究者提出 Self-Listening 建模方法,将模型已播放的语音作为输入流回喂,使打断恢复锚定在用户真实听到的内容上。
研究团队发布 SynthGait-19K,一个包含 19,272 段步行视频的物理仿真合成数据集,源自 437 名受试者的 6,427 段 MoCap 序列,并配有 SMPL 动作与六项步态参数标注。
研究团队提出 OpenWAM,一个将世界-动作模型(WAM)预训练拆解为可组合模块的开放研究栈,并配套统一训练、推理、部署与评估的基础设施 OpenWAM-Infra。
A*-Thought-V2 提出一种基于 LLM 几何动力学的框架,将 CoT 建模为隐藏状态轨迹,用显式-隐式交错潜在架构替代硬删除。在 Qwen3.5-9B 和 Qwen3.6-27B 上,六个基准测试平均准确率最高提升 2.6%,响应长度最多减半,单位计算准确率提升 2.29 倍,预处理和训练时间分别减少 94.6% 和最高 80.3%。
Marigold V2 将基于 DiT 架构的预训练多步 flow-matching 模型改造为单步推理的单目深度估计器,在 KITTI 和 ETH3D 上 AbsRel 较此前最佳提升 16-26%。
UCF-Net 通过不确定性感知的级联融合网络,结合 CLIP 的语言对齐语义先验与 DINO 的自监督视觉结构先验,跨 Transformer 深度提取层级特征并按熵推导的不确定性加权融合。
RelightFormer 是一个前馈生成式 Transformer,可直接完成单视角与多视角图像重光照,无需显式估计材质等本征属性。它改造自视频基础模型,通过潜在光照模块以 cross-attention 注入目标环境贴图,并用置换不变位置编码处理无序多视角输入。
Cadence 是一款误差有界的有损压缩器,将 330M 参数的 Google TimesFM-3 与自适应算术编码器结合,保证每个样本满足 |x̂_t−x_t|≤τ。
研究者提出 SQS,一个通过贝叶斯变分学习同时进行剪枝与低比特量化的统一框架,采用 spike-and-slab 先验诱导稀疏性、用高斯混合模型(GMM)建模量化权重,并给出高效近似与变分方法的一致性理论结果。在 ResNet、BERT-base、Llama3.2 和 Qwen2.5 上的压缩实验显示,SQS 在性能下降相当的情况下压缩率高于现有方法。该论文已被 TMLR 接收。
研究用 ExpertCollab 多轮研究规划对话语料发现,Transformer 对对话伙伴专业水平的推断在早期层最易解码,到网络中点前已降至接近随机水平。反事实修补显示,在解码峰值层注入专业水平差异几乎不改变固定后期层读出,而在中点之后注入则几乎完全传播,差距超过一个数量级。这表明推断出的关系属性在被因果使用前早已被表征,界定了读取或引导伙伴条件行为的干预位置。
ReactVAU 是一个面向实时流式视频异常理解(VAU)的慢-快解耦框架,被 ECCV 2026 接收。它由基于 Spatial Grid Folding(SGF)的轻量快速检测模块、保护关键视觉线索的 Anomaly-Aware Persistent Memory(AAPM),以及仅在可疑事件时唤醒的重量级慢推理模块组成。
研究仅用机器改写指令、不改架构,为 Cosmos3 视觉-语言-动作策略加入希腊语。在 90 任务判别套件、每组 3 个种子的测试中,双语训练比对照组稳定高出 6.7-7.1 分,达到英语性能约五分之二;仅希腊语训练最多超出对照 2.7 分,无希腊语演示的多语言文本塔则停留在错误指令下限。策略还会过拟合译者的措辞,每任务用 7 种表述训练可将该损失约减半。
一项被 EMNLP 2026 主会接收的研究发现,1.7B 至 70B 的指令微调模型中存在一条隐藏状态线性方向,能区分可答问题与结构性无解的数学和代码提示,说明模型在生成前已表征出问题无解。
CoVeR 是一种无需训练、确定性的视觉 token 选择器,仅利用 token 坐标实现多视图 3D 场景的覆盖率剪枝。在三个 3D 推理基准上,它仅保留约 8% 的视觉 token 即可维持全量 token 93.5% 的性能,平均超越此前 SOTA 3.9 个百分点,并可作为即插即用模块适配四种 VLM。
研究团队提出 RoboSPA,一个面向 VLA 模型具身推理诊断的大规模机器人操作数据集与基准,聚焦细粒度空间推理与长程程序规划,覆盖 10 个任务类别、56 个基础任务,每个任务设五级难度共 280 个变体,采集 527K 条轨迹。
AuK 是一个开源基础模型,用自然语言指令和音频上下文这一统一接口完成语音生成与编辑,团队为此构建了约 3.03 billion 条指令-音频实例、1.95 million 小时有效监督,覆盖语音生成、内容编辑、增强与分离、副语言编辑和声学编辑五类任务。
TransNormal-2 是一个基于 FLUX.2 的整流流框架,采用单步确定性推理,通过几何感知像素空间损失和轻量级 Geometric Refinement Module(GRM)在 VAE 解码器两侧修正法线估计退化。
研究者提出 Procedural Graph,将智能体的程序性知识组织为(procedure, relation, procedure)三元组,在每步决策时定位活跃节点并由引导模型将子图转化为步骤级情境指引,从而偏置而非强制求解器的下一步动作。
研究者提出 Causal Visual Recurrent Reasoning(CVRR),从预训练视觉语言模型融入图像后的问题隐藏状态初始化循环计算,反复更新状态并重读同一固定视觉证据,解码前移除视觉状态与原始多模态 KV cache,使循环计算成为预测必需的图像条件路径。
针对自回归视频扩散模型蒸馏中 DMD 反向 KL 目标导致的模式坍缩、画面过饱和与过平滑问题,研究者提出 Mask Forcing 双噪声掩码 Rollout 策略,在自回归学生模型自 rollout 过程中沿空间和时间轴注入随机掩码,向噪声输入中引入更干净的信号。该方法无需真实视频数据或额外后训练阶段,即可提升多种自回归视频扩散蒸馏方法的视觉质量。
研究团队发布 Gander,一个基于 MiniCPM-o 4.5 构建的原生多模态全双工交互模型,采用异步智能体循环实现实时交互。Gander 采用 Cerebellum-Brain 协作框架:Cerebellum 负责实时交互,Brain 处理复杂推理与高层智能体任务,两者通过工具调用和智能体编排运行时持续交互。模型支持用户打断、主动反馈与追问,并已开源模型、代码和数据。
BeaconKV 是一种免训练的 KV cache 压缩方法,通过维护 beacon queries(全局查询簇的紧凑代表)来预判哪些 KV 对会被重新访问,从而避免存储完整查询历史。在四个开源大型推理模型和多个推理基准上,该方法最高实现 5.8 倍内存压缩,几乎保持完整缓存精度,吞吐量提升超过 4.3 倍。该工作已被 ICML 2026 接收。
研究者提出 TANGO,一个面向杂乱环境语言引导人形穿越的全身视觉-语言-动作框架,输入自然语言指令与自我中心 RGB 观测后直接预测 29-DoF 关节空间动作。
研究者提出 On-Policy Reverse Distillation(OPRD),通过在学生的 rollout 上评估教师相对参考策略的策略偏移,并沿该方向放大由 verifier 驱动的策略梯度分量,从而在保留策略优化驻点的同时加速学习、超越教师。
AgiBot Research Team 发布技术报告 GE-Act 2.0,这是一个世界动作模型,其可训练的生成组件和动作组件全部在操作数据上从头初始化,由控制导向自编码器 CoAE、单步视觉规划器 SVP 和逆动力学模型 IDM 组成,采用知识对齐选择性优化 KASO 联合训练。
研究者提出 Kalman Delta Networks(KDNs),一类显式追踪记忆不确定性以指导每次更新的线性注意力模型,将关联记忆建模为线性高斯状态空间模型,用 Kalman 增益平衡累积证据与新观测可靠性。
RadixArk 发布 Miles v0.1,一套覆盖完整后训练流程的生产级系统,已在 GitHub 开源并提供项目网站。系统基于 slime 的设计,rollout 引擎构建在 SGLang 上,训练器可选 NVIDIA Megatron-LM 与 PyTorch FSDP 两种后端,并提供三种权重同步传输方式适配不同部署拓扑。
研究以 Schwartz 基本人类价值观理论为框架,构建覆盖 20 种价值观的 26K 样本基准,检验 LLM 激活引导向量是否编码连贯的语义结构。
一篇综述提出按控制器对生成过程的直接控制范围划分智能体化视觉生成:L1 条件控制、L2 执行控制、L3 结果自适应控制、L4 经验自适应控制,L0 则指无控制器的固定生成器、编辑器、评估器、奖励模型、基准与流水线。该框架强调这些层级描述的是决策范围逐步扩大,而非模型规模、系统复杂度、输出质量、工具或角色数量或训练方法,并据此梳理图像、视频、编辑、3D、世界、幻灯片与用户界面生成中控制器能力的演进。
研究者提出反馈增强环境(FEEs),将智能体训练从"智能体侧预热"转向"环境侧适配",通过在回合内探索与回合间演化后期从动作引导转为观测增强来缓解长程任务的奖励稀疏问题。在 SciWorld 和 BFCL 基准上,FEEs 配合 Qwen3 各规模模型及 GRPO、GSPO、DAPO 等 RL 算法均稳定优于标准设置,并能降低熵波动、促进状态空间探索,使环境引导内化进策略权重。
一项研究基于两个生产系统约六个月的连续记录,测量自主大语言模型交易智能体的真实行为,其间包含 750 万次单模型调用、约 30 万次链上操作,以及 231,638 个多工具轮次产生的 14,596 笔成交。
研究团队发布 CosmoH2G 手部到夹爪迁移数据集,包含 1,254 个物体的 6,189 条演示轨迹,空间复杂度显著高于现有基准。该方法采用两阶段框架:第一阶段预测稀疏夹爪关键帧(初始与终止),第二阶段据此生成完整连续动作序列,并通过抓取启发式与运动学一致性对平移做后优化以缓解累积漂移。仿真与真机实验显示,该框架在复杂空间操作的手部到夹爪迁移上稳定精确,明显优于传统基线。
针对大规模长上下文 RL 后训练中投机解码的在线草稿协同训练难题,研究者提出端到端系统,解决标准因果上下文并行(CP)不支持分支注意力、目标特征跨流水线并行(PP)阶段两大障碍。