MoE 强化学习中的专家空间探索(ESRL)
研究者提出 Expert-Space Exploration Reinforcement Learning(ESRL),一个显式探索 MoE 模型专家路由空间的架构感知框架,通过保留高置信专家作为锚点、将随机路由限制在候选池内并按 router 熵自适应调整扰动强度来提升 rollout 多样性。
huggingface.co · 开发者平台
研究者提出 Expert-Space Exploration Reinforcement Learning(ESRL),一个显式探索 MoE 模型专家路由空间的架构感知框架,通过保留高置信专家作为锚点、将随机路由限制在候选池内并按 router 熵自适应调整扰动强度来提升 rollout 多样性。
研究者提出 Minimal Intervention Reinforcement Learning(MInTRL),通过在在线策略 rollout 中周期性插入稀疏局部修正来扩展探索边界,训练时采用序列级优势回归目标,无需重要性采样。在数学与代码基准上,MInTRL 持续优于标准在线策略与离线策略基线;消融显示自干预和不同 judge 策略下仍有效,且性能在中等干预强度时达到峰值。
研究者提出 Grouped Value Attention(GVA),只存储分组 value,并用学习到的线性映射重建 content key,推理时该映射可吸收进 query,无需物化 content key。
团队构建了生产级双语希腊语-英语语音识别系统 Sophea,在 23 轮训练和两种模型架构下,没有任何训练数据组合能同时通过全部九项生产门禁。三模型 ROVER 集成将门禁覆盖从单模型的 4-7/9 提升至 9/9,重叠语音 WER 从 53.35% 降至 37.87%。
AlayaVista 是一个相机可控的流式视频世界模型,将全景世界演化与透视观测合成解耦:给定单张透视图像,先用预训练全景扩展模型构建 360 度场景先验,再以相机条件化的全景 latent 状态演化场景,由 latent viewport renderer 映射为透视视频 latent,透视 refiner 负责恢复细节、抑制伪影并做超分。
研究团队提出免训练多智能体框架 RSIAgent,通过课程、执行与验证三类智能体协同探索环境,构建可复用的因果记忆,并采用"先广后深"的探索策略。在 OSWorld-v2 和 Agent's Last Exam 上,RSIAgent 显著提升开源模型表现,使 Kimi-K3 和 GLM-5.3 超越 GPT-6 等前沿闭源模型。
蚂蚁集团 Venus 团队与清华大学发布 Realtime-Venus 全双工交互系统,包含两个独立训练的 9B 模型:Realtime-Venus-Omni 负责音视频交互,Realtime-Venus-Audio 负责语音对话。
HazardAuditor 是一个面向计算机使用智能体的执行级安全框架,可在受控环境中运行 Claude Code、Codex、Hermes、OpenClaw 等异构智能体,并将其交互归一化为统一事件表示以实现跨框架监督。
研究提出 Agent as Policy(AGP),让通用智能体无需任务或环境专属训练即可直接驱动机器人执行操作,在八项真实世界任务配置中有七项成功率达到至少 80%,显著优于此前的智能体机器人系统。AGP 由智能体理解视觉信息、编写可执行程序、发出运动指令,并根据物理结果修正动作,覆盖精密操作、动态运动和可形变物体等任务。研究还发现,复用已保存的流程和程序可以缩短重复试验的执行时间。
研究提出一种推理架构,将设计方向作为显式中间决策,用预生成步骤产出带典型性评分的结构化设计规范,再由外部选择器采样、下游生成器在固定设置下实现,从而把探索与实现分离。
研究显示,在三个 LLaMA-3-8B 后门场景中,固定模型、干净数据和投毒数量时,仅因投毒集选择不同,攻击成功率就从 3% 波动到 80%。为此作者提出 SAILS,将投毒集选择形式化为带 oracle 预算的集合优化,用数百次微调-评估训练集合打分器,从数百万候选集中筛选并审计少量候选。
研究提出 Elo-per-token 分析,追踪每个 token 预算下找到的最优解,并用 Bradley-Terry 模型将任务内排序聚合为跨任务的 Elo 评分。
KaiNinja 是 TRELLIS.2 的部件级扩展,基于其 O-Voxel 表示的双体积形式,无需 mask 或分割器即可在保持生成速度与质量的同时输出部件级资产。其训练数据涵盖 CAD 模型及 LLM 智能体生成的资产,据称是首个用智能体创作部件数据训练的 3D 生成模型。相比不同范式的部件生成流程,整体物体 Chamfer 距离降低 40%,严格部件 F-score 提升 16%。
研究团队发布 Atria Dawn Preview,一个面向科学研究和工程工作流的基础智能体语言模型,通过可验证经验管道训练,在16项基准中与前沿智能体竞争并在五项上取得最高分。论文还基于56名参与者的769条任务记录分析人机协作,约三分之一AI辅助完成的任务被参与者认为没有AI无法完成。智能体常提出方法并实施修改,人类保留最终决策。
ZGCM-1 是一个完全开源、从零训练的 7B 稠密基础模型,支持 256K 上下文,面向数学推理与智能体搜索。论文开源了预训练、中训练与后训练阶段的权重、中间 checkpoint、训练代码、分阶段数据与数据配方以及 W&B 日志。
研究者提出探索引导式提示词脚手架框架,在多模态大语言模型(MLLM)的在线强化学习后训练中动态调整训练提示词分布,核心是可直接由 on-policy rollout 统计计算的 Exploration Potential Score(EPS)。
Vidu S2 包含实时交互数字人模型 Vidu S2-Avatar 和实时视频编辑模型 Vidu S2-Editing,并探索了两者实时空间视频生成的可行性。
DeepCybo 团队发布 PhysBrain 1.5,一个统一理解物理环境、生成动作并预测未来状态的物理基础模型。该模型从通用视觉语言模型出发,将语言响应、末端执行器运动和稠密视觉目标编码为离散序列,以自回归下一 token 预测联合优化,预训练监督全部来自人类交互视频。
研究者推出 BVB(Blender-VideoBench)基准,要求智能体通过编写代码将真实视频重建为 Blender 动画场景,以检验其视频理解能力。评测覆盖 10 个模型家族的 51 种配置,最佳模型 Latent Similarity 达 88.6,但仅保留源视频 53.7% 的时空事实,增加推理可提升感知相似度却无法弥合该差距。
研究者提出 Discovery Foundation Models(DFMs),将基础模型从解决人类给定的问题推进到参与新问题、表示与知识的创造过程,并定义问题发现、假设形成、干预、证据修正等七项耦合能力。
Attention-DP3 是一种空间物体感知的 3D 扩散策略,在保持 DP3 扩散骨干不变的前提下,通过注意力机制注入物体级几何线索。该方法先对 RGB 图像做开放词汇 2D 分割,再借助标定相机几何将目标掩码提升到 3D,并通过 Tri-field Attentional Conditioning 构建目标性、目标内显著性和背景性三个场。
LLaDA-UI 是一个 16.7B 参数的 MoE 块级扩散视觉语言 GUI 智能体,采用两阶段训练:先以通用多模态预训练对齐原生分辨率视觉编码器与 LLaDA2.0-mini-base 扩散语言骨干,再在移动、桌面、Web 与 grounding 数据上做 GUI 智能体监督微调。
研究团队提出 Omni-Streaming Thinking(OST),通过将音视频证据分开存储、把结论标记为待验证并绑定未来验证区间,在检测到矛盾证据时进行反驳与状态更新,解决流式全模态模型的"过早跨模态承诺"问题。
ReMoMask-2 将检索数据库重建在生成器的量化前潜在空间中,并用蒸馏的轻量投影器对齐文本查询,让生成器直接消费检索到的动作语义内容。
MobileVLA-R1 2.0 是一个 RL 增强的 VLA 框架,通过监督式 CoT 对齐与强化学习实现多粒度具身推理,并引入推理条件动作解码器,将多模态推理表示映射为任务级动作目标。
Pelican-Sim 1.0 是面向具身智能的通用世界模型模拟器,可从视觉上下文和机器人动作预测未来观测。它采用 28 维统一动作空间、动作-视觉注入、稀疏 MoE 与四步自回归蒸馏,实现 5.67 倍加速,并在 AgiBotWorld Beta、RoboMIND、RoboTwin 上分别将 PSNR 提升 4.636、2.080、10.343。
Occamy-1.0 是基于 Qwen3.6-35B-A3B 检查点继续训练得到的开源协作智能体模型,权重与部分训练数据已发布。该模型在四类代表性协作基准上的综合表现处于成本-性能帕累托前沿的低成本拐点,并在工具调用、编程和指令遵循评测中保持广泛智能体能力。
CARPM-FIQA 通过在整个训练过程中累积相对点边际测量值(类内紧凑度与类间分离度之比),替代单轮次估计来稳定人脸图像质量评估。
研究者推出 ReactHuman,首个面向具身多模态 LLM 类人反应式决策的物理基准,让模型充当仿真人形机器人的大脑应对突发家庭危险,覆盖 17 类事件、超 1000 个可逐位复现场景,真值来自 240 Hz 刚体仿真。评测 7 个代表性 MLLM 显示,模型约每 3 个危险就处理错 1 个,依赖固定倾向而非观察场景、轻信外观而非运动,且这些失败不随模型规模缩小。
研究提出"胜任力门控"方法,通过已解决结果估计领域级来源权重并收缩至全局权重,再校准池化预测,在 2,357 个已解决二元问题和五个语言模型上将外部基线 Brier 从 0.0771 降至 0.0732,显著优于全局预测组合。
研究者提出 TRACE,一个面向火灾后物体理解的变化感知基准,包含 21.4K 真实图像合成的场景,覆盖 189 类、499 个物体身份,并定义退化物体检测、原始状态恢复与检索、原始材质恢复、原始描述生成和功能推理五项任务。
研究提出 Program-Solve 接口,让模型不直接计算,而是编写针对具体病例的 Python 代码,由受限本地执行器作为确定性求解器运行。
Ambient 在 ECCV 2026 可穿戴 AI 挑战赛 EgoProactive 赛道获大模型组第一、总排名第二。该方法将主动干预判定改为对 yes/no 两个 token 的重归一化概率做决策,相比自由生成把 macro-F1 提升 0.249、G-mean 提升 0.30。
Ambient 在 ECCV 2026 Wearable-AI Challenge 的 EgoLongQA 赛道以 0.8279 的成绩拿下 <=2B 参数组第一,方案是把工具型智能体流水线中的初级感知模块蒸馏进单个 2B 视觉语言模型,一次贪心前向即可回答十分钟第一视角视频的选择题。
研究提出"任务无关的环境预处理"设定:LLM 智能体在测试前、不知下游任务分布的情况下,自主探索陌生环境并产出可复用产物供冻结的求解器使用。在六个异构基准上,配备归档的 meta-agent 变体在五个基准取得最高 Avg@3 奖励,固定语料处理在最大语料基准上仍最优;更大的研究预算并未稳定提升下游奖励,但研究产物可减少达到既定分数所需的测试时采样次数。
TRACE 是一个免训练的 GUI 智能体视觉 token 剪枝框架,通过布局交互先验、指令相关性与特征新颖度对视觉证据排序,并预留预算保留原生视觉 token 以修复空间覆盖。其嵌套 token 顺序与单调 KV 收缩机制让保留证据可随预算单调缩减并在整条轨迹中复用,避免重复视觉编码。在六个 GUI benchmark 和多种模型上验证了紧预算下的有效性,源码将开源。
ActionSplice 通过反事实状态传输(CST)在采样中途编辑动作,无需重放已完成计算,世界模型与采样器保持冻结。CST_R 重定向整个活跃 chunk,CST_T 保留干预步的时间前缀、只修正后缀。
DataFlex-RL 是用于在统一 GRPO 配方下比较 RLVR 数据策略的评估平台。基于 Qwen2.5-7B-Base 在 12 个数学、逻辑与科学基准上测试 13 种配置,Uniform GRPO 较未训练检查点提升 7.76 个百分点,但八种 rollout 选择或重加权方法均未显著优于均匀采样,三种自适应混合也未胜过固定等权混合。
研究者提出用大型语音克隆模型作为可编程数据源,将 15 秒语音参考转化为完全基于合成语音训练的紧凑固定音色学生模型,并开源 82M 参数的泰语 TTS 模型 Wayu-Paxa-TTS-Edge,支持无参考音频的端侧泰语合成。
研究拆解合成 OCR 数据中字体多样性、二维结构与真实手写字形对泰语文档迁移的影响,并据此将 0.9B 参数的 PaddleOCR-VL-1.6 适配为 Wayu-Paxa-OCR-Zero,全程仅用 45,723 页合成数据、无需真实 OCR 标注。