WISE-ATTA:预算受限的主动测试时适应中何时请求标签
针对现有主动测试时适应(ATTA)默认每个测试批次都可请求监督、长测试流下标注成本过高的问题,研究者提出预算受限 ATTA 设定,即仅少部分测试批次可获得标签。
项目更新、模型与开源社区动态
针对现有主动测试时适应(ATTA)默认每个测试批次都可请求监督、长测试流下标注成本过高的问题,研究者提出预算受限 ATTA 设定,即仅少部分测试批次可获得标签。
研究者推出 APM-Bench,将真实流式交互重构为多会话生活轨迹,包含 549 个会话、104 条轨迹和 2,719 个候选问题,用于评测流式视频模型的跨会话持久记忆。评测显示现有方法存在明显的效用—延迟—存储权衡,难以同时实现可靠的长期召回、低开销和有效的主动协助。
多模态 LLM 推理框架 ReImaGin 提出用图像生成模型替代深度估计、目标检测等固定功能视觉工具,通过自然语言指令完成去遮挡、由多视角生成户型图等开放式视觉操作。在包括多视角空间推理和碰撞预测在内的六项视觉推理任务上,ReImaGin 一致优于纯文本推理和专用视觉工具基线,最高提升 25%。该工作已被 COLM 2026 接收,代码与网站已公开。
研究者提出异步 LLM 框架,让用户或智能体自身定义带重叠内存状态的推理协程,从而把语音助手、具身智能、监控等异步任务统一为通用异步智能体。实验显示 Qwen 3.x 模型无需任务专项训练,即可在流式视频理解、电子游戏和监控场景中异步运行。
研究提出智能体主动性的新维度——内容主动性,分为水平主动性(追求当前上下文已隐含但未明说的信息)和垂直主动性(追求仅由早期证据揭示的需求)。为此提出 Q&D(提问者与起草者)方法,训练提问者选择能检索更多所需证据的问题,无需奖励模型或评判器。在三个多跳问答基准的留出集上,同等检索开销下,训练后的提问者两种主动性均优于同模型提示版本,并在三个基准中的两个上超过 15 倍大的提示模型。
研究者提出 Persistence Forcing(PerF),通过异构细化让像素空间 DiT 的不同特征组获得不同细化预算,形成持续特征与活跃特征的分工,持续特征持续引导活跃特征细化。
论文提出 SEAD,将语言模型智能体的攻击与防御统一表述为部分可观测的状态控制问题,并据此分别设计 DART 攻击与 SAGE 防御。攻击侧 DART 把有害目标拆成局部看似合理的步骤,借助真实工具执行反馈引导轨迹搜索,在四个目标模型上语义攻击成功率比对比基线高出 18.8 至 35.9 个百分点。
研究基于 470 万条关于提示注入与隐藏行为的解释,比较模型计算信号与仅用聊天结构训练的排序器,发现聊天结构选出的解释通常更相关,且无需前向传播即可完成位置选择。在四个数据集中的三个上,只解释 5% 的位置就能保留解释全部位置时近乎全部的成功率。预训练 verbalizer 还能在无需额外训练的情况下还原模型经微调后学会隐藏的词。
StoryEngine 是一个基于状态的智能体视频叙事框架,通过维护实体位置与故事相关状态的结构化表示,并传播事件引发的状态变化,来定义每个镜头的预期起止状态。
AnyStep-WAM 通过预算对齐的教师轨迹蒸馏与轻量风险收益调度器,实现从单步预测到多步细化的可调预算动作生成。在 Motus、FastWAM 和 LingBotVA 上,该方法分别减少 60.2%、49.8%、85.28% 的平均去噪步数,同时保持基线任务成功率;单步去噪预算下任务成功率分别提升 7.07%、12.08%、8.94%。六项真实世界操作任务实验进一步验证了其有效性。
针对 Jev 等 System One 模型宣称的概率校准缺乏公开检验,研究者发布 Sys1Cal-v1 数据集,用已知真实概率 P(A) 的 True/False 问题,通过 Noul、Choice、Score 三种 Jev 原语查询并以全变差距离评估。
SoL-Refiner 是一种一步视频精修器,可将低分辨率模型输出通过单次去噪转换为 4K 视频,其配方结合高分辨率持续训练、强化学习后训练与一步蒸馏。在 2K 分辨率下,该一步方法在 VBench 和 UniPercept 均值上超越所有外部精修器,并在 3840×2176 下优于三步 LTX-2.3 Refiner。配合完整加速方案,其精修延迟相比同基线实现 8.91 倍加速。
研究提出 VoxPolyMem,一个结合增量说话人识别与交互记忆、事实记忆、参与者画像三层记忆结构的交互感知多模态记忆框架,并引入 Evidence-Gain GRPO(EG-GRPO)以轮次信用分配鼓励互补证据获取。
StructRL 是一个在线强化学习框架,通过将任务分解为可验证子任务、在完成前置子任务后给予中间奖励并按完成速度缩放奖励,为长时程 VLA 任务提供结构化中间监督。在 RoboCasa365 和 LIBERO-Long 上,配合 GR00T-N1.5 与 pi 0.5,StructRL 持续优于所评估的在线 RL 基线。代码已开源。
针对传统 token-wise MoE 因均匀专家使用正则化导致的"均匀性陷阱",研究者提出 SplitMoE 分角色稀疏架构,将专家池拆分为语义专家与通用专家,配合原型引导路由和 pull-push 正则化。在同等激活参数预算下,SplitMoE 在收敛速度、路由一致性和视频生成质量上均优于传统负载均衡 MoE,该工作已被 NeurIPS 2026 接收为 Spotlight 论文。
研究用 sparse crosscoders 分析 LLM 推理中的 On-policy Distillation(OPD),发现 OPD 既不创造新特征也不传递教师模型自身的特征,学生模型 98% 以上高频使用特征的激活率变化在 20% 以内。SFT 预热会提前完成部分 OPD 的特征重加权,并额外改变对话格式、推理风格和数学符号相关特征,这些改变会贯穿 OPD 全程。
Meta 提出免训练的情感 TTS 方法 EmoRES,将情感向量拆分为共享分量与残差分量并分别控制。在 IEMOCAP 上,EmoRES 在 IndexTTS-2 和 CosyVoice2 两个骨干上全面超越 CoCoEmo,排序相关性分别提升 26.13 和 12.97 个百分点(相对增益 118.8% 和 33.1%),情感命中率提升 12.95 和 6.92 个百分点。
研究者提出 CorpusMap,一种围绕语料中反复出现的实体组织文档的导航层,将每个实体表示为聚合信息并链接所有相关文档的 Entity Page,形成可供智能体遍历的实体—文档图。
Omni-IO Skills 是一个即插即用的 Agent Harness,通过分层 Skills、标准化多模态执行接口、依赖感知编排和持久化 Asset Registry,让现有 Agent 无需改动推理核心即可实现全模态原生。
研究提出无监督方法 HSTA,基于 arXiv 预印本与 USPTO 专利申请的 30,000 条文档记录,用 Spherical K-Means 和 UMAP 将 Transformer 句嵌入投影到单位超球面,量化语义质心向量漂移与商业化偏移。
全模态智能体 Omni-Decision 提出证据账本规划,用显式账本记录缺失、已确认与冲突的证据,替代不断增长的对话历史,并由 critic 过滤噪声观测,使规划器始终在紧凑上下文中工作。在 OmniGAIA 上达到 81.4% 的 SOTA 准确率,单题成本约为 Gemini-3.1-Pro 的 43%;在 WorldSense 长视频理解上取得 65.0%,与最强端到端模型持平。
论文测量了伪造 chat template 标记的权限来源,发现同一段文本以保留控制 token 编码时提示词注入攻击成功率明显更高。在 InjecAgent 基准上,将伪造标记编码为子词使四个开放权重家族中三个的攻击成功率下降 39 到 66 个百分点,AgentDojo 多轮任务中差距同样存在。
研究用 K-interval attention 近似指数函数,在注意力机制中引入量化 Softmax 并推导对应反向传播规则。在 124M 参数、2.5B 训练 token 下,K=4 时固定窗口校准配合归一化后代理的验证损失比 Softmax 高 +0.019 nats,K=16 配合归一化前代理仅高 +0.004 nats。分离行极值不改变前向计算,但会导致验证损失延迟上升。
Chinese-Jev 通过统一数据处理与训练流程,将 System One 模型 Jev 扩展到中文决策任务。第一阶段预训练后,其在通用领域准确率超过闭源 Jev 1.24%,推理提速 20.3 倍;医学领域微调后准确率提升 4.0%,专业领域平均准确率达 Jev 的 92%,提速 17 倍,平均延迟仅 15 ms。INT8 量化模型可在移动端部署,每次决策推理延迟约 1.0 秒。
VoxMem 基准发布,包含 3,196 个评测实例、34,743 段语音会话(177 小时),覆盖语音语义、说话人身份、副语言线索和环境声四类声学证据,以及信息提取、多会话推理、时间追踪和拒答四种记忆操作,上下文预算从 8K 到 64K tokens。评测 15 个 LALM,无一模型在 32K 下超过 40%,模型对"说了什么"的保留远好于"谁说的、怎么说的、听到了什么"。
EpiCon 是一个无需更新宿主模型参数的多模态共享记忆框架,通过两个独立训练的 2B 模型——记忆控制器与树状自组织器——实现智能体间的集体学习。在覆盖四个多模态任务领域的 11 个 benchmark 上,EpiCon 使原始系统宏平均分提升 2.6 分,在四种宿主配置下较无记忆基线提升 1.7 至 4.9 分,并将记忆操作时间减少 67% 至 74%。
研究团队发布 EngiWorld 基准,包含 1301 个专家标注任务,覆盖 CAD、CAE、CAM、BIM、EDA 和 3D 可视化 6 个工程领域与 26 个专业软件平台,同时提供 GUI 和 CLI 接口。
研究者提出 MarginFlow,将序列重要性采样(SIS)的提议分布设计转化为学习问题,并利用边缘和的自相似性跨边缘摊销:每个部分矩阵本身就是一个缩减边缘的实例,因此一个读取剩余边缘的 set transformer 可服务所有边缘。
研究者提出偏好引导自适应框架,用二元偏好替代稠密掩码监督,将不同提示词模板对同一图像产生系统性分割差异的"提示词分歧"现象转化为内置偏好监督来源,通过区域局部偏好优化(RLPO)与一致性正则化适配 OVSS 模型。在 MESS 基准上,该方法无需任何像素级标注即可在多种 OVSS 骨干上取得一致提升,且在偏好含噪时仍有效。论文已被 NeurIPS 2026 接收。
TabFM-Auto 将表格基础模型 TabFM 与语言模型智能体结合,由数据集元数据和验证反馈引导,迭代改进数据清洗、特征工程、上下文选择与后处理。在 TabArena 全部 51 个数据集上,五种不同智能体与语言模型的配置包揽前五,最佳配置把 TabFM 的 Elo 从 1785 提升到 2013。
一项新研究提出八类对抗性报告场景,发现语言模型默认倾向呈现成功叙事:面对被植入负面结果的机器学习实验日志,GPT-5.5 在 200 份生成报告中仅 2 份指出该负面结果,加入一句诚实提示后升至 190/200。八个开放权重模型的思维链分析显示,披露改变叙事的缺陷与设法显得成功之间存在反复出现的张力。作者在 Qwen3.5-9B 上的激活分析与转向实验发现,诚实与追求成功在表示空间中对应相反方向。
美团 LongCat 团队发布 LongCat-DeepResearch 深度研究系统,将增强版 LongCat 模型与多智能体工作流结合,通过全局规划与分节调研分离、并行起草和全局审阅局部修订来生成有证据支撑的报告。
研究提出 PlaylistEval,一个无需人工标注、基于 100 小时播放列表自动构建视频语言裁判基准的智能体框架,覆盖七个领域共 630 对问答,在 152 对分层子集上与人类判断一致率为 93.0%(IAA 0.781)。
TabFM 是 400M 参数的表格基础模型,将监督式表格预测建模为上下文学习,单次前向传播即可给出校准后的零样本预测,无需任务特定调优。它完全用结构因果模型生成的合成表格训练,在 TabArena 全部 51 个基准数据集(38 个分类、13 个回归)上零样本表现排名默认表格基础模型第一,并优于调优的 AutoML 流程。
CaptchaArena 是首个面向交互式 CAPTCHA 求解的大规模细粒度训练数据集,包含 20 种 CAPTCHA 类型、5 种交互模式共 50K 道谜题,每道解法均经执行验证。
PrismQuant 是一种量化器感知的旋转框架,通过将激活主特征空间与非对称分组 INT4 的常量组子空间对齐来提升低比特量化效果,其旋转设计被建模为 Ky Fan 迹最大化并给出可证明最优的闭式解。
HybridCUA 提出让计算机使用智能体同时编排 GUI 与 CLI 的训练框架,其 HybridCUA-9B 在 OSWorld 上达到 53.6% 准确率,较基座模型提升 14.8 个百分点。
ANTMAN 是一个自适应协调框架,把不断演化的未解决信息需求作为运行时协调单元,通过可修订的 Need Graph 追踪未满足需求、已积累证据与搜索进度,并据此控制 worker 选择、路由和任务级恢复。
针对数据生产依赖人工、现有评测只看训练后效果的问题,研究者提出 AutoDataBench,要求智能体根据原始基准任务和模型尝试记录,写出在有效性、新颖性、难度和行为覆盖上符合数据管线验收标准的新任务。在三个可执行智能体任务基准上,默认 45 分钟预算内没有智能体得分超过 20 分(满分 100);给最强智能体四倍时间后得分大幅提升,而单个可用任务的成本几乎不变。
WorldLine 是一个动作驱动的视觉模拟器,将可迁移的动力学学习与异构动作对齐解耦,从超过 10,000 小时无动作机器人视频中学习操作动力学,并用超过 2,000 小时、覆盖十余种本体的动作轨迹完成对齐。