NavHarness:面向终身具身导航的训练无关框架
NavHarness 是一个面向终身具身导航的训练无关框架,将记忆处理纳入导航循环,通过多轮智能体会话调用地图、任务记录与房屋知识并对照观测修正。
huggingface.co · 开发者平台
NavHarness 是一个面向终身具身导航的训练无关框架,将记忆处理纳入导航循环,通过多轮智能体会话调用地图、任务记录与房屋知识并对照观测修正。
研究者提出 RegLLM 诊断框架,用于评估受监管智能体工作流中的有限自主性,监测引用有效性、来源依据、schema 合规、升级正确性、宪法对齐和不安全动作率六项可信度信号。
研究发现,在 LIBERO、ManiSkill、MetaWorld 和 CALVIN 上对 π0.5、GR00T N1.5/N1.6 等 flow-based VLA 模型做 RL 后训练,会产生秩显著更低的参数更新,且高度集中在 action expert 的 Timestep Modules 中。
研究者提出 Future-Aware Recall(FAR),一个从未来感知预测监督中学习情景记忆召回的框架,通过负扩散预测损失近似条件对数似然来衡量记忆的预测效用,并训练一个推理时对未来盲的检索器。该检索器能学习各线索的相关性,自动决定每个查询该信任时间、姿态、视觉、音频中的哪些线索。在三种互补设置下,FAR 即使使用相同检索线索也优于手工设计的召回方法。
研究者提出 Minkowski 位置编码(MinkowskiPE),用联合时空坐标参数化作用于 query 和 key 特征的 Lorentz 变换,使注意力分数仅依赖两个 token 间的相对时空位移,从而对坐标全局平移保持不变。
针对 SFT 中 token 重加权只能抑制或放大监督更新、无法反转有害特征的问题,研究者提出 SCALE(Selective Control of Adaptation via Local Entropy),冻结预训练模型与 SFT delta,仅通过最小化预测熵学习有界的 token 与模块级门控。
DataMagic 提出一种从原始表格数据自动生成数据视频的声明式多智能体编排方法。其 DVSpec 规范统一图表、旁白与动画并保证数据溯源,配合“先生成后编排”策略优化叙事连贯性。在 109 个真实样本上,DataMagic 将质量分数从 GPT-5 的 2.13/5 提升至 3.89(+83%),执行成功率超 95%,并将创作耗时降低 79.7%。
研究提出 IntentFlux 基准,将可验证任务转为带受控意图变更的多轮对话,在 627 个案例的校准中,随着对话包含更多被取代和撤回的信息,平均任务得分从 0.476 降至 0.384。
BiasReducer 通过只编辑奖励模型的线性奖励头,自动识别并削弱模型对长度、自信度等表层属性的依赖,无需重新训练。在五个奖励模型上,BiasReducer-M 将三项基准平均提升 8.3、18.0 和 6.9 个百分点,优于两个基于训练的基线。该增益可迁移至下游,减少冗余冗长与谄媚,同时保持相当的评判质量。
X-Tree 通过统计动作片段的可复用性,将重复出现的子过程合并为可复用的经验树,无需调用 LLM 即可从数据中恢复层级结构。该方法被集成进离线 RL、在线 RLVR 和同策略自蒸馏三种训练设置,在 WebArena、ScienceWorld 和 WebShop 上分别提升最高 4.5%、5.8% 和 4.1% 的成功率。
研究者提出 The Extender,一种日志结构化的 Transformer 变体,通过新增拼接通道 x 让各层注意力 kv 投影只读取 x,将持久注意力内存占用从 2Ld_model 降至 Σ|εℓ|。
LANTERN 通过预训练模型激活上的分类器对候选关系排序,结合分阶段过滤、假设生成、可执行验证与分析检查,在 OEIS 的 10,000 个高频序列中排名 5000 万对,产出 62 条此前无交叉引用的已验证关系。
研究将 Jev 的决策导向 API 集成到边缘服务编排中,在 8,280 条请求和 33 种测试条件下,其决策延迟中位数比最快的 LLM 降低 22.7-64.5%,且几乎不随输入规模变化。四字段合约下,Jev 每次正确决策的 API 费用低 59.7-80.9%,代价是少量精确匹配分数。在实时准入路径上,LLM 低于 0.1 的负载下 Jev 仍能保持 0.91-0.95 的请求精确且准时。
KeyRec 是一个免训练框架,通过构建有界视觉记忆来降低长视频与流式理解中的长上下文推理成本。它用视觉缓存保留近期细粒度观测、用结构化事件库组织历史证据,并由纯文本路由器在固定读取预算下自适应分配近期与事件记忆。
PluginRSI 将 Agent harness 拆解为原子化插件组合,各插件独立改进并汇入共享插件库,每轮迭代再重组为新 harness。该方法在软件工程、命令行交互和问答任务上均优于现有 harness 优化方法,且迁移到其他 solver 模型后仍保持优势。演化出的插件库还能加速后续优化,在未见任务上收敛更快、更高。
研究者推出 CUA-SWE,一个面向"计算机使用+软件工程"的 benchmark、环境与评测流水线,覆盖四个软件工程领域,要求智能体在同一任务内改代码与配置、执行命令、操作运行中的软件并查看视觉反馈。每个任务配有确定性的专属测试,用于验证软件是否满足需求并保持既定行为。该工作评测前沿智能体如何结合源码级执行与应用截图、图形交互,产出经过验证的软件改动。
OpenTumorBoard 是一个包含 611 个患者病例、19,157 轮讨论、覆盖十种专科角色的多学科肿瘤委员会讨论基准,转录自 YouTube 上 12,534 分钟的公开肿瘤委员会录像。
研究者提出 VGBench,一个含 1,018 条样本的诊断基准,用于评测语音智能体在闲聊、自言自语和说话人切换场景下的动作级"被称呼"判断。六款原始 Audio LLM 和三种免训练适配方案常能识别目标工具,却很少在说话人切换时抑制动作,最高静默率仅 14%。
LLM 打分器在同一 prompt 中给多个候选打分时,重排候选顺序会改变分数,进而改变阈值保留集等决策。研究发现,在段落重排任务上,nDCG@10 相差 0.010 以内的五个训练打分器,重排后保留集重叠度仅 0.66-0.84。
DMM(Decentralized Master-Mind)提出用离散的迭代意图精炼替代一次性动作采样,解决多智能体路径规划中局部有效动作重组为不兼容联合动作的问题。该方法受扩散模型去噪启发,通过通信轮次耦合智能体选择,并用模仿学习预训练、MICPO 强化学习优化。在 1,600 个 MovingAI 任务上,DMM 经 MICPO 微调后解决 1,598 个,覆盖率最高,且可扩展至超百万智能体。
CacheBack 是一种无需训练、基于发送方注意力权重的接收方条件化潜在通信方法,让接收智能体向发送方描述信息需求,从而过滤压缩发送方的 KV 缓存。
研究提出奖励加权传输蒸馏(RWTD),一种仅需生成样本和标量奖励评估的一步生成模型后训练方法,通过混合当前与参考分布的自适应目标,经特征空间最优传输与不动点回归实现。该方法将一步 SANA Sprint 1.6B 的 GenEval 分数从 0.73 提升至 0.80,偏好对齐实验显示其具备跨奖励泛化能力,能兼顾改进与组合能力保留。
研究针对基于检索的医学事实性评估,基于 MedExpert 开放式数据集和 3 个封闭式数据集构建了两套分类体系,将失败拆解为检索阶段五个质量维度的错误与验证器推理的六个连续步骤。团队用 LLM-as-Judge 自动归纳模式,在 4 种检索方法和 6 个前沿验证模型上压力测试,发现扩大模型规模、增加推理投入、扩展权威网络来源和医学微调均无法消除这些失败模式。
研究提出 NowWAM,一种无需未来目标的协同训练方法,直接对当前观测去噪并从同一视觉流预测机器人动作,将生成式目标与动作表征耦合。在 LIBERO-Plus 上,NowWAM 搭配 FLUX2-Klein 达到 87.7%,较未来目标协同训练基线提升 6.1 分,训练视觉 token 从 784 减至 392,单步时间从 2.85 s 降至 1.63 s,提速 1.8 倍。
研究者提出 Gated Token Recurrence(GTR),一种无 softmax 的循环视觉骨干,结合门控线性注意力、交替空间扫描方向与空间增强 SwiGLU 模块,仅通过最终层 patch-token 对齐从检测专用 DINOv3 教师蒸馏。
OSWorld-Pro 是一个面向计算机使用智能体(CUA)的过程式评测基准,包含 300 多个任务、2800 多个子目标,基于 67000 多条人工标注,用人类对齐的 LLM-Judge 评估子目标完成情况。该基准对 SOTA 模型仍有挑战,Claude Opus 5 仅得 75.7%,低于其在 OSWorld 上的 83.4%。研究还识别出子目标无关操作、点击类错误等过程性失败模式。
研究提出 Never Give Up(NGU)自适应采样方法,通过异步 RL 持续为同一问题生成样本直到答对,将算力从简单题重新分配给难题。作者称 RL 对 LLM 存在"马太效应":简单题提升大、难题提升小。在数学基准 Deepscaler 上 NGU 提升了单位算力性能,在编程任务 Manufactoria 上,标准 GRPO 无法完全解题,NGU 则迭代攻克越来越难的测试直至完全解决。
针对 LLM 自动根因归因(RCA)在长执行轨迹上准确率低的问题,研究者提出迭代框架 Continual Search,通过多轮引导判定器持续搜寻未解决的诊断证据。
一项研究将认知科学中的规则归纳任务扩展到推理模型,通过重组、替换等任务同构方式构造结构等价的变体,发现模型虽能正确解出某个任务,却常在结构等价的变体上失败。这表明许多模型行为缺乏系统性,难以在其被评估的特定语境之外稳健地确立推理模型的认知能力。
TREVIS 通过 Tree Transformer 变分自编码器(TTVAE)的隐空间探索来学习决策树,将离散搜索空间映射为连续空间,借助可微代理模型实现基于梯度的优化。实验显示,TREVIS 在预测性能上匹配现有近最优算法,同时提升了决策树的结构稀疏性。该工作已被 ICDM 2026 接收。
研究者推出 E2A-Bench,一个基于 323 只 HS300 成分股、含 969 条查询的金融图表推理基准,用 UCR、RCI、ECI、NDR 四项指标评估证据溯源、推理-行动一致性、证据-置信度校准与方向覆盖。
研究以混合自回归-扩散架构 Orthrus 为例,考察有限精度浮点计算对"无损投机解码"的影响:在 12 个领域共 1,190 条提示上,BF16 推理下仅 45% 的作者 checkpoint 生成和 43% 的独立训练模型生成实现精确轨迹匹配,匹配概率与自回归参考模型的响应条件困惑度强相关。
ModaLens 是一种配对图像替换审计方法,用于测量报告可用性如何改变医学视觉语言模型的图像敏感性。在 MedGemma-27B 上对 3,199 个 MIMIC-CXR 配对病例测试,有报告时答案变化率为 4.26%,无报告时为 20.94%,配对增加 16.7 个百分点(95% CI 15.6-17.7),表明报告可用性降低了图像替换敏感性。
Dynin-Robotics 将视觉目标与动态预测引入动作生成,基于全模态掩码扩散骨干 Dynin-Omni 统一建模语言、视觉观测、目标与动作。
研究团队提出 LynnReal-Omni,一个基于 32B 共享多模态扩散 Transformer 的原生多模态视频生成框架,统一支持文生视频、图像条件生成、参考引导生成、结构控制、编辑、退化视频修复和长视频生成。
研究者提出 Expert-Space Exploration Reinforcement Learning(ESRL),一个显式探索 MoE 模型专家路由空间的架构感知框架,通过保留高置信专家作为锚点、将随机路由限制在候选池内并按 router 熵自适应调整扰动强度来提升 rollout 多样性。
研究者提出 Minimal Intervention Reinforcement Learning(MInTRL),通过在在线策略 rollout 中周期性插入稀疏局部修正来扩展探索边界,训练时采用序列级优势回归目标,无需重要性采样。在数学与代码基准上,MInTRL 持续优于标准在线策略与离线策略基线;消融显示自干预和不同 judge 策略下仍有效,且性能在中等干预强度时达到峰值。
研究者提出 Grouped Value Attention(GVA),只存储分组 value,并用学习到的线性映射重建 content key,推理时该映射可吸收进 query,无需物化 content key。
团队构建了生产级双语希腊语-英语语音识别系统 Sophea,在 23 轮训练和两种模型架构下,没有任何训练数据组合能同时通过全部九项生产门禁。三模型 ROVER 集成将门禁覆盖从单模型的 4-7/9 提升至 9/9,重叠语音 WER 从 53.35% 降至 37.87%。
AlayaVista 是一个相机可控的流式视频世界模型,将全景世界演化与透视观测合成解耦:给定单张透视图像,先用预训练全景扩展模型构建 360 度场景先验,再以相机条件化的全景 latent 状态演化场景,由 latent viewport renderer 映射为透视视频 latent,透视 refiner 负责恢复细节、抑制伪影并做超分。