Adaptive Bridge:缓解 ROS 2 中 DDS 背压的代理式解耦层
针对 ROS 2 中 DDS 的 RELIABLE 主题因单个网络受损订阅者产生背压、拖累所有订阅者的问题,研究者提出代理式解耦层 Adaptive Bridge,通过主题拆分与动态限速隔离关键路径。
huggingface.co · 开发者平台
针对 ROS 2 中 DDS 的 RELIABLE 主题因单个网络受损订阅者产生背压、拖累所有订阅者的问题,研究者提出代理式解耦层 Adaptive Bridge,通过主题拆分与动态限速隔离关键路径。
研究提出 Verdict-Preserving-Unfaithfulness(VPU)失效模式:错误形式化编码仍能通过求解器验证并得到预期判定,并证明仅凭判定的结构化验证启发式检测能力在数学上被限制在随机水平。
研究提出 ActReview,一个以作者反驳为引导的后训练框架,将可执行同行评审生成拆解为诊断性论断生成与修改建议生成两个子任务。团队从 OpenReview 真实评审-反驳对话构建 ActReview-40K,对 Qwen3-8B-Base 先做多任务监督微调再用 GRPO 配合候选感知、弱点专属的评分奖励训练,并发布含 1,000 条实例的 ActReview-Bench。
研究者提出 IdeaAMBIG 基准,包含 660 个有证据支撑的实例,其中 163 个来自复现报告和 GitHub issue 的真实缺口、497 个注入到可编码参考中的合成缺口,用于评测编码就绪度评估、缺陷定位和澄清动作生成三项能力。
研究者提出 MaP-WAM,将依赖记忆的世界-动作建模拆分为记忆驱动的规划与规划条件执行,把长期多模态情景上下文用作规划证据,而非反复将完整历史输入执行器。该框架在 RMBench 上取得 83.3% 成功率,真实机器人任务成功率达 78.0%,且执行器推理延迟随任务历史增长基本保持恒定。
针对 On-Policy Self-Distillation(OPSD)在复杂推理任务上会抑制模型不确定性表达、惩罚探索与自我纠错行为的问题,研究者提出 Negative Self-Distillation(NSD)框架,让模型自行生成问题特定的负面条件(如扮演"粗心推理者"),并将学生分布推离这一自生成负面教师,而非模仿特权解答。
Mi-Ripple 是一种诊断引导的修复流程,用于抑制迭代参考条件图像编辑产生的网格状与颗粒状"数字波纹"纹理,同时保护图像结构。它先分离周期性晶格伪影与内容纠缠的颗粒纹理,再结合选择性频谱陷波、结构感知平滑和干净参考再生。在 14 次仅陷波执行中,全图残差标准差为 0.08–0.44 CIELAB 亮度单位;配对再生示例中参考清洗使输出碎片密度降低 45%。
FreeFlow 是一个不含任何光流专用组件的层级 Transformer,仅用单一前馈编码器-解码器,结合窗口注意力、移位窗口注意力和降分辨率全局注意力三种变体。
DRG-MAPPO 是一个融合图关系建模与动态角色分配的多智能体强化学习框架,用于协同空战。它通过图注意力机制提取友军、敌军与威胁间的关系特征,由高层策略动态分配"leader""supporter"等战术角色,低层策略据此执行机动动作,并设计目标优先级辅助任务促进集火行为。实验显示其胜率达 87%,达到 SOTA 水平。
MetroLLM-Bench 发布,这是一个 955 例基准,用于测试语言模型作为地铁自助终端策略层的能力,覆盖六个真实地铁系统(37 至 414 站)和十一类任务。
研究团队推出 TempCloze,一个视频完形填空基准,要求 Video-LLM 根据视频开头和结尾片段从四个候选中找出真正缺失的中间内容。该基准包含来自七个来源的 1,521 个视频,并沿 Semantic、Alignment、Progression 三个维度构建同源干扰项。对 10 个闭源和 21 个开源 Video-LLM 的评测显示,时间对齐(Alignment)是主要瓶颈。
UniH^3 是一个统一分层同质性与异质性的全能医学图像复原框架,通过 Hierarchical Homogeneity Memory 模块蒸馏任务内与任务间同质性先验,并用 Homogeneity-Guided Attention 注入复原流程,同时以 Hierarchical Heterogeneity Balancer 缓解任务间与任务内冲突。
针对视觉文档检索中后期交互嵌入存储开销大的问题,研究者提出生成式后期交互嵌入 GLIE:每页仅学习 k 个向量作为轻量索引,查询时只在这 k 个向量上检索,再由解码器将 top 候选还原为全部 N 个向量精确重排。
X-AuT 通过短行为探针选择层组合,并用表征对齐、跨尺度蒸馏、学生策略监督和 LoRA 微调恢复剪枝模型,语言模型主干保持冻结。在十项中英公开基准上,Qwen3-ASR-0.6B 的音频编码器从 18 层压到 16 层,宏平均错误率由 5.61% 降至 5.27%;14 层模型为 5.75%,音频塔参数减少 20.7%。
EvoSafeHarness 是一个安全专用优化框架,针对冻结模型与目标领域联合搜索自然语言策略和可执行代码逻辑,合成可部署的安全护栏,并通过新上下文对抗评审剔除只对基准有效的规则。
研究者提出 SpatialBlock-15k,一个包含 15,000 道积木堆叠问题的合成数据集,覆盖 3D 到 2D 投影、视角变换和结构组合,并加入受控颜色调制作为视觉线索。LVLM 经直接作答或基于推理的预测训练后,表现显著优于基线,并能泛化到真实空间任务。代码与数据已公开。
研究团队从 Nemotron 3 Ultra 出发,用监督微调与强化学习训练出两个专家 checkpoint,通过纯自然语言的生成、验证与精炼迭代搜索流程,在 IMO 2026 取得 42 分中的 30 分,达到金牌线。
World in World 是一种免训练的推理时接口,可将源视频观测、目标视角投影、几何渲染和检索生成状态等异构控制证据转化为带相机与时间标签的干净视觉状态,并通过冻结因果视频模型的原生自注意力读取。它借助对应路由器和 Evidence-wise attention CFG(EWA),在同一个冻结骨干上支持相机控制重渲染、长时程回访和人体动作迁移。
研究者提出 Recursive Code World Models(RCWM),通过递归场景程序(RSP)表示与可递归调用自身的构建求解器,从单张参考图像重建复杂 3D 世界。
HyQuant 是一种面向 LLM 注意力机制的混合精度量化框架,将大部分注意力状态量化为低比特,仅保留少量竖线 token 和局部窗口状态为高精度,并以轻量级竖线感知注意力模式信号筛选这些精度关键区域。
Intern-NCP 团队发布 NCP-ArchPreview 技术报告,该隐空间语言模型在标准 token 级自回归生成之外,通过下一概念预测(NCP)学习跨多个 token 的离散概念,并用隐状态构建乘积量化的概念词表。
研究团队提出 CARDEA,一个用于冠脉造影(CAG)端到端解读的大型视觉语言模型,可从原始多视角视频经关键帧筛选输出研究级诊断,并展示结论背后的可审计空间证据。
SenseNova-U1.5 发布,这是一个 8B-MoT 原生统一多模态模型,在无编码器、无 VAE 架构下实现视觉内容的理解、推理与生成。模型支持最高 4K 原生分辨率,并通过多专家 on-policy 蒸馏优化视觉美学、双语文字渲染、信息图生成与图像编辑等能力。官方将开源训练代码,涵盖监督微调、强化学习与 on-policy 蒸馏。
针对 AutoResearch 智能体 RL 训练中环境执行成为瓶颈的问题,研究者提出 World Model RL(WMRL),用世界模型替代环境执行,并配合 Online Debiasing 与 Inverse-Variance Denoising 分别抵消偏差、抑制噪声,理论上证明两者严格改善收敛保证。
研究团队推出 T1,一个 122B 总参数的 Mixture-of-Experts 模型,通过强化学习在云沙箱中操作真实 shell,单任务支持 300+ 轮工具调用,并以任务自带 verifier 执行结果作为奖励。
PARSER 将长文档读取与推理解耦:一组轻量子智能体各自绑定单个 chunk 并行读取全文,主智能体通过迭代 scatter-gather 轮次广播查询、聚合证据并生成更深层追问,仅主智能体用强化学习优化,子智能体保持冻结。
开源答案引擎 OreoLook 提出三层缓存架构,在单台 8-vCPU Intel Cascade Lake 服务器上实现 89.3% 的 Redis 键空间命中率、0.1 ms 读取延迟和仅 1.38 MB 内存开销。
论文提出 SCHEMEARENA,一个 400 场景的基准,通过因子化场景合成框架对 LLM 智能体中的图谋行为做可扩展压力测试,覆盖多种安全相关工具域、工具性目标、管控条件和施压机制。
研究针对稀疏二元信号在噪声线性测量下的支撑集恢复问题,给出稀疏高斯测量矩阵在高信噪比区间 $ds/p \to \infty$ 时最大似然恢复所需最小样本量的充分条件,并结合已知下界得到阶为 $s\log(p/s)/\log(ds/p)$ 的信息论阈值。
研究者推出 StochBench,一个包含 450 道研究生级随机过程问题的 Lean 4 基准,每题配有自然语言题面,覆盖 Markov 链、鞅、布朗运动、随机微积分等 Mathlib 中较少涉及的领域。
研究提出 influence-guided response rewriting,用影响函数(IF)定位干预目标,在保持指令不变的前提下将样本回答替换为行为对齐或行为相反的监督信号。
研究者提出 Brain2Semantics2Text,通过中间语义嵌入空间重建文本,将句子级 MEG 响应映射到语义流形后再反演为自然语言,无需词级对齐即可恢复高层语义。该方法针对非侵入式神经记录信噪比低、难以细粒度重建音素或单词的问题,与既有非侵入式 Brain2Text 方法相比在句子级结果上取得提升。
AgentGrad 是一个面向 LLM 多智能体系统的提示词优化框架,通过顺序干预逐个修改智能体行为以定位导致失败的目标智能体,并用其输出作为智能体级监督提取细粒度文本梯度。该方法还通过语义文本梯度抽象对相似梯度聚类,避免混合无关失败模式。在五个 MAS 基准上,AgentGrad 达到 SOTA,优化耗时降低 2.5 倍,优化成本平均降低 21.8%。
OracleZoom 是一个受在线策略蒸馏启发、带参考约束的递归图像超分辨率框架,通过在训练轨迹上保留最后一次真实标注证据来监督更深层预测。它在七个数据集上取得 SOTA 超分质量,平均 CLIPIQA 达 0.713,深层放大尺度收益更大,并显著减少模型幻觉。代码、数据与模型均已开放。
一篇综述系统梳理了 VideoLLM 的推理效率机制,覆盖帧采样、模态编码、连接器层 token 压缩以及 LLM 预填充与解码各阶段的瓶颈。研究按方法作用的流水线阶段进行归类,涵盖 2022 年底以来的 VideoLLM 及更早的帧采样与视觉编码器机制,并汇总了共享宿主模型与输入协议下的精度—成本对比,指出音视频效率与标准化评测仍存空白。
HybridAL 是一种自适应训练调度方法,通过监测在线稳定信号,在模型轨迹持续稳定后从重新训练切换为微调。在三种编码器骨干和六个文本分类任务上,HybridAL 的端点 macro-F1 与重新训练和微调相比不劣于 0.010 的差距,最多节省 49% 的重新训练时间,并恢复了重新训练在 NLL 校准上的大部分优势。相比固定轮次切换,它在中度额外成本下获得更低的 NLL。
论文发布 SWE-Bench Pro Verified,针对 SWE-Bench Pro 的两类可靠性问题做修正,形成更可信的软件工程智能体评测基准。原基准的问题一是奖励攻击,源自定义解法或隐藏评测信息泄漏;二是任务质量,包括问题陈述误导与测试范围不当,这些都会抬高分数。
SyncWorld 是一种动作条件世界模型,借助视觉校准片段(成对帧与动作)在上下文中指定具体环境的 Action-Visual Mapping,无需额外训练即可跨未见环境充当零样本模拟器。实验显示,SyncWorld 能在先前未见场景中准确模拟动作结果,并支持测试时策略改进而无需训练。
研究团队提出 DF26 基准,用于检测由近期文本到视频和图像到视频模型生成的合成视频,视频为单人公开演讲场景,包含 271 条真实视频与 2,420 条合成视频,合成视频由七个现代视频模型生成。基于 DF26 的研究显示,人类识别 AI 生成视频的表现以及当前最先进的 deepfake 检测器都接近随机水平。研究指出当前评测协议存在局限,需要能明确衡量对现代生成模型分布偏移鲁棒性的基准。
研究者推出 WearableQA 基准,包含 4,084 道 10 选项多选题,数据来自 200 名真实用户的可穿戴时间序列、血液生物标志物与人口统计信息,每人最多 500 天日常测量。