DSR:面向 LLM 智能体的多样性感知技能路由,超越 Top-k 技能检索
研究者提出 Diverse Skill Routing(DSR),一种基于 Determinantal Point Process 的多样性感知重排序框架,用于 LLM 智能体的技能路由,通过 query-residual diversity kernel 在相关性与非冗余之间取得平衡。
huggingface.co · 开发者平台
研究者提出 Diverse Skill Routing(DSR),一种基于 Determinantal Point Process 的多样性感知重排序框架,用于 LLM 智能体的技能路由,通过 query-residual diversity kernel 在相关性与非冗余之间取得平衡。
研究在反馈预算有限(m ≪ T)的在线场景下,将提示词自适应路由到多个 LLM 专家以最大化回答质量,并建模为含 K 个专家动作、d 维提示词特征的 bandit 问题。所提算法在全信息设定下达到 Õ(dT/√m) 的 regret,在 bandit 设定下达到 Õ(dT√(K/m))。实验表明其能从有限反馈中高效学到跨多种 LLM 的高质量路由策略。
StepAudio 3 Gen 技术报告发布,该模型在统一框架内支持零样本 TTS、音色设计、人声生成、音效和音乐等多种音频生成任务。其核心是离散自回归生成器,直接对 RVQ token 建模,区别于近期通用音频模型常用的扩散 Transformer 连续生成范式。
Feyospace-v1 论文提出一套数据中心化框架,用 Choulea、SkyReal、Hongzwang、PSBreakup、Kreator 五个系统构建可重置的编码、漏洞、CTF、内核、固件等环境,经执行验证与证据审计后保留 164,269 条轨迹用于长上下文监督微调。
Benchmark Radar 是一个面向 AI 基准与评测的活数据库与搜索引擎,覆盖 LLM 评测、智能体与工具使用、编码、推理、安全及领域评测。系统每日从 37 个来源发现基准论文、仓库、数据集与发布,目录含 1,283 条来源记录和 12,916 条数值观测,并保留来源身份与引用。已发布网页仪表盘、基准排行榜、Pareto 前沿视图、饱和与趋势视图、每日订阅、可下载证据及离线查询 CLI。
针对现有可训练注意力稀疏化方法用硬 Top-K 选择阻断梯度、只能蒸馏逐层稠密注意力分布的问题,研究者提出 SAS(Simple Attention Sparsification),一种门控稀疏注意力机制,将选择器的连续分数以 log 形式注入注意力 softmax,用语言建模损失端到端优化上下文排序。
COBRA-Skills 将 LLM 智能体技能优化建模为动态候选空间上的预算化序列优化,通过上下文赌博机引导的优先级排序与基于证据的技能进化,把评估资源集中到更有潜力的候选上。在六个异构智能体基准和三个目标模型上,该方法平均性能最强,相比 SkillOpt 降低 55–58% 优化成本,每个基准仅用 50 个优化样本。
针对 DPO 假设所有偏好标签可靠的问题,研究者提出 PLC-DPO,利用校准后的策略-参考模型 margin 作为在线证据,将每对样本的训练信号分流为干净、翻转或平局三类,主动校正监督方向与强度。在 57 个数据集-模型-基准组合中,PLC-DPO 对 DPO 的平均胜率达 60.5,优于次优方法的 55.5。该工作为 EMNLP 2026 Findings,代码已开源。
SNAP3D 提出一种物理引导框架,从单张图像生成部件级 3D 资产,解决相邻部件相互穿透、连接无效或受重力坍塌的问题。该方法消除部件间穿透、恢复接触图,并在接触面引入参数化连接件,借助物理仿真反馈优化其位置、朝向与尺寸以提升装配稳定性。实验显示其物理可实现性与稳定性显著优于多个部件级 3D 生成器,并已通过 3D 打印和真实装配验证。
研究者提出 Latent Interface Training(LIT),一种与框架无关的两阶段策略,先在不使用图像的情况下建立以空间目标为条件的动作先验,再通过姿态监督的 latent interface 约束视觉条件路径。
研究构建了一个纯自回归的受控测试平台,在多模态持续预训练中追踪文本、图像、T2I 与 I2T 四类任务的验证损失,以此考察图像 tokenizer 作为"视觉语言"与文本联合建模的效果。
研究者提出一种免训练框架,让具备推理能力的视觉语言模型迭代搜索并推理 Wikipedia,以解决多模态实体链接在稀有实体上的性能退化问题。在覆盖 Hindi、Indonesian、Japanese、Tamil、Vietnamese 五种语言的 MERLIN 基准上,最佳系统整体超越 SOTA 6.9%,稀有实体切片最高提升 23.3%。
研究团队构建了 3.35B 规模的 Tiny Aya L2-Thinker,在覆盖数学、常识推理、指令遵循、开放式生成和文化推理的 6 个基准上,于 60 种语言中实现超过 93% 的 L2 推理率,即模型始终用用户提示词的语言进行推理。
针对 ROS 2 中 DDS 的 RELIABLE 主题因单个网络受损订阅者产生背压、拖累所有订阅者的问题,研究者提出代理式解耦层 Adaptive Bridge,通过主题拆分与动态限速隔离关键路径。
研究提出 Verdict-Preserving-Unfaithfulness(VPU)失效模式:错误形式化编码仍能通过求解器验证并得到预期判定,并证明仅凭判定的结构化验证启发式检测能力在数学上被限制在随机水平。
研究提出 ActReview,一个以作者反驳为引导的后训练框架,将可执行同行评审生成拆解为诊断性论断生成与修改建议生成两个子任务。团队从 OpenReview 真实评审-反驳对话构建 ActReview-40K,对 Qwen3-8B-Base 先做多任务监督微调再用 GRPO 配合候选感知、弱点专属的评分奖励训练,并发布含 1,000 条实例的 ActReview-Bench。
研究者提出 IdeaAMBIG 基准,包含 660 个有证据支撑的实例,其中 163 个来自复现报告和 GitHub issue 的真实缺口、497 个注入到可编码参考中的合成缺口,用于评测编码就绪度评估、缺陷定位和澄清动作生成三项能力。
研究者提出 MaP-WAM,将依赖记忆的世界-动作建模拆分为记忆驱动的规划与规划条件执行,把长期多模态情景上下文用作规划证据,而非反复将完整历史输入执行器。该框架在 RMBench 上取得 83.3% 成功率,真实机器人任务成功率达 78.0%,且执行器推理延迟随任务历史增长基本保持恒定。
针对 On-Policy Self-Distillation(OPSD)在复杂推理任务上会抑制模型不确定性表达、惩罚探索与自我纠错行为的问题,研究者提出 Negative Self-Distillation(NSD)框架,让模型自行生成问题特定的负面条件(如扮演"粗心推理者"),并将学生分布推离这一自生成负面教师,而非模仿特权解答。
Mi-Ripple 是一种诊断引导的修复流程,用于抑制迭代参考条件图像编辑产生的网格状与颗粒状"数字波纹"纹理,同时保护图像结构。它先分离周期性晶格伪影与内容纠缠的颗粒纹理,再结合选择性频谱陷波、结构感知平滑和干净参考再生。在 14 次仅陷波执行中,全图残差标准差为 0.08–0.44 CIELAB 亮度单位;配对再生示例中参考清洗使输出碎片密度降低 45%。
FreeFlow 是一个不含任何光流专用组件的层级 Transformer,仅用单一前馈编码器-解码器,结合窗口注意力、移位窗口注意力和降分辨率全局注意力三种变体。
DRG-MAPPO 是一个融合图关系建模与动态角色分配的多智能体强化学习框架,用于协同空战。它通过图注意力机制提取友军、敌军与威胁间的关系特征,由高层策略动态分配"leader""supporter"等战术角色,低层策略据此执行机动动作,并设计目标优先级辅助任务促进集火行为。实验显示其胜率达 87%,达到 SOTA 水平。
MetroLLM-Bench 发布,这是一个 955 例基准,用于测试语言模型作为地铁自助终端策略层的能力,覆盖六个真实地铁系统(37 至 414 站)和十一类任务。
研究团队推出 TempCloze,一个视频完形填空基准,要求 Video-LLM 根据视频开头和结尾片段从四个候选中找出真正缺失的中间内容。该基准包含来自七个来源的 1,521 个视频,并沿 Semantic、Alignment、Progression 三个维度构建同源干扰项。对 10 个闭源和 21 个开源 Video-LLM 的评测显示,时间对齐(Alignment)是主要瓶颈。
UniH^3 是一个统一分层同质性与异质性的全能医学图像复原框架,通过 Hierarchical Homogeneity Memory 模块蒸馏任务内与任务间同质性先验,并用 Homogeneity-Guided Attention 注入复原流程,同时以 Hierarchical Heterogeneity Balancer 缓解任务间与任务内冲突。
针对视觉文档检索中后期交互嵌入存储开销大的问题,研究者提出生成式后期交互嵌入 GLIE:每页仅学习 k 个向量作为轻量索引,查询时只在这 k 个向量上检索,再由解码器将 top 候选还原为全部 N 个向量精确重排。
X-AuT 通过短行为探针选择层组合,并用表征对齐、跨尺度蒸馏、学生策略监督和 LoRA 微调恢复剪枝模型,语言模型主干保持冻结。在十项中英公开基准上,Qwen3-ASR-0.6B 的音频编码器从 18 层压到 16 层,宏平均错误率由 5.61% 降至 5.27%;14 层模型为 5.75%,音频塔参数减少 20.7%。
EvoSafeHarness 是一个安全专用优化框架,针对冻结模型与目标领域联合搜索自然语言策略和可执行代码逻辑,合成可部署的安全护栏,并通过新上下文对抗评审剔除只对基准有效的规则。
研究者提出 SpatialBlock-15k,一个包含 15,000 道积木堆叠问题的合成数据集,覆盖 3D 到 2D 投影、视角变换和结构组合,并加入受控颜色调制作为视觉线索。LVLM 经直接作答或基于推理的预测训练后,表现显著优于基线,并能泛化到真实空间任务。代码与数据已公开。
研究团队从 Nemotron 3 Ultra 出发,用监督微调与强化学习训练出两个专家 checkpoint,通过纯自然语言的生成、验证与精炼迭代搜索流程,在 IMO 2026 取得 42 分中的 30 分,达到金牌线。
World in World 是一种免训练的推理时接口,可将源视频观测、目标视角投影、几何渲染和检索生成状态等异构控制证据转化为带相机与时间标签的干净视觉状态,并通过冻结因果视频模型的原生自注意力读取。它借助对应路由器和 Evidence-wise attention CFG(EWA),在同一个冻结骨干上支持相机控制重渲染、长时程回访和人体动作迁移。
研究者提出 Recursive Code World Models(RCWM),通过递归场景程序(RSP)表示与可递归调用自身的构建求解器,从单张参考图像重建复杂 3D 世界。
HyQuant 是一种面向 LLM 注意力机制的混合精度量化框架,将大部分注意力状态量化为低比特,仅保留少量竖线 token 和局部窗口状态为高精度,并以轻量级竖线感知注意力模式信号筛选这些精度关键区域。
Intern-NCP 团队发布 NCP-ArchPreview 技术报告,该隐空间语言模型在标准 token 级自回归生成之外,通过下一概念预测(NCP)学习跨多个 token 的离散概念,并用隐状态构建乘积量化的概念词表。
研究团队提出 CARDEA,一个用于冠脉造影(CAG)端到端解读的大型视觉语言模型,可从原始多视角视频经关键帧筛选输出研究级诊断,并展示结论背后的可审计空间证据。
SenseNova-U1.5 发布,这是一个 8B-MoT 原生统一多模态模型,在无编码器、无 VAE 架构下实现视觉内容的理解、推理与生成。模型支持最高 4K 原生分辨率,并通过多专家 on-policy 蒸馏优化视觉美学、双语文字渲染、信息图生成与图像编辑等能力。官方将开源训练代码,涵盖监督微调、强化学习与 on-policy 蒸馏。
针对 AutoResearch 智能体 RL 训练中环境执行成为瓶颈的问题,研究者提出 World Model RL(WMRL),用世界模型替代环境执行,并配合 Online Debiasing 与 Inverse-Variance Denoising 分别抵消偏差、抑制噪声,理论上证明两者严格改善收敛保证。
研究团队推出 T1,一个 122B 总参数的 Mixture-of-Experts 模型,通过强化学习在云沙箱中操作真实 shell,单任务支持 300+ 轮工具调用,并以任务自带 verifier 执行结果作为奖励。
PARSER 将长文档读取与推理解耦:一组轻量子智能体各自绑定单个 chunk 并行读取全文,主智能体通过迭代 scatter-gather 轮次广播查询、聚合证据并生成更深层追问,仅主智能体用强化学习优化,子智能体保持冻结。
开源答案引擎 OreoLook 提出三层缓存架构,在单台 8-vCPU Intel Cascade Lake 服务器上实现 89.3% 的 Redis 键空间命中率、0.1 ms 读取延迟和仅 1.38 MB 内存开销。