SAEScientist-Bench:AI 智能体能否自主开展 SAE 可解释性研究?
研究者提出 SAEScientist-Bench,用于评估 AI 智能体能否像科学家一样使用 SAE 工具自主完成机制可解释性发现。任务要求智能体在 Gemma-2-9B-IT 的 Gemma Scope 词典中检索 131K+ 特征,并与 Neuronpedia 上的专家参考特征对比激活排名、对比文本上的概念选择性和因果引导效果。
huggingface.co · 开发者平台
研究者提出 SAEScientist-Bench,用于评估 AI 智能体能否像科学家一样使用 SAE 工具自主完成机制可解释性发现。任务要求智能体在 Gemma-2-9B-IT 的 Gemma Scope 词典中检索 131K+ 特征,并与 Neuronpedia 上的专家参考特征对比激活排名、对比文本上的概念选择性和因果引导效果。
针对 agent harness 与模型权重共同决定行为的问题,研究在七项企业 agent 任务上先为较弱模型演化 harness,再用更强专家监督。但让弱模型模仿专家完整轨迹会导致 Qwen3-Coder 和 Gemma 4 在全部七项任务上回退 4 至 30 分,原因是模仿破坏了模型与 harness 的匹配。
研究在共享 Flutter/Dart 数据集上训练 Rainbow-Pony-100M 和微调 Qwen2.5-Coder-0.5B 两种代码模型,对比直接生成整文件与迭代 diff 编辑两种输出方式,在约 1,790 个任务上评估。
DianShi-RxnDB 是一个通过全自动抽取与归一化流程构建的大规模细粒度有机反应数据平台,整合专利文本、图像与反应式,覆盖 USPTO 和 EPO 1976 至 2025 年的有机合成专利,产出约 2400 万条反应实例,其中约 1480 万条(61.7%)通过自动质检。
针对 AI 研究智能体的成果声明,Discovery Certification Protocol(DCP)将其转为在注册模型、信息边界和预算下的可执行审计,Gate 1 验证有效改进,Gate 2 用匹配智能体测试可复现性,Core 要求零复现且给出有限样本复现上界。
研究者构建了 RESCUE 基准,用于评估 LLM 能否捕捉并利用多人关系中不断变化的动态来提供情感支持。该基准取自真实情侣与家庭访谈对话,包含 191 个样本、7,079 个标注轮次和 1,064.8 分钟视频,定义了关系理解与关系敏感支持两类能力下的六项任务。对十款 LLM 的实验显示,模型在依赖局部情绪线索的任务上表现尚可,但在关系模式预测、观点预测和支持策略预测等关系密集型任务上表现不佳。
研究团队提出 AgenticGen,一个奖励引导的智能体框架,将广告视频生成拆解为策略选择与草稿生成两个可训练推理阶段,并从在线反馈中学习性能奖励、结合人工质量标准的评分奖励来监督策略优化。
Puppeteer 是一个姿态感知、物体锚定的共语手势扩散模型,在因果潜空间中运行,将长手势分解为结构化基元并编码为时序有序的潜 token,再以语音、运动历史、初始姿态参考和物体几何为条件进行扩散生成。
Show-Harness 是一种 Embodied Harness,通过离散语义动作单元接口让 VLM 直接控制机器人,无需额外模型容量或昂贵的本体专用预训练。
研究者提出 Φ-Bench,用于系统评估 LLM 工程化 LLM 基础设施栈的能力,覆盖从局部 kernel 级函数补全到长周期实现与端到端系统优化等不同复杂度任务。该基准源自前沿研究中的优化问题并基于真实代码仓库构建,弥补了现有基准仅关注孤立 kernel、预定义算子或预设优化目标的不足。对前沿 LLM 的实验揭示了其在工程化复杂 LLM 基础设施上的现有能力与局限。
研究发现,LLM 后训练(如 SFT)中完整推理轨迹带来的收益有限,而部分轨迹即使被大幅截断仍然有效。基于注意力的分析和受控 token 移除实验表明,中间 token 对最终推理质量贡献极小,模型可依据已知轨迹端点从内部知识推断缺失步骤。仅用端点训练还能改变推理行为,并提升基于强化学习或 on-policy 蒸馏的后训练方法效果。
Programmable World Model 提出一种可编程世界模型框架,把世界状态演化与视觉观测生成解耦,由智能体将自然语言指令翻译为可执行程序,以指定实体状态和状态转移规则。
研究者提出 StudyBench,一个受控物理基准,直接衡量自进化方法将训练材料转化为能力的效率,测试集分为评估吸收能力的 Application Set(难题)与评估迁移能力的 Transfer Set(奥赛级题)。
研究者提出 Graph Machine(GM)架构,维护 O(n) 大小的状态并通过稀疏动态路由访问,用类似指针追逐的 referral 机制以可微分方式更新边。
研究者提出 EvoHarnessBench,一个在可控 harness 演进下评测 LLM 智能体的基准,覆盖工具、技能和智能体三个维度,包含 802 个任务、520 个工具、42 个技能和 62 个智能体。
RenderFormer-V2 是一个基于 Transformer 的统一神经渲染模型,无需逐场景训练或专用代码即可处理焦散、体积散射、环境光照、带纹理与位移的表面及分布外材质等光照传输效果。它延续两阶段设计,在视图无关阶段引入窗口注意力与渲染感知注意力汇以提升可扩展性,并支持环境贴图和参与介质等异构场景基元,采用独立于表面反射模型的材质编码。该工作已被 ECCV 2026 接收。
研究者提出 NOAH,一个时间感知、任务无关的生成式 Transformer 模型,可表征并预测完整的多模态患者病程。该模型基于 MIMIC 数据集家族中 299,000 名患者、431,000 次就诊的逾 5.59 亿条临床事件构建,原生处理医学图像、时间序列与数值信号、分类事件及结构化与非结构化临床记录。
多模态大模型在细粒度图像差异识别上仍很脆弱。VDiff-Bench 包含 1,756 道四选一题目,覆盖位置、运动、颜色、噪声/分辨率、纹理、OCR/文本、光照等 10 类变化,并配有需区分真实变化与近似语义选项的难负样本。
一项企业分析研究让语言模型只负责理解问题,由确定性策略选择并运行预先批准的分析程序,同时返回结果与证据。在 440 次运行中,三个 8B 模型运行时生成 SQL 并选工具,330 次运行规划无一满足完整的答案加证据契约,而策略执行的 Qwen3-8B 分析器 110 次全部匹配。
研究者提出一种无需配对 3D 监督的前馈式 3D 编辑框架,通过生成先验蒸馏从基础模型向 3D 编辑模型迁移视觉、语义与几何知识。该方法借助可微渲染管线,在主编辑视图用图像编辑模型的 2D 视觉先验、在新视图用视觉语言模型的语义先验进行监督,并引入 3D 感知分布匹配正则化以缓解几何坍塌与多视图不一致。实验显示其在指令保真度与跨视图一致性上显著优于现有基线。
针对 Hugging Face 事件与一起公开 wiki 调查,研究者提出防御的操作单元应是可修订的“协同事件”,将观察到的传输、任务权限与响应历史关联起来。核心问题是前瞻性事件发现:在评估者给出归属之前,判断哪些动作属于同一事件。论文给出评估设计,在同等审查成本与误报负载下比较孤立动作、滚动窗口、已知群体与前瞻发现的事件,并检验通道关闭与状态隔离后的复发情况。
针对全双工语音模型文本生成、语音合成与音频播放异步导致"自认为说过"与"用户实际听到"不一致的问题,研究者提出 Self-Listening 建模方法,将模型已播放的语音作为输入流回喂,使打断恢复锚定在用户真实听到的内容上。
研究团队发布 SynthGait-19K,一个包含 19,272 段步行视频的物理仿真合成数据集,源自 437 名受试者的 6,427 段 MoCap 序列,并配有 SMPL 动作与六项步态参数标注。
研究团队提出 OpenWAM,一个将世界-动作模型(WAM)预训练拆解为可组合模块的开放研究栈,并配套统一训练、推理、部署与评估的基础设施 OpenWAM-Infra。
A*-Thought-V2 提出一种基于 LLM 几何动力学的框架,将 CoT 建模为隐藏状态轨迹,用显式-隐式交错潜在架构替代硬删除。在 Qwen3.5-9B 和 Qwen3.6-27B 上,六个基准测试平均准确率最高提升 2.6%,响应长度最多减半,单位计算准确率提升 2.29 倍,预处理和训练时间分别减少 94.6% 和最高 80.3%。
Marigold V2 将基于 DiT 架构的预训练多步 flow-matching 模型改造为单步推理的单目深度估计器,在 KITTI 和 ETH3D 上 AbsRel 较此前最佳提升 16-26%。
UCF-Net 通过不确定性感知的级联融合网络,结合 CLIP 的语言对齐语义先验与 DINO 的自监督视觉结构先验,跨 Transformer 深度提取层级特征并按熵推导的不确定性加权融合。
RelightFormer 是一个前馈生成式 Transformer,可直接完成单视角与多视角图像重光照,无需显式估计材质等本征属性。它改造自视频基础模型,通过潜在光照模块以 cross-attention 注入目标环境贴图,并用置换不变位置编码处理无序多视角输入。
Cadence 是一款误差有界的有损压缩器,将 330M 参数的 Google TimesFM-3 与自适应算术编码器结合,保证每个样本满足 |x̂_t−x_t|≤τ。
研究者提出 SQS,一个通过贝叶斯变分学习同时进行剪枝与低比特量化的统一框架,采用 spike-and-slab 先验诱导稀疏性、用高斯混合模型(GMM)建模量化权重,并给出高效近似与变分方法的一致性理论结果。在 ResNet、BERT-base、Llama3.2 和 Qwen2.5 上的压缩实验显示,SQS 在性能下降相当的情况下压缩率高于现有方法。该论文已被 TMLR 接收。
研究用 ExpertCollab 多轮研究规划对话语料发现,Transformer 对对话伙伴专业水平的推断在早期层最易解码,到网络中点前已降至接近随机水平。反事实修补显示,在解码峰值层注入专业水平差异几乎不改变固定后期层读出,而在中点之后注入则几乎完全传播,差距超过一个数量级。这表明推断出的关系属性在被因果使用前早已被表征,界定了读取或引导伙伴条件行为的干预位置。
ReactVAU 是一个面向实时流式视频异常理解(VAU)的慢-快解耦框架,被 ECCV 2026 接收。它由基于 Spatial Grid Folding(SGF)的轻量快速检测模块、保护关键视觉线索的 Anomaly-Aware Persistent Memory(AAPM),以及仅在可疑事件时唤醒的重量级慢推理模块组成。
研究仅用机器改写指令、不改架构,为 Cosmos3 视觉-语言-动作策略加入希腊语。在 90 任务判别套件、每组 3 个种子的测试中,双语训练比对照组稳定高出 6.7-7.1 分,达到英语性能约五分之二;仅希腊语训练最多超出对照 2.7 分,无希腊语演示的多语言文本塔则停留在错误指令下限。策略还会过拟合译者的措辞,每任务用 7 种表述训练可将该损失约减半。
一项被 EMNLP 2026 主会接收的研究发现,1.7B 至 70B 的指令微调模型中存在一条隐藏状态线性方向,能区分可答问题与结构性无解的数学和代码提示,说明模型在生成前已表征出问题无解。
CoVeR 是一种无需训练、确定性的视觉 token 选择器,仅利用 token 坐标实现多视图 3D 场景的覆盖率剪枝。在三个 3D 推理基准上,它仅保留约 8% 的视觉 token 即可维持全量 token 93.5% 的性能,平均超越此前 SOTA 3.9 个百分点,并可作为即插即用模块适配四种 VLM。
研究团队提出 RoboSPA,一个面向 VLA 模型具身推理诊断的大规模机器人操作数据集与基准,聚焦细粒度空间推理与长程程序规划,覆盖 10 个任务类别、56 个基础任务,每个任务设五级难度共 280 个变体,采集 527K 条轨迹。
AuK 是一个开源基础模型,用自然语言指令和音频上下文这一统一接口完成语音生成与编辑,团队为此构建了约 3.03 billion 条指令-音频实例、1.95 million 小时有效监督,覆盖语音生成、内容编辑、增强与分离、副语言编辑和声学编辑五类任务。
TransNormal-2 是一个基于 FLUX.2 的整流流框架,采用单步确定性推理,通过几何感知像素空间损失和轻量级 Geometric Refinement Module(GRM)在 VAE 解码器两侧修正法线估计退化。
研究者提出 Procedural Graph,将智能体的程序性知识组织为(procedure, relation, procedure)三元组,在每步决策时定位活跃节点并由引导模型将子图转化为步骤级情境指引,从而偏置而非强制求解器的下一步动作。
研究者提出 Causal Visual Recurrent Reasoning(CVRR),从预训练视觉语言模型融入图像后的问题隐藏状态初始化循环计算,反复更新状态并重读同一固定视觉证据,解码前移除视觉状态与原始多模态 KV cache,使循环计算成为预测必需的图像条件路径。