InternReviewer 与 InternAdvocate:面向同行评审与反驳的智能体强化学习客观奖励与评估框架
研究团队提出 InternReviewer 和 InternAdvocate 两个学术智能体,用于生成同行评审与反驳内容,并构建了大规模高质量学术数据集与高效 arXiv 检索工具支持主动取证。
huggingface.co · 开发者平台
研究团队提出 InternReviewer 和 InternAdvocate 两个学术智能体,用于生成同行评审与反驳内容,并构建了大规模高质量学术数据集与高效 arXiv 检索工具支持主动取证。
ReFlowSET 是一种条件潜空间流匹配框架,通过联合 SAR-EO 重建审计来选择编解码器,并在选定潜空间中从零训练更小的条件 DiT,配合双流 SAR 条件与联合特征精炼。训练时用冻结视觉基础模型提取的干净 EO 表征对齐中间噪声 EO 特征,不增加推理成本。在 QXS-SAROPT 和 SAR2Opt 上取得 SOTA,代码与预训练权重已公开。
研究者推出 GUI-CC 基准,用于评测 GUI 世界模型作为智能体环境时的上下文一致性,而非单步下一屏预测。该基准包含离线参考动作与在线智能体循环两条赛道,基于 GUIOdyssey 构建 500 个离线轨迹任务,并在 30 个移动应用中构建 200 个经模拟器验证的在线任务,评测转换保真度、转换合理性、上下文一致性与任务进度。
一项 arXiv 研究指出,当前 LLM 服务的安全防护多以拒答率、攻击成功率和违规率来评估,但这些指标只反映防护在测试请求上的局部表现,无法回答部署后攻击者持续适配或另寻入口时系统仍会提供多少有害帮助。研究认为,证明有害帮助仍存在只需一次成功攻击,而要证明其已很少则必须补充防护之外整个系统的证据,这类证据在深度编码的论断中仅占少数。因此局部分数提升本身不等于部署更安全。
RECAP-Forcing 提出按"外观新颖度"而非时间远近组织记忆,在内容首次出现时保留其对应 KV cache,让记忆规模随新增内容量而非视频长度增长。该方法统一了注意力汇与基于光流的新颖度库两种机制,作为无需训练、不增加可学习参数的推理方法,在多个强基线上持续提升视觉质量与语义保真度,并优于现有记忆方法。
研究者发布 CoVA-SFT,一个包含 51.9K 样本、超 222K 多模态推理步骤的视觉抽象链数据集,覆盖 5 种布局家族和 17 项复杂任务,并配套 1,700 条测试样本的 CoVA-Bench 基准。在该数据集上微调的模型在 CoVA-Bench 上平均超过所有交错 CoT 基线 2 倍以上,但仍落后于强纯文本 CoT 基线。该数据集已被 EMNLP 2026 Findings 接收。
研究者构建了来自 Twitter/X 七种语言的大规模真实虚假信息数据集,并提出多模态虚假信息分类体系,通过 VLM 自动化多步标注流程完成分类落地并经人工验证。分析发现,AI 生成内容在科技领域尤为普遍,而疫苗虚假信息则大量借用新闻媒体图片以增强可信度。该方法和发现为针对性检测多模态虚假信息提供指引,并建议缓解措施应策略性地差异化应用而非统一实施。
SpanCalib-VLM 提出一种双系统混合方案,用于视觉语言模型的幻觉片段检测:将 XLM-RoBERTa-Large 与 SigLIP 视觉编码器经交叉注意力融合的多模态序列标注器,与微调生成式 VLM(Qwen3.5-4B-SHROOM-SFT)结合,通过 Union-Calibrated Fusion 策略用标注器的校准概率对生成模型的候选片段重新打分。
研究者提出 ContextBias 受控评估框架与 ContextBench 基准,覆盖 92 种职业、1,656 条语义受控提示词,用于隔离上下文变化对职业相关视觉表征的影响。
研究者推出 EvoGenUI-Bench,用于评估 LLM 在多轮生成式 UI 任务中维护可执行界面的能力,包含 150 个五轮任务、共 750 轮,覆盖信息呈现、可执行交互和工具接地外部状态三类场景。
研究提出 FACE-Eval,用 5,100 条样本评测来自 8 个模型族、参数量 4B 至 1.60T 的 15 个开源模型,改变偏好线索的位置(用户消息或工具返回)与呈现方式(直接摘要或原始文件)。
Aardvark Weather 通过为观测编码器加入输入相关噪声、在处理器中引入 Monte Carlo dropout,被改造为概率模型,并用全方差定律将预报离散度分解到观测与模型两个来源。
研究者提出 PRISK 动态评估框架,用于系统检测 LLM 个性化的副作用,覆盖无关个性化、偏好窄化和谄媚偏见三类风险。在 13 个 LLM 上的实验显示,用户画像与检索记忆会持续加剧这些偏见,三项指标平均分别下降 45.9%、41.7% 和 61.7%。
研究者提出 Super Library Agent 问题:让 LLM 编码智能体在顺序生成 N 个相关应用的同时,维护一个可复用的跨应用共享 Super Library。
研究者提出 Hash-Atlas 网络与对话式 3D 场景编辑方法 CE3D++,将 3D 场景编辑重构为对 2D atlas 图像的操作,实现 2D 编辑与 3D 重建流程解耦。
SafeAtlas-VL 发布 150 万条训练实例的多模态安全数据集,将图像、请求、回复三个层级的判断统一到五级有序量表,覆盖 15 个危害类别和 55 个细分子类。
WebWorld 让 VLM 与浏览器这一可执行模拟器交互,由浏览器对每次候选修复重新执行并签发验收证书,只有目标进展与既有能力保持同时成立才纳入监督。
LightNav-0 是一款紧凑的通用具身导航模型,通过统一 token 接口激发预训练 VLM 的空间智能,无需任务专用预测头。其导航训练语料覆盖 2K+ 场景和 4K+ 小时具身导航数据,在全部 10 个公开导航仿真设置中取得 SOTA 单目成功率,并实现跨机器人本体的零样本泛化。
研究者提出数据内在一致性(DIC)自评分指标及基于它的自适应数据筛选方法 DICS,在样本级一致性与全局分布多样性之间做权衡。DICS 仅用 25% 的 LLaVA-1.5-665K 数据即超过全量微调,并构建了 600 万样本的 DICS-6M 多模态指令语料。在不足 InternVL3-8B-Instruct 官方训练数据 25% 的情况下,DICS 达到其 94.52% 的性能。
研究者提出 KATok,一种基于 Transformer 的 VAE,通过可学习自适应 token 选择器评估每个 token 的 keep-or-drop 概率,丢弃无信息 token,实现数据依赖的压缩。
针对科学图表生成中单轮难以满足作者偏好的问题,研究者提出多轮图表生成基准 MTPaperBananaBench,含 292 张图像和 3,518 条用户需求,并构建用户模拟器将未满足需求转为自然语言反馈。基于此提出的多智能体系统 PaperBanana-Interact 通过内部批判-精修循环,在多轮中持续提升图表质量,质量分超越基线 11.9-18.6 分,遗忘问题减少 3.7-6.2 分。
Lucida 提出一种可组合场景建模框架,将真实室内视频解析为带多视角证据的场景图,为每个实例生成完整资产,并用 VLM 策略 GizmoAct 以多轮 GUI 交互方式闭环放置物体。在 R2S-Scene 上其 mAP 较 Boxer 提升 69%,CA-1M 上 ADD-SB@0.05 从 57.8% 升至 83.4%,场景 F-Score 从 SAM3D 的 0.794 提升至 0.924。
DreamX-Creator 1.0 是一个以 7B 生成器为核心的原生音视频联合生成系统,输入首帧与文本提示词即可对音频和视频流联合去噪。网络前半段独立处理两路模态,后半段通过 Gated Cross-Modal Attention 耦合,并配合渐进式联合训练与音视频强化学习后训练。
阿里通义千问团队披露 Qwen3.8-Flash-Next 架构,这是一款 125B 参数的稀疏 MoE 模型,每 token 激活 6B,另有 51B 参数的 n-gram 嵌入表放在加速器之外。
研究者提出 Image Bundle Composition(IBC)新范式,将图像检索从单图打分转为从海量照片池动态组合连贯图像束,并构建含 109,467 张图像、667 条验证查询的 IBCBench 基准。
研究者提出 Normalized Low-Rank Adaptation(NoRA),通过在训练中归一化 down-projection 矩阵来稳定 LoRA 的优化动态,也可仅在初始化时归一化。在预训练、监督微调和强化学习中,NoRA 均能加速收敛、提升性能与训练稳定性,并缓解灾难性遗忘,且不增加可训练参数或推理开销。
研究者提出 Dynamic Important Example Mining(DIEM),一个全自动的强化微调数据利用框架,通过梯度对齐重要性估计器近似每个样本对策略改进的边际贡献,并用约束批重加权方案在保持更新梯度幅度的同时最大化总体效用。在多个推理基准上,DIEM 持续优于强静态与动态基线,代码将通过论文链接发布。
研究者提出 SHAPE 框架,从语义空间与启发式两个数学教育视角分析 LLM 的 Chain-of-Thought 轨迹,发现模型采用的数学启发式比传统 CoT 特征更能解释最终答案正确性,且模型倾向集中在少数语义空间内推理。研究还发现强化学习会导致启发式使用出现模式寻求,而通过后训练促进启发式多样性可提升数学推理准确率。
研究者推出 MineAmongUs——一个 3D 多模态 Among Us 沙盒,内鬼智能体需通过言语与非言语动作联合欺骗队友,同时提出可配置 VLM 智能体框架 ARIA,暴露五条认知组件消融轴。实验显示 VLM 智能体依靠言语与非言语联合欺骗取胜,非言语通道在框架消融与跨 VLM 评测中都是更决定性的获胜因素。该工作为具身 VLM 智能体对齐研究开辟了新路径。
Verification-Aware Training(VAT)是一种即插即用的训练框架,在每步训练中模拟投机解码的验证过程,把接受与拒绝模式转化为监督信号,包含验证头和验证自适应加权两个组件。
Matrix-Game 3.5 在 Matrix-Game 3.0 基础上提出统一几何感知记忆框架,其中 patch-memory 与 tiled-PRoPE 不额外引入可学习参数,用于实现几何一致的相机控制和长时序场景回忆。
BLARM 是一种前馈方法,给定单目视频和静态物体网格即可预测时序连贯的动画网格,无需骨架、笼子、蒙皮权重或绑定标注。它用一组学习到的时变刚性运动分量和时不变顶点到分量的蒙皮权重表示动画,并通过分解式时空注意力将几何形变潜变量与视频特征结合。模型以轨迹重建、熵正则化和运动感知对比学习训练,可从单目视频中恢复紧凑可解释的运动结构。
研究检验了功能向量(FVs)在多语言多标签情感识别任务中的跨语言迁移能力,发现从源语言提取的 FVs 无需推理时提供示例即可引导另一语言的任务行为,在干净与扰动零样本设置下均显著提升性能。每个 LLM 存在相对稳定的最优注意力头区间用于构建有效 FVs,且该模式跨语言一致。FVs 可部分复现标准少样本上下文学习的任务引导效果,同时避免处理多个示例的计算开销。
针对潜空间生成模型两阶段训练中重建优化潜空间不利于生成、端到端联合训练易发生潜空间坍缩的问题,研究者提出 GenFirst 策略:先以弱重建压力让生成目标塑造潜空间,再逐步加强重建以恢复视觉细节,实现首个无潜空间坍缩的直接端到端训练。
PaperGym 将每篇论文转化为完整训练环境,问题由研究目标与背景合成、评分标准取自方法与实验,标准泄漏率降至 3.7%(现有数据集为 11.90%–34.10%)。
研究团队提出 AutoSciRub,一个"先评估后执行"的框架,在科研执行前为任务自动生成可执行评分标准,用于指导实验、逐条验证与迭代修订。
CAST 是一个批判感知训练框架,可将稀疏的任务结果转化为动作级监督,用于批判学习与策略优化,并合成结构化理由来解释部分可观测条件下的动作有效性。在动态工具调用基准上微调 Qwen3 系列模型后,CAST 在 Retail 任务上 pass^4 超过 GPT-OSS-120B 逾 10%,在 Telehealth 的域外场景中再提升 9%。该工作已被 EMNLP 2026 主会接收。
研究者提出 MNIST-PRO,将 MNIST 数字识别改造为带 lookback 约束的序列化 glimpse 搜索任务,用以隔离考察 AI 智能体的感知状态构建能力。
NavMCP 是一个智能体脚手架框架,将 VLM 推理智能体与 NFM 执行器耦合,通过 intent、observation、memory 三条通道协作,无需重训练即可把孤立的导航 rollout 变成持续的具身交互。
一篇 72 页论文提出用 L0 到 L4 五级阶梯刻画大推理模型(LRM)学习过程中人类控制力的逐步退出,并沿奖励与经验两条轴线展开:奖励从逐例人工判断走向可复用验证器乃至无人类反馈的奖励,经验从人工策划任务走向自生成课程、自建环境与自主协同演化。论文同时指出奖励黑客、反馈漂移、课程崩塌和环境错误等风险,并从策略能力、反馈保真度、经验质量三方面给出评估框架,另维护 GitHub 仓库跟踪最新进展。