EarlyEval:通过早期结果预测降低 Agent 评估成本
EarlyEval 是一个轻量框架,通过训练一对 LightGBM 成功与失败分类器,在 Agent 执行过程中提前预测最终结果并终止运行,从而降低评估成本。
huggingface.co · 开发者平台
EarlyEval 是一个轻量框架,通过训练一对 LightGBM 成功与失败分类器,在 Agent 执行过程中提前预测最终结果并终止运行,从而降低评估成本。
研究团队提出 ASPIRE 基准,考察模型能否仅凭一句自然语言能力目标完成自我进化,下游评测任务对智能体保持隐藏。智能体需自行选择数据与更新方法、构建训练和验证信号并决定何时评测,基准同时支持模型权重与 agent-harness 两条进化路径,并在覆盖六个目标的 520 条隐藏专家题目上评测。
研究者提出 Declarative Attention(DA)协议,让模型在思维链中主动声明需要关注的上下文区域,推理引擎像解析工具调用一样跳过大部分 KV cache 读取。
论文提出一套端到端后训练流水线,结合 22,000 道题的数据筛选、合成推理轨迹、SFT 与 RL,训练出 Nemotron-3-Nano-CC(30B-A3B)和 Nemotron-3-Ultra-CC(550B-A55B)。
研究团队提出 Kirin 框架,可从野外动物视频重建 3D 动作、大规模学习动作先验并生成可直接用于动画资产的真实动作。团队基于大量野外视频构建了 AiM3D,这是首个面向四足动物、提供对齐视频-文本-动作三元组的大规模数据集。其视觉引导动作生成模型以文本和图像为条件,结合现成图像到 3D 模型自动绑定并驱动 3D 网格,生成可直接渲染的动画动物。
研究通过系统性消融实验确定鲁棒视觉文本表示学习的四个关键要素:可变图像分辨率与渲染字号、自然图文对、布局感知渲染、两阶段多语言课程。据此训练的 Pixel Linguist II 采用原生分辨率与实时渲染,在 2.8 亿训练样本上完成多语言课程训练,在英文、跨语言及多语言 Visual STS 与 ViDoRe 上取得新的 SOTA,并在 80% 视觉 token 压缩下保持稳健。
论文提出 ExecRetrieval 代码检索基准,包含 939 个 Python 任务,每个任务配有一个经执行验证的规范实现和最多四个执行验证的缺陷干扰项。在评测 23 种稠密嵌入配置与 BM25 后,检索池含近似克隆反事实时头部托管系统的 exec@10 达到 1.00,但 exec@1 仅 0.331。
针对 RLVR 依赖粗粒度结果奖励、对中间推理过程指导不足的问题,研究者提出奖励塑形策略 Cliff,用现成 LLM 作为教师识别每条 rollout 中的第一个错误,将轨迹拆分为正确前缀与错误后缀,并转化为 token 级优势。在 12 个场景的实验中,Cliff 持续提升推理表现,分别超过 on-policy distillation 15%、标准 GRPO 7%,即使教师模型能力一般也有效。
PaperCompiler 将论文证据编译为显式的仓库级实现规格,保留来源溯源并区分论文支持、推断、外部委托和未解决信息,规格中编码非退化要求、归属分配、跨文件依赖和文件级约束。在 Paper2CodeBench 上,其基于参考的忠实度相对提升 13.8%(从 3.64 到 4.15),高严重度评估批评从 13.2% 降至 6.1%。
论文提出 SolarWM,一个完全开放的视频世界模型基础,覆盖从数据准备到长时程推理的全流程。其数据引擎把 10 个数据集的 143 万条片段统一为帧对齐格式,并在共享接口下基于 Wan2.2、LTX-2.5 和 MiniMax-H3 实例化四个 5B 至 33B 模型。模型仅用 5 秒序列训练即可支持分钟到小时的实时交互 rollout,数据、流程、配方、权重与框架均已开放。
针对采样 token 在线策略蒸馏(OPD)中 pass@1 提升但 pass@k 停滞的多样性蒸馏失败问题,研究者提出一阶局部熵影响(First-Order Local Entropy Influence),将每次更新的熵效应拆解为师生对数概率差与学生局部概率结构。
研究者推出 Multi³IR 基准,包含 104.9K 条 Stack Exchange 查询,每条都标注了捕捉查询隐含视角的视角描述,用于评估检索器在跨领域、跨模态下覆盖开放式查询多面视角的能力。
CoGR 是一个让 LLM 在查询侧和物品侧直接生成关键词表示的检索框架,关键词通过倒排索引匹配,兼容现有检索基础设施。它采用两阶段训练:先监督微调建立对齐的关键词空间,再用 GRPO 交替优化两侧生成器,物品侧使用反事实边际奖励。在内部 APP Marketplace 数据集和公开 WANDS 基准上,CoGR 的 F1 分别比最强基线提升 10.9% 和 36.1%。
研究提出"内生授权洗白"概念:LLM 智能体的持久记忆若错误记录权限变更,可在无外部攻击下凭虚假授权执行未授权操作。新基准 EAL-Bench 测试显示,增量记忆更新下写入方为最高 50.2% 的未授权请求创建虚假权限,执行方在 98.6% 的试验中照此行动。要求权限有有效源事件背书、用有界事件溯源追踪权限变更可大幅降低洗白,但也会拒绝更多合法操作,形成安全与效用的权衡。
RealSWE 提出由 SWE-bench Verified 与 Pro 衍生的 381 个多变量任务族,用于评测真实用户请求风格下的编码智能体。对真实提示词与基准问题的对比显示,只含问题陈述的请求占真实提示词的 88%,在基准问题中仅占 7%;87% 的真实提示词为随意书写,而 94% 的基准问题为正式书写。
基于 logit 的知识蒸馏在中训练阶段会拖慢事实记忆的习得,但推理能力仍持续提升,原因是教师模型对程序性数据更有信心、而学生模型更早掌握低熵事实知识。为此提出的 Switch Distillation 以教师预测熵为路由信号,仅在教师有信心的 token 上蒸馏,其余回退到交叉熵。
研究对比了脚本专家与 ACT 策略在 ParcelStow 接触密集型任务中不同执行速度下的表现:两者在标称速度下均达 100% 成功率,但在最大演示速度下专家成功率为 84%,ACT 仅为 53%。
研究者提出 agentic data cracking,让智能体在推理过程中顺带将非结构化数据自适应、推测性地结构化,从而减少重复打开文档的开销。在 FanOutQA 上每道测试题仅扩展一个相关问题,该方法在保持准确率的同时将成本降低 53%;而理想预结构化存储的推理成本可低 28 倍。
论文提出 AgentJudgeBench,称其为首个系统研究 LLM-as-a-judge 在智能体工具调用工作流 DAG 上可靠性的基准,包含 3,808 个实例、六种 DAG 拓扑和三个难度层级,用五个生成模型与六个裁判模型在有无真值条件下配对评测。
研究团队通过生产错误分析定位指令遵循、函数调用和内部任务分布三方面差距,为每个维度单独训练 GRPO 专家并用两阶段 SLERP 合并,将 200 多个内部应用的流量整合到单一自托管模型上。
腾讯混元联合北京电影学院、北京大学等发布 DramaChain Bench,这是首个覆盖剧本、分镜、关键帧、镜头级视频到成片全链路的短剧生成评测基准。该基准基于 DramaChain Dimensions 的 5 个评估轴、63 个叶子维度构建,由 3 位专业标注员对 5,785 个条目独立打分,产出 17,488 条有效评分和 255,925 条可追溯归因记录。
CASTER 是一种无需梯度的测试时自适应方法,将源类统计量存入判别子空间,由目标批次矩估计类共享仿射变换并解析传输源类分布,无需反向传播、优化器状态或源特征库。
研究提出可信用分配推理(credit-addressable reasoning),并实例化为 Code-CoT 与 CE-GRPO:前者将视觉关系表示为可按行寻址的可执行代码,并把推理组织为带类型事件;后者用结构先验与类型归一化熵选取事件边界,从共享前缀采样完整续写,将结果差异转为局部优势。
一项研究提出递归再生数 R_AI,用于判断 AI 研发反馈是否会在开发周期中自我放大:R_AI>1 时改进效果跨周期累积,R_AI<1 时则逐周期衰减。该转变取决于 AI 研发反馈回路的结构,而非某个特定的模型能力水平,因此系统可能在加速显现之前就已进入自我放大状态。模型还显示,跨机构共享的改进可使整个研发生态具备自我放大性,即便单个参与者并非如此。
研究者提出以感知为中心的持久智能体架构 Pera,将语言智能体从解决用户指定的有限任务,转向在长期场景中提供持续服务。Pera 围绕感知与控制组件,持续捕捉任务执行、内部上下文和环境变化中的服务相关信号,并据此构建生命周期任务,驱动服务流程持续运行与自适应。该工作用 Pera 回溯梳理近期研究、开展案例研究,并提出构建更强持久智能体的前瞻性见解。
DiagEvo 通过诊断器从自我博弈的失败历史中提取反复出现的错误原因,存入错误原因记忆并按技能节点追踪 Active 或 Mastered 状态,无需外部任务资源即可引导出题。
Safin-1 是一系列基础模型,基于 Memory-Anchor Routing across Context History(MARCH)架构,通过内容条件路由维护结构化记忆状态并选择性检索历史信息,实现"内在安全"。
研究提出 SMELT(Sparse MoE Transformer, middle layers Loop Twice),将 MoE Transformer 中间一半层循环两次,在每 token FLOPs、非嵌入参数量和 KV cache 三项预算与未循环基线匹配的前提下扩展至 54B 非嵌入参数。
阿里发布 Qwen-Drive-1.0,一个面向自动驾驶的视觉语言基础模型,在统一框架内整合 3D 感知、视觉问答与运动规划。模型保留预训练 VLM 架构,通过外部 BEV 感知头联合执行 3D 目标检测、语义占用预测和 BEV 地图分割,并由规划专家生成未来自车轨迹。实验显示其在保持通用视觉语言能力的同时具备较强 3D 感知与驾驶场景理解,开环、伪闭环和闭环评测中运动规划表现具竞争力。
UI-Venus-2 是一个通用基础 GUI 智能体,通过统一的闭环推理动作框架在移动、网页和桌面环境运行。为贴近实际部署,论文从环境、任务和验证三个维度扩展:环境覆盖 170 多个多语言移动应用与原生桌面操作系统,任务侧用深度研究流程生成基于功能的指令,验证侧采用 trace-level 与 sample-level 评估器,结合视觉关键点和多模型投票提供可靠 RL 信号。
论文提出 Harness-of-Harness(HoH)框架,让基于 LLM 的编码智能体在自主开发中按规划、编码、测试循环持续改进软件。
ZimaBlue 提出从大规模视频学习可泛化世界动作模型(WAM)的三段式训练框架,先在人类与机器人第一视角视频上做因果具身视频预训练,再通过统一动作表示在异构机器人轨迹上做视频-动作中期训练,最后针对目标机器人专门化。
H3-World 将 33B MiniMax-H3 视频生成器改造为交互式世界模型,把自然语言指令转化为精确的、时间对齐的角色与镜头控制,且不引入专门的动作模块。它通过时间注意力路由限制每条指令的作用区间以减少控制泄漏,仅用 8,000 个游戏样本、10,000 步 LoRA 优化和 0.199% 可训练参数即实现有效控制,并保持生成质量、可泛化到未见场景。
研究团队提出 E-Commerce Bench,一个把多轮供应商谈判与动态事件整合进为期一年电商经营的开源基准,LLM 智能体需在 365 天内同时运营多家网店,完成市场调研、进货谈判、销售策略、订单履约、退货处理与现金流管理,以最大化年末总资产。
针对多智能体 LLM 系统中提示词同时承担内容生成与执行协议两种角色、优化时易破坏路由与格式协议的问题,研究者提出 control-data flow separation,将执行关键的控制逻辑表示为带类型、可验证的程序对象,任务相关语言则保留为可优化的数据流。在合成推理、协作评审生成和保险评级三类工作流中,该框架实现 100% 最终协议有效性,并持续提升任务表现。
研究者提出 DroneCATS-Agent 架构与 DroneCATS 基准,将 MLLM 直接放入无人机控制回路,动作空间仅由提示词声明,无需微调或函数调用。评测覆盖接近可见目标、跟踪移动目标、搜索视野外目标及多无人机编队指挥四项能力,模型规模下探至 2B 参数。结果显示小型开源模型常比前沿模型更可靠地进入成功半径,却因过早或未声明到达而失败,多机指挥中还会盲目复制单一坐标。
研究在无预训练视觉先验的原生统一多模态模型中发现,理解与生成在表征层面可互相提供有用信号,但强制走同一计算路径会导致一方主导。任务解耦架构在保留语义交互的同时专门化冲突的视觉计算,可避免这种不对称退化。系统层面,端到端统一多模态模型在同时需要图像理解与生成的复杂任务上优于匹配的规划器-执行器流水线。
StudentSim 是一个将稀疏的单个学生数据转化为个性化模拟器的训练框架,采用先池化训练、再按学生特化的方式,使模拟器既能复现学生自身回答,也能在导师指导下更新。
EM^2Mem 是一个事件中心的多模态记忆框架,在记忆构建阶段将异构证据绑定到事件锚点,使每个事件索引记忆单元对齐多模态记录、时间上下文、图关联关系、语义事实与来源信息。
Hi-Q 是一个证据条件化的分层查询细化框架,通过 resolution 算子判断当前查询单元是否已被检索证据支持,未解决节点再由保持依赖关系的二元算子展开并经语义覆盖验证器检查,从而生成由语料支持信号决定拓扑的查询树。