KaliBench:面向 Kali Linux 网络安全工具调用的细粒度基准,支持免运行时可验证奖励
KaliBench 是一个面向 Kali Linux 上自然语言到 CLI 命令转换的细粒度基准与数据集,包含 8,504 对查询-命令,覆盖 1,642 个工具、23 个能力维度和 5 个安全阶段。
KaliBench 是一个面向 Kali Linux 上自然语言到 CLI 命令转换的细粒度基准与数据集,包含 8,504 对查询-命令,覆盖 1,642 个工具、23 个能力维度和 5 个安全阶段。
OmniSeek 是一个将 Omni-LLM 转变为具备原生工具调用能力的多轮推理智能体的框架,能动态决定看或听以及对应的时间窗口,将检索到的音视频片段回填上下文以支持后续推理。
EgoTools 发布,成为首个面向第一视角工具使用理解的综合套件,包含 100 小时带同步音频、密集标注与 3D 信息的 EgoTools-Data 语料库,以及覆盖感知、几何、流程与因果推理四条轨道的 1,000 对 QA 基准 EgoTools-Bench。
Hugging Face 发布 ProvenanceGuard,一个面向 MCP 智能体的生成后验证层,专门检测"跨来源混淆"——即事实真实但被归因到错误来源的问题。在 281 条医疗智能体真实 trace 上,专家判定应拦截的 139 条声明中它拦下 138 条,来源识别准确率约 86%,并在四项对比检查器中取得最高分。
CorrGRPO 提出将 GRPO 中成对奖励协方差归一化为皮尔逊相关系数,在不改变中心化总奖励的前提下,平衡不同尺度奖励对归一化的影响,避免大尺度奖励主导优势值计算。研究者在代码生成、工具调用和智能体安全三类任务上,使用 0.5B 至 8B 参数的模型进行对比,结果显示 CorrGRPO 在三项任务上均优于 GRPO 及其他变体。代码已开源。
Google Research 提出 ToolGrad,一种“答案优先”的工具调用数据集生成范式:先生成真实工具调用链,再反向标注用户提示词,只需一步 LLM 调用。