IssueTrojanBench:评测 AI 编程智能体面对恶意 Issue 请求的表现
IssueTrojanBench: Benchmarking AI Coding Agents Against Malicious Issue Requests
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
IssueTrojanBench 是一个用于评测 AI 编程智能体在恶意 Issue 请求下表现的基准。该基准聚焦于智能体处理被植入恶意意图的 Issue 时是否会执行有害操作,目前相关讨论已在 Hacker News 上线。
来源:arxiv.org(经 Hacker News) · arxiv.org