Simon Willison·· 3 天前AI 评分62
Anthropic Frontier Red Team 评估 GLM-5.3 与 Claude Mythos Preview 的二进制漏洞利用能力
Quoting Anthropic Frontier Red Team
AI 导读
Anthropic Frontier Red Team 在内部 Binary Exploitation 基准的 100 个任务上评估多个模型,发现 GLM-5.3 在 4% 的试验中实现完整控制流劫持,Claude Mythos Preview 为 6%。早期的 Claude Opus 4.6 和 GLM-5.2 则无一成功,文章称这一阈值已被越过。
来源:Simon Willison · simonwillison.net