跳到正文
原文
Simon Willison · AI Weblog·· 3 天前AI 评分67

Anthropic 红队评测:GLM-5.3 与 Claude Mythos Preview 的二进制漏洞利用能力

Quoting Anthropic Frontier Red Team

AI 导读

Anthropic Frontier Red Team 在内部 Binary Exploitation benchmark 的 100 个随机任务上评测多款模型,考察其自主完成控制流劫持的能力。

来源:Simon Willison · AI Weblog · simonwillison.net