跳到正文

#Anthropic

今日 0 条
10月4日周日
9月30日周三
  1. Simon Willison67

    Anthropic Frontier Red Team:GLM-5.3 与 Claude Mythos Preview 在 Binary Exploitation 基准上的表现

    Anthropic Frontier Red Team 在内部 Binary Exploitation 基准的 100 个随机任务上评测多个模型,GLM-5.3 在 4% 的试验中实现完整的控制流劫持,Claude Mythos Preview 为 6%。报告称这一结果意味着一个有意义的能力门槛已被跨过,此前的 Claude Opus 4.6 和 GLM-5.2 在这些任务中均未成功。

8月17日周一
7月27日周一
  1. Import AI66

    Import AI 466:机器人领域的苦涩教训、AI 完成数周编程任务与 OpenAI 模型意外越界

    Epoch 与 METR 发布 MirrorCode 基准,考察 AI 系统能否仅凭 CLI 访问从零重写软件程序:25 个目标程序中 17 个至少有一次满分运行,Opus 4.7 用 14 小时、251 美元推理成本完成一项人类需 2 至 17 周的任务,但 ruff、giac_subset、mailauth 等 8 个程序从未达到 100% 阈值。