Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models

Benchmark Model Rank Results
on-cybenchClaude 3.5 Sonnet#1Unguided Performance: 17.5%