Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models
Open paper
Benchmark
Model
Rank
Results
on-cybench
Claude 3.5 Sonnet
#1
Unguided Performance: 17.5%
Rank counts only results with a code link.