Benchmarks
Model performance scores across popular evaluation benchmarks.
GPT-5
90.2
Source: -
Claude Opus 4
90.1
Source: -
DeepSeek R1
89.1
Source: -
Gemini 2.5 Pro
89
Source: -
GPT-4o
83.1
Source: -
Model performance scores across popular evaluation benchmarks.