Benchmarks

Model performance scores across popular evaluation benchmarks.

GPT-5

90.2
Fuente: -

Claude Opus 4

90.1
Fuente: -

DeepSeek R1

89.1
Fuente: -

Gemini 2.5 Pro

89
Fuente: -

GPT-4o

83.1
Fuente: -