Model Performance Benchmarks
Comprehensive evaluation across reasoning, coding, knowledge, and more.
Arena Elo Rating
Human preference ranking via LMSys Chatbot Arena
MMLU
Massive Multitask Language Understanding
GPQA Diamond
Graduate-level physics, chemistry & biology reasoning
HumanEval
Code generation from docstrings
Inference Speed
Tokens per second — throughput comparison
Complete Model Rankings
| # | Model | Provider | Arena Elo | MMLU | HumanEval | GPQA | Speed |
|---|