| benchmark | category | # scored |
|---|---|---|
| MMLU | knowledge | 1,152 |
| MATH | math | 1,015 |
| WER | speech-asr | 702 |
| BigBench | reasoning | 576 |
| AGIEval | reasoning | 491 |
| LiveCodeBench | coding | 476 |
| MMLU-Pro | knowledge | 465 |
| GSM8K | math | 439 |
| HumanEval | coding | 429 |
| GPQA | reasoning | 421 |
| BBH | reasoning | 392 |
| HellaSwag | knowledge | 392 |
| Humanity's Last Exam | knowledge | 330 |
| GPQA Diamond | reasoning | 324 |
| MMMU | multimodal | 324 |
| MBPP | coding | 323 |
| IFEval | instruction-following | 318 |
| CER | speech-asr | 317 |
| WER Common Voice | speech-asr | 297 |
| WinoGrande | knowledge | 297 |
| TruthfulQA | safety | 291 |
| AIME 2025 | math | 276 |
| DocVQA | multimodal | 218 |
| TriviaQA | knowledge | 205 |
| PIQA | knowledge | 204 |
| ChartQA | multimodal | 200 |
| AIME 2024 | math | 199 |
| DROP | reasoning | 190 |
| WER FLEURS | speech-asr | 183 |
| BoolQ | knowledge | 178 |
| MT-Bench | chat | 178 |
| Chatbot Arena | chat | 166 |
| MGSM | math | 143 |
| MATH-500 | math | 141 |
| AlpacaEval | chat | 136 |
| WER AMI | speech-asr | 130 |
| Terminal-Bench | agentic-coding | 119 |
| AIME 2026 | math | 112 |
| RULER | long-context | 109 |
| ARC-Challenge | knowledge | 98 |
| MathVista | multimodal | 96 |
| WER VoxPopuli | speech-asr | 96 |
| IFBench | instruction-following | 92 |
| BFCL (function calling) | agentic | 86 |
| MMBench | multimodal | 85 |
| OpenBookQA | knowledge | 81 |
| SimpleQA | knowledge | 80 |
| WER GigaSpeech | speech-asr | 79 |
| BrowseComp | agentic | 78 |
| WER Earnings-22 | speech-asr | 76 |
| WER LibriSpeech | speech-asr | 73 |
| WER TED-LIUM | speech-asr | 70 |
| C-Eval | knowledge | 65 |
| WildBench | chat | 64 |
| PopQA | knowledge | 63 |
| SWE-bench Verified | swe | 61 |
| RTF | speech-asr | 51 |
| WER SPGISpeech | speech-asr | 51 |
| SciCode | coding | 47 |
| CMMLU | knowledge | 45 |
| MedQA | domain | 40 |
| tau-bench | agentic | 40 |
| CommonsenseQA | knowledge | 39 |
| WER MLS | speech-asr | 37 |
| QuALITY | knowledge | 34 |
| TydiQA | knowledge | 33 |
| MUSR | reasoning | 29 |
| Speaker SIM | speech-tts | 29 |
| Codex-Eval | coding | 27 |
| LongBench | long-context | 25 |
| Terminal-Bench 2.0 | agentic-coding | 25 |
| MOS | speech-tts | 23 |
| miniF2F | math | 19 |
| BigCodeBench | coding | 17 |
| DeepSWE | swe | 17 |
| OSWorld | agentic | 17 |
| Terminal-Bench 2.1 | agentic-coding | 17 |
| Math Olympiad | math | 16 |
| GAOKAO | knowledge | 14 |
| UTMOS | speech-tts | 13 |
| OmniMath | math | 12 |
| EvalPlus | coding | 9 |
| CodeContests | coding | 8 |
| GPQA-Main | reasoning | 6 |
| WER Switchboard | speech-asr | 6 |
| ARC-AGI | reasoning | 5 |
| Codeforces | coding | 5 |
| FrontierSWE | swe | 5 |
| MMAU | agentic | 5 |
| WebArena | agentic | 4 |
| CRUX | coding | 3 |
| Seamless | speech | 3 |
| DNSMOS | speech-tts | 2 |
| TTS-WER | speech-tts | 2 |
| LegalBench | domain | 1 |
| MuSiQue | reasoning | 1 |
| ToolBench | agentic | 1 |
| org | kind | variants | roots |
|---|---|---|---|
| mradermacher | quantizer | 1,671 | 0 |
| publisher | 1,626 | 1,589 | |
| bartowski | quantizer | 1,600 | 0 |
| TheBloke | quantizer | 1,396 | 0 |
| unsloth | quantizer | 1,077 | 12 |
| nvidia | publisher | 670 | 585 |
| lmstudio-community | quantizer | 658 | 0 |
| publisher | 534 | 512 | |
| Qwen | publisher | 454 | 240 |
| microsoft | publisher | 440 | 429 |
| Mungert | quantizer | 440 | 0 |
| mlx-community | discovered | 395 | 2 |
| allenai | publisher | 342 | 334 |
| alphaedge-ai | discovered | 252 | 0 |
| OpenVoiceOS | discovered | 204 | 0 |
| cstr | discovered | 169 | 0 |
| ggml-org | quantizer | 151 | 1 |
| inclusionAI | publisher | 150 | 122 |
| zai-org | publisher | 122 | 103 |
| tiiuae | publisher | 112 | 69 |
| multilingual-tts | discovered | 111 | 0 |
| jinaai | publisher | 105 | 57 |
| deepseek-ai | publisher | 101 | 94 |
| internlm | publisher | 100 | 80 |
| mlabonne | quantizer | 94 | 45 |
| onnx-community | discovered | 90 | 2 |
| aufklarer | discovered | 86 | 0 |
| xl-24 | discovered | 85 | 0 |
| ryanontheinside | discovered | 80 | 0 |
| mistralai | publisher | 74 | 63 |
| meta-llama | publisher | 70 | 74 |
| handy-computer | discovered | 68 | 0 |
| alibaba-pai | publisher | 59 | 58 |
| majentik | discovered | 57 | 0 |
| waxal-benchmarking | discovered | 57 | 0 |
| ArliAI | quantizer | 56 | 23 |
| m-a-p | publisher | 52 | 52 |
| michael-chan-000 | discovered | 52 | 0 |
| aoiandroid | discovered | 50 | 0 |
| speechbrain | discovered | 49 | 0 |
Full benchmarks × models matrix · All 24,078 model variants · All 5,876 orgs