terminal bench Benchmark: Scores and Sources
Published result; benchmark version and evaluation conditions remain in the id and result note.
| Row | Model | Result | Normalized (0–100) | Confidence |
|---|---|---|---|---|
| 1 | Fugu Ultra sakana | 82.1%Official model cards via models.devLab-reported; metric percent score; transcribed by MIT models.dev catalog; not independently evaluated [variant]
Retrieved Oct 9, 2026 · factual citation; MIT transcription Open source ↗ | 82.1 | 100% confidence 100 percent, Full |
| 2 | Fugu sakana | 80.2%Official model cards via models.devLab-reported; metric percent score; transcribed by MIT models.dev catalog; not independently evaluated [variant]
Retrieved Oct 9, 2026 · factual citation; MIT transcription Open source ↗ | 80.2 | 100% confidence 100 percent, Full |
| 3 | Ornith 1.0 397B deepreinforce | 78.2%Official model cards via models.devLab-reported; metric percent; transcribed by MIT models.dev catalog; not independently evaluated [variant] Claude Code
Retrieved Oct 9, 2026 · factual citation; MIT transcription Open source ↗ | 78.2 | 100% confidence 100 percent, Full |
| 4 | Ornith 1.0 397B deepreinforce | 77.5%Official model cards via models.devLab-reported; metric percent; transcribed by MIT models.dev catalog; not independently evaluated [variant] Terminus-2
Retrieved Oct 9, 2026 · factual citation; MIT transcription Open source ↗ | 77.5 | 100% confidence 100 percent, Full |
| 5 | Ornith 1.0 35B deepreinforce | 64.2%Official model cards via models.devLab-reported; metric percent; transcribed by MIT models.dev catalog; not independently evaluated [variant] Terminus-2
Retrieved Oct 9, 2026 · factual citation; MIT transcription Open source ↗ | 64.2 | 100% confidence 100 percent, Full |
| 6 | Ornith 1.0 35B deepreinforce | 62.8%Official model cards via models.devLab-reported; metric percent; transcribed by MIT models.dev catalog; not independently evaluated [variant] Claude Code
Retrieved Oct 9, 2026 · factual citation; MIT transcription Open source ↗ | 62.8 | 100% confidence 100 percent, Full |
| 7 | Ornith 1.0 9B deepreinforce | 43.1%Official model cards via models.devLab-reported; metric percent; transcribed by MIT models.dev catalog; not independently evaluated [variant] Terminus-2
Retrieved Oct 9, 2026 · factual citation; MIT transcription Open source ↗ | 43.1 | 100% confidence 100 percent, Full |
| 8 | Ornith 1.0 9B deepreinforce | 40.6%Official model cards via models.devLab-reported; metric percent; transcribed by MIT models.dev catalog; not independently evaluated [variant] Claude Code
Retrieved Oct 9, 2026 · factual citation; MIT transcription Open source ↗ | 40.6 | 100% confidence 100 percent, Full |
| 9 | GPT-5-Codex OpenAI | 37.9%Official model cards via models.devLab-reported; metric success rate; transcribed by MIT models.dev catalog; not independently evaluated [variant] Published Jun 1, 2026
Retrieved Oct 9, 2026 · factual citation; MIT transcription Open source ↗ | 37.9 | 6% confidence 6 percent, Low |
| 10 | Step 3.7 Flash stepfun | 35.6%Official model cards via models.devLab-reported; metric success rate; transcribed by MIT models.dev catalog; not independently evaluated [variant] Published Jun 15, 2026
Retrieved Oct 9, 2026 · factual citation; MIT transcription Open source ↗ | 35.6 | 13% confidence 13 percent, Low |
| 11 | GLM-4.7 Z.ai | 33.4%Official model cards via models.devLab-reported; metric score; transcribed by MIT models.dev catalog; not independently evaluated [variant]
Retrieved Oct 9, 2026 · factual citation; MIT transcription Open source ↗ | 33.4 | 69% confidence 69 percent, Medium |
| 12 | Step 3.5 Flash 2603 stepfun | 32.6%Official model cards via models.devLab-reported; metric success rate; transcribed by MIT models.dev catalog; not independently evaluated [variant] Published Jun 2, 2026
Retrieved Oct 9, 2026 · factual citation; MIT transcription Open source ↗ | 32.6 | 13% confidence 13 percent, Low |
| 13 | Step 3.5 Flash stepfun | 27.3%Official model cards via models.devLab-reported; metric success rate; transcribed by MIT models.dev catalog; not independently evaluated [variant] Published Jun 2, 2026
Retrieved Oct 9, 2026 · factual citation; MIT transcription Open source ↗ | 27.3 | 88% confidence 88 percent, High |
| 14 | Gemini 2.5 Pro Google | 26.5%Official model cards via models.devLab-reported; metric success rate; transcribed by MIT models.dev catalog; not independently evaluated [variant] Published Jun 2, 2026
Retrieved Oct 9, 2026 · factual citation; MIT transcription Open source ↗ | 26.5 | 90% confidence 90 percent, High |
| 15 | GLM-4.6 Z.ai | 25%Official model cards via models.devLab-reported; metric success rate; transcribed by MIT models.dev catalog; not independently evaluated [variant] Published May 22, 2026
Retrieved Oct 9, 2026 · factual citation; MIT transcription Open source ↗ | 25.0 | 55% confidence 55 percent, Medium |
| 16 | GLM-4.5 Z.ai | 22%Official model cards via models.devLab-reported; metric success rate; transcribed by MIT models.dev catalog; not independently evaluated [variant] Published Mar 11, 2026
Retrieved Oct 9, 2026 · factual citation; MIT transcription Open source ↗ | 22.0 | 47% confidence 47 percent, Low |
| 17 | Qwen3 Max Alibaba / Qwen | 20.5%Official model cards via models.devLab-reported; metric success rate; transcribed by MIT models.dev catalog; not independently evaluated [variant] Published May 30, 2026
Retrieved Oct 9, 2026 · factual citation; MIT transcription Open source ↗ | 20.5 | 69% confidence 69 percent, Medium |
| 18 | GLM-4.5-Air Z.ai | 20.5%Official model cards via models.devLab-reported; metric success rate; transcribed by MIT models.dev catalog; not independently evaluated [variant] Published May 30, 2026
Retrieved Oct 9, 2026 · factual citation; MIT transcription Open source ↗ | 20.5 | 37% confidence 37 percent, Low |
| 19 | Devstral 2 mistral | 18.9%Official model cards via models.devLab-reported; metric success rate; transcribed by MIT models.dev catalog; not independently evaluated [variant] Published May 31, 2026
Retrieved Oct 9, 2026 · factual citation; MIT transcription Open source ↗ | 18.9 | 19% confidence 19 percent, Low |
| 20 | Mistral Small 4 mistral | 17.4%Official model cards via models.devLab-reported; metric success rate; transcribed by MIT models.dev catalog; not independently evaluated [variant] Published Jun 1, 2026
Retrieved Oct 9, 2026 · factual citation; MIT transcription Open source ↗ | 17.4 | 6% confidence 6 percent, Low |
| 21 | Mistral Large 3 mistral | 15.9%Official model cards via models.devLab-reported; metric success rate; transcribed by MIT models.dev catalog; not independently evaluated [variant] Published Jun 4, 2026
Retrieved Oct 9, 2026 · factual citation; MIT transcription Open source ↗ | 15.9 | 37% confidence 37 percent, Low |
| 22 | Qwen3-Coder 30B-A3B Instruct Alibaba / Qwen | 15.2%Official model cards via models.devLab-reported; metric success rate; transcribed by MIT models.dev catalog; not independently evaluated [variant] Published Jun 2, 2026
Retrieved Oct 9, 2026 · factual citation; MIT transcription Open source ↗ | 15.2 | 19% confidence 19 percent, Low |
| 23 | Gemini 2.5 Flash Google | 13.6%Official model cards via models.devLab-reported; metric success rate; transcribed by MIT models.dev catalog; not independently evaluated [variant] Published Jun 2, 2026
Retrieved Oct 9, 2026 · factual citation; MIT transcription Open source ↗ | 13.6 | 47% confidence 47 percent, Low |
| 24 | GPT-4o (2024-08-06) OpenAI | 8.3%Official model cards via models.devLab-reported; metric success rate; transcribed by MIT models.dev catalog; not independently evaluated [variant] Published Mar 11, 2026
Retrieved Oct 9, 2026 · factual citation; MIT transcription Open source ↗ | 8.3 | 100% confidence 100 percent, Full |
| 25 | GPT-4o (2024-11-20) OpenAI | 8.3%Official model cards via models.devLab-reported; metric success rate; transcribed by MIT models.dev catalog; not independently evaluated [variant] Published Mar 11, 2026
Retrieved Oct 9, 2026 · factual citation; MIT transcription Open source ↗ | 8.3 | 61% confidence 61 percent, Medium |
| 26 | DeepSeek-R1 DeepSeek | 6.1%Official model cards via models.devLab-reported; metric success rate; transcribed by MIT models.dev catalog; not independently evaluated [variant] Published Mar 11, 2026
Retrieved Oct 9, 2026 · factual citation; MIT transcription Open source ↗ | 6.1 | 88% confidence 88 percent, High |
| 27 | Mistral Large 2.1 mistral | 6.1%Official model cards via models.devLab-reported; metric success rate; transcribed by MIT models.dev catalog; not independently evaluated [variant] Published Mar 11, 2026
Retrieved Oct 9, 2026 · factual citation; MIT transcription Open source ↗ | 6.1 | 100% confidence 100 percent, Full |
| 28 | GLM-4.5V Z.ai | 5.3%Official model cards via models.devLab-reported; metric success rate; transcribed by MIT models.dev catalog; not independently evaluated [variant] Published Apr 29, 2026
Retrieved Oct 9, 2026 · factual citation; MIT transcription Open source ↗ | 5.3 | 37% confidence 37 percent, Low |
| 29 | Gemini 2.5 Flash-Lite Google | 4.5%Official model cards via models.devLab-reported; metric success rate; transcribed by MIT models.dev catalog; not independently evaluated [variant] Published Mar 11, 2026
Retrieved Oct 9, 2026 · factual citation; MIT transcription Open source ↗ | 4.5 | 6% confidence 6 percent, Low |
| 30 | Mistral Medium 3 mistral | 3.8%Official model cards via models.devLab-reported; metric success rate; transcribed by MIT models.dev catalog; not independently evaluated [variant] Published May 30, 2026
Retrieved Oct 9, 2026 · factual citation; MIT transcription Open source ↗ | 3.8 | 85% confidence 85 percent, High |
| 31 | Llama-3.3-70B-Instruct Meta | 3%Official model cards via models.devLab-reported; metric success rate; transcribed by MIT models.dev catalog; not independently evaluated [variant] Published Mar 11, 2026
Retrieved Oct 9, 2026 · factual citation; MIT transcription Open source ↗ | 3.0 | 100% confidence 100 percent, Full |
Results are as published by the source behind each value (hover or tap the number). Benchmark scores are shown individually for every source/variant (a model may have multiple rows), and vary by version, harness and date; the normalized column uses the method’s fixed 0–100 scales and feeds the coding pillar of the SI Score.