Compare the top 40
SWE-Bench Verified AI models
Compare the top 40 AI models ranked by SWE-Bench Verified, alongside Terminal-Bench 2.1 results, API pricing, evaluation harnesses, and model comparisons.
Top 40 AI Models
SWE-Bench Verified Rankings
Compare the top 40 AI models by SWE-Bench Verified score, with Terminal-Bench 2.1 results, API pricing, evaluation harnesses, and model comparisons.
Click a column to sort. Click again to reverse the order.
| 1 | Claude Opus 5 Anthropic | Benchmark source: Vals AI · Checked Sep 11, 2026 Harness: Terminus 2 | 97% | 84.64% | $5 | $0.5 | $25 | Claude Opus 5 SWE 97% | GPT-5.6 Sol SWE 96.2% |
| 2 | DeepSeek V4 Pro 0813 DeepSeek | Benchmark source: Vals AI · Checked Sep 11, 2026 Harness: Terminus 2 | 96.4% | 54.68% | $1.32 | $0.132 | $3.96 | Claude Opus 5 SWE 97% | GPT-5.6 Sol SWE 96.2% |
| 3 | GPT-5.6 Sol OpenAI | Benchmark source: Vals AI · Checked Sep 11, 2026 Harness: Terminus 2 | 96.2% | 85.77% | $2 | $0.2 | $10 | Claude Opus 5 SWE 97% | GPT-5.6 Sol SWE 96.2% |
| 4 | Grok 4.6 xAI | Benchmark source: Vals AI · Checked Sep 11, 2026 Harness: Terminus 2 | 95.6% | 78.28% | $2 | $0.5 | $6 | Claude Fable 5 SWE 95% | GPT-5.6 Terra SWE 95.4% |
| 5 | GPT-5.6 Terra OpenAI | Benchmark source: Vals AI · Checked Sep 11, 2026 Harness: Terminus 2 | 95.4% | 77.53% | $2 | $0.2 | $12 | Claude Fable 5 SWE 95% | GPT-5.6 Terra SWE 95.4% |
| 6 | GLM 5.3 Zhipu AI | Benchmark source: Vals AI · Checked Sep 11, 2026 Harness: Terminus 2 | 95.4% | 71.54% | $1.4 | $0.26 | $4.4 | Claude Fable 5 SWE 95% | GPT-5.6 Terra SWE 95.4% |
| 7 | Claude Fable 5 Anthropic | Benchmark source: Vals AI · Checked Sep 11, 2026 Harness: Terminus 2 | 95% | 80.52% | $10 | $1 | $50 | Claude Fable 5 SWE 95% | GPT-5.6 Terra SWE 95.4% |
| 8 | Kimi K3 Moonshot AI | Benchmark source: Vals AI · Checked Sep 11, 2026 Harness: Terminus 2 | 93.4% | 80.9% | $2.55 | $0.256 | $12.75 | Claude Fable 5 SWE 95% | GPT-5.6 Luna SWE 93% |
| 9 | GPT-5.6 Luna OpenAI | Benchmark source: Vals AI · Checked Sep 11, 2026 Harness: Terminus 2 | 93% | 79.03% | $0.2 | $0.02 | $1.2 | Claude Fable 5 SWE 95% | GPT-5.6 Luna SWE 93% |
| 10 | GLM 5.3 Flash Zhipu AI | Benchmark source: Vals AI · Checked Sep 11, 2026 Harness: Claude Code | 92% | 84.3% | $0.15 | $0.03 | $0.5 | Claude Fable 5 SWE 95% | GPT-5.6 Terra SWE 95.4% |
| 11 | DeepSeek V4 Flash 0731 DeepSeek | Benchmark source: Vals AI · Checked Sep 11, 2026 Harness: Terminus 2 | 88.8% | 67.04% | $0.05 | — | $0.16 | Claude Opus 4.8 SWE 88.6% | GPT-5.6 Luna SWE 93% |
| 12 | Claude Opus 4.8 Anthropic | Benchmark source: Vals AI · Checked Sep 11, 2026 Harness: Terminus 2 | 88.6% | 71.91% | $5 | $0.5 | $25 | Claude Opus 4.8 SWE 88.6% | GPT-5.6 Luna SWE 93% |
| 13 | Grok 4.5 xAI | Benchmark source: Vals AI · Checked Sep 11, 2026 Harness: Terminus 2 | 86.6% | 67.79% | $2 | $0.3 | $6 | Claude Opus 4.8 SWE 85.8% | GPT-5.5 SWE 82.6% |
| 14 | Muse Spark 1.2 Meta | Benchmark source: Vals AI · Checked Sep 11, 2026 Harness: Terminus 2 | 86.6% | 69.66% | $1.25 | $0.15 | $4.25 | Claude Opus 4.8 SWE 85.8% | GPT-5.5 SWE 82.6% |
| 15 | Qwen3.8 27B Alibaba | Benchmark source: Vals AI · Checked Sep 11, 2026 Harness: Terminus 2 | 86% | 58.43% | $0.15 | — | $2 | Claude Opus 4.8 SWE 85.8% | GPT-5.5 SWE 82.6% |
| 16 | Claude Opus 4.8 Anthropic | Benchmark source: Vals AI · Checked Sep 11, 2026 Harness: Claude Code | 85.8% | 69.66% | $5 | $0.5 | $25 | Claude Opus 4.8 SWE 85.8% | GPT-5.5 SWE 82.6% |
| 17 | Qwen3.8 Max Alibaba | Benchmark source: Vals AI · Checked Sep 11, 2026 Harness: Terminus 2 | 85.6% | 67.42% | $2 | $0.25 | $6 | Claude Opus 4.8 SWE 85.8% | GPT-5.5 SWE 82.6% |
| 18 | GLM 5.2 Zhipu AI | Benchmark source: Vals AI · Checked Sep 11, 2026 Harness: Terminus 2 | 82.8% | 67.79% | $0.5 | $0.115 | $3.15 | Claude Opus 4.7 SWE 82% | GPT-5.5 SWE 82.6% |
| 19 | GPT-5.5 OpenAI | Benchmark source: Vals AI · Checked Sep 11, 2026 Harness: Terminus 2 | 82.6% | 76.4% | $5 | $0.5 | $30 | Claude Opus 4.7 SWE 82% | GPT-5.5 SWE 82.6% |
| 20 | Inkling Small Thinking Machines | Benchmark source: Vals AI · Checked Sep 11, 2026 Harness: Terminus 2 | 82.2% | 55.06% | $0.45 | $0.1 | $1.2 | Claude Opus 4.7 SWE 82% | GPT-5.5 SWE 82.6% |
| 21 | Muse Spark 1.1 Meta | Benchmark source: Vals AI · Checked Sep 11, 2026 Harness: Terminus 2 | 82% | 69.29% | $1.25 | $0.15 | $4.25 | Claude Opus 4.7 SWE 82% | GPT-5.5 SWE 82.6% |
| 22 | Claude Opus 4.7 Anthropic | Benchmark source: Vals AI · Checked Sep 11, 2026 Harness: Terminus 2 | 82% | 68.54% | $5 | $0.5 | $25 | Claude Opus 4.7 SWE 82% | GPT-5.5 SWE 82.6% |
| 23 | Gemini 3.7 Flash | Benchmark source: Vals AI · Checked Sep 11, 2026 Harness: Terminus 2 | 80.8% | 77.53% | $0.375 | $0.0375 | $1.875 | Claude Opus 4.7 SWE 82% | GPT-5.5 SWE 82.6% |
| 24 | Gemini 3.8 Flash | Benchmark source: Vals AI · Checked Sep 11, 2026 Harness: Terminus 2 | 80% | 90.8% | $0.75 | $0.075 | $3.75 | Claude Sonnet 5 SWE 79.6% | GPT-5.4 SWE 78.2% |
| 25 | Composer 2.5 Cursor | Benchmark source: Vals AI · Checked Sep 11, 2026 Harness: Cursor CLI | 79.6% | 58.43% | $0.5 | $0.2 | $2.5 | Claude Sonnet 5 SWE 79.6% | GPT-5.4 SWE 78.2% |
| 26 | Gemini 3.6 Flash | Benchmark source: Vals AI · Checked Sep 11, 2026 Harness: Terminus 2 | 79.6% | 73.78% | $0.75 | $0.075 | $3.75 | Claude Sonnet 5 SWE 79.6% | GPT-5.4 SWE 78.2% |
| 27 | Claude Sonnet 5 Anthropic | Benchmark source: Vals AI · Checked Sep 11, 2026 Harness: Terminus 2 | 79.6% | 74.53% | $2 | $0.2 | $10 | Claude Sonnet 5 SWE 79.6% | GPT-5.4 SWE 78.2% |
| 28 | Gemini 3.5 Flash | Benchmark source: Vals AI · Checked Sep 11, 2026 Harness: Terminus 2 | 78.8% | 74.16% | $1.5 | $0.15 | $9 | Claude Opus 4.6 Thinking SWE 78.2% | GPT-5.4 SWE 78.2% |
| 29 | Gemini 3.1 Pro Preview | Benchmark source: Vals AI · Checked Sep 11, 2026 Harness: Terminus 2 | 78.8% | 70.79% | $2 | $0.2 | $12 | Claude Opus 4.6 Thinking SWE 78.2% | GPT-5.4 SWE 78.2% |
| 30 | GPT-5.4 OpenAI | Benchmark source: Vals AI · Checked Sep 11, 2026 Harness: Terminus 2 | 78.2% | 54.8% | $2.5 | $0.25 | $15 | Claude Opus 4.6 Thinking SWE 78.2% | GPT-5.4 SWE 78.2% |
| 31 | Claude Opus 4.6 Thinking Anthropic | Benchmark source: Vals AI · Checked Sep 11, 2026 Harness: Terminus 2 | 78.2% | 63.8% | $5 | $0.5 | $25 | Claude Opus 4.6 Thinking SWE 78.2% | GPT-5.4 SWE 78.2% |
| 32 | Kimi K2.7 Code Moonshot AI | Benchmark source: Vals AI · Checked Sep 11, 2026 Harness: Terminus 2 | 78.2% | 67.04% | $0.68 | — | $3.4 | Claude Opus 4.6 Thinking SWE 78.2% | GPT-5.4 SWE 78.2% |
| 33 | GPT-5.3 Codex OpenAI | Benchmark source: Vals AI · Checked Sep 11, 2026 Harness: Terminus 2 | 78% | 57.3% | $1.75 | $0.175 | $14 | Claude Opus 4.6 Thinking SWE 78.2% | GPT-5.3 Codex SWE 78% |
| 34 | Inkling Thinking Machines | Benchmark source: Vals AI · Checked Sep 11, 2026 Harness: Terminus 2 | 77.6% | 47.57% | $0.95 | $0.16 | $4.05 | Claude Sonnet 4.6 SWE 77.4% | GPT-5.3 Codex SWE 78% |
| 35 | Claude Sonnet 4.6 Anthropic | Benchmark source: Vals AI · Checked Sep 11, 2026 Harness: Terminus 2 | 77.4% | 57.3% | $3 | $0.3 | $15 | Claude Sonnet 4.6 SWE 77.4% | GPT-5.3 Codex SWE 78% |
| 36 | DeepSeek V4 Pro DeepSeek | Benchmark source: Vals AI · Checked Sep 11, 2026 Harness: Terminus 2 | 77.4% | 50.19% | $0.87 | — | $1.74 | Claude Sonnet 4.6 SWE 77.4% | GPT-5.3 Codex SWE 78% |
| 37 | GPT-5.5 Codex OpenAI | Benchmark source: Vals AI · Checked Sep 11, 2026 Harness: Codex | 76.4% | 83.2% | $5 | $0.5 | $30 | Claude Opus 4.5 Thinking SWE 76.4% | GPT-5.5 Codex SWE 76.4% |
| 38 | Claude Opus 4.5 Thinking Anthropic | Benchmark source: Vals AI · Checked Sep 11, 2026 Harness: Terminus 2 | 76.4% | N/A | $5 | $0.5 | $25 | Claude Opus 4.5 Thinking SWE 76.4% | GPT-5.5 Codex SWE 76.4% |
| — | GPT-6 Astra OpenAI | Benchmark source: Vals AI · Checked Sep 11, 2026 Harness: Codex | N/A | 87.3% | $10 | $1 | $50 | Claude Opus 5 SWE 97% | GPT-5.6 Sol SWE 96.2% |
| — | Muse Spark 1.3 Meta | Benchmark source: Vals AI · Checked Sep 11, 2026 Harness: Mini-SWE-agent | N/A | 88.8% | $1.25 | $0.15 | $4.25 | Claude Opus 5 SWE 97% | GPT-5.6 Sol SWE 96.2% |