ChatOSS
Sign in
← All benchmarks

Compare the top 40
SWE-Bench Verified AI models

Compare the top 40 AI models ranked by SWE-Bench Verified, alongside Terminal-Bench 2.1 results, API pricing, evaluation harnesses, and model comparisons.

Top 40 AI Models

SWE-Bench Verified Rankings

Compare the top 40 AI models by SWE-Bench Verified score, with Terminal-Bench 2.1 results, API pricing, evaluation harnesses, and model comparisons.

Click a column to sort. Click again to reverse the order.

40 models
Top 40 AI coding models ranked by SWE-Bench Verified, with Terminal-Bench results, pricing, evaluation harnesses, and model comparisons.
1

Claude Opus 5

Anthropic

Benchmark source: Vals AI · Checked Sep 11, 2026

Harness: Terminus 2
97%84.64%$5$0.5$25

Claude Opus 5

SWE 97%

GPT-5.6 Sol

SWE 96.2%

2

DeepSeek V4 Pro 0813

DeepSeek

Benchmark source: Vals AI · Checked Sep 11, 2026

Harness: Terminus 2
96.4%54.68%$1.32$0.132$3.96

Claude Opus 5

SWE 97%

GPT-5.6 Sol

SWE 96.2%

3

GPT-5.6 Sol

OpenAI

Benchmark source: Vals AI · Checked Sep 11, 2026

Harness: Terminus 2
96.2%85.77%$2$0.2$10

Claude Opus 5

SWE 97%

GPT-5.6 Sol

SWE 96.2%

4

Grok 4.6

xAI

Benchmark source: Vals AI · Checked Sep 11, 2026

Harness: Terminus 2
95.6%78.28%$2$0.5$6

Claude Fable 5

SWE 95%

GPT-5.6 Terra

SWE 95.4%

5

GPT-5.6 Terra

OpenAI

Benchmark source: Vals AI · Checked Sep 11, 2026

Harness: Terminus 2
95.4%77.53%$2$0.2$12

Claude Fable 5

SWE 95%

GPT-5.6 Terra

SWE 95.4%

6

GLM 5.3

Zhipu AI

Benchmark source: Vals AI · Checked Sep 11, 2026

Harness: Terminus 2
95.4%71.54%$1.4$0.26$4.4

Claude Fable 5

SWE 95%

GPT-5.6 Terra

SWE 95.4%

7

Claude Fable 5

Anthropic

Benchmark source: Vals AI · Checked Sep 11, 2026

Harness: Terminus 2
95%80.52%$10$1$50

Claude Fable 5

SWE 95%

GPT-5.6 Terra

SWE 95.4%

8

Kimi K3

Moonshot AI

Benchmark source: Vals AI · Checked Sep 11, 2026

Harness: Terminus 2
93.4%80.9%$2.55$0.256$12.75

Claude Fable 5

SWE 95%

GPT-5.6 Luna

SWE 93%

9

GPT-5.6 Luna

OpenAI

Benchmark source: Vals AI · Checked Sep 11, 2026

Harness: Terminus 2
93%79.03%$0.2$0.02$1.2

Claude Fable 5

SWE 95%

GPT-5.6 Luna

SWE 93%

10

GLM 5.3 Flash

Zhipu AI

Benchmark source: Vals AI · Checked Sep 11, 2026

Harness: Claude Code
92%84.3%$0.15$0.03$0.5

Claude Fable 5

SWE 95%

GPT-5.6 Terra

SWE 95.4%

11

DeepSeek V4 Flash 0731

DeepSeek

Benchmark source: Vals AI · Checked Sep 11, 2026

Harness: Terminus 2
88.8%67.04%$0.05$0.16

Claude Opus 4.8

SWE 88.6%

GPT-5.6 Luna

SWE 93%

12

Claude Opus 4.8

Anthropic

Benchmark source: Vals AI · Checked Sep 11, 2026

Harness: Terminus 2
88.6%71.91%$5$0.5$25

Claude Opus 4.8

SWE 88.6%

GPT-5.6 Luna

SWE 93%

13

Grok 4.5

xAI

Benchmark source: Vals AI · Checked Sep 11, 2026

Harness: Terminus 2
86.6%67.79%$2$0.3$6

Claude Opus 4.8

SWE 85.8%

GPT-5.5

SWE 82.6%

14

Muse Spark 1.2

Meta

Benchmark source: Vals AI · Checked Sep 11, 2026

Harness: Terminus 2
86.6%69.66%$1.25$0.15$4.25

Claude Opus 4.8

SWE 85.8%

GPT-5.5

SWE 82.6%

15

Qwen3.8 27B

Alibaba

Benchmark source: Vals AI · Checked Sep 11, 2026

Harness: Terminus 2
86%58.43%$0.15$2

Claude Opus 4.8

SWE 85.8%

GPT-5.5

SWE 82.6%

16

Claude Opus 4.8

Anthropic

Benchmark source: Vals AI · Checked Sep 11, 2026

Harness: Claude Code
85.8%69.66%$5$0.5$25

Claude Opus 4.8

SWE 85.8%

GPT-5.5

SWE 82.6%

17

Qwen3.8 Max

Alibaba

Benchmark source: Vals AI · Checked Sep 11, 2026

Harness: Terminus 2
85.6%67.42%$2$0.25$6

Claude Opus 4.8

SWE 85.8%

GPT-5.5

SWE 82.6%

18

GLM 5.2

Zhipu AI

Benchmark source: Vals AI · Checked Sep 11, 2026

Harness: Terminus 2
82.8%67.79%$0.5$0.115$3.15

Claude Opus 4.7

SWE 82%

GPT-5.5

SWE 82.6%

19

GPT-5.5

OpenAI

Benchmark source: Vals AI · Checked Sep 11, 2026

Harness: Terminus 2
82.6%76.4%$5$0.5$30

Claude Opus 4.7

SWE 82%

GPT-5.5

SWE 82.6%

20

Inkling Small

Thinking Machines

Benchmark source: Vals AI · Checked Sep 11, 2026

Harness: Terminus 2
82.2%55.06%$0.45$0.1$1.2

Claude Opus 4.7

SWE 82%

GPT-5.5

SWE 82.6%

21

Muse Spark 1.1

Meta

Benchmark source: Vals AI · Checked Sep 11, 2026

Harness: Terminus 2
82%69.29%$1.25$0.15$4.25

Claude Opus 4.7

SWE 82%

GPT-5.5

SWE 82.6%

22

Claude Opus 4.7

Anthropic

Benchmark source: Vals AI · Checked Sep 11, 2026

Harness: Terminus 2
82%68.54%$5$0.5$25

Claude Opus 4.7

SWE 82%

GPT-5.5

SWE 82.6%

23

Gemini 3.7 Flash

Google

Benchmark source: Vals AI · Checked Sep 11, 2026

Harness: Terminus 2
80.8%77.53%$0.375$0.0375$1.875

Claude Opus 4.7

SWE 82%

GPT-5.5

SWE 82.6%

24

Gemini 3.8 Flash

Google

Benchmark source: Vals AI · Checked Sep 11, 2026

Harness: Terminus 2
80%90.8%$0.75$0.075$3.75

Claude Sonnet 5

SWE 79.6%

GPT-5.4

SWE 78.2%

25

Composer 2.5

Cursor

Benchmark source: Vals AI · Checked Sep 11, 2026

Harness: Cursor CLI
79.6%58.43%$0.5$0.2$2.5

Claude Sonnet 5

SWE 79.6%

GPT-5.4

SWE 78.2%

26

Gemini 3.6 Flash

Google

Benchmark source: Vals AI · Checked Sep 11, 2026

Harness: Terminus 2
79.6%73.78%$0.75$0.075$3.75

Claude Sonnet 5

SWE 79.6%

GPT-5.4

SWE 78.2%

27

Claude Sonnet 5

Anthropic

Benchmark source: Vals AI · Checked Sep 11, 2026

Harness: Terminus 2
79.6%74.53%$2$0.2$10

Claude Sonnet 5

SWE 79.6%

GPT-5.4

SWE 78.2%

28

Gemini 3.5 Flash

Google

Benchmark source: Vals AI · Checked Sep 11, 2026

Harness: Terminus 2
78.8%74.16%$1.5$0.15$9

Claude Opus 4.6 Thinking

SWE 78.2%

GPT-5.4

SWE 78.2%

29

Gemini 3.1 Pro Preview

Google

Benchmark source: Vals AI · Checked Sep 11, 2026

Harness: Terminus 2
78.8%70.79%$2$0.2$12

Claude Opus 4.6 Thinking

SWE 78.2%

GPT-5.4

SWE 78.2%

30

GPT-5.4

OpenAI

Benchmark source: Vals AI · Checked Sep 11, 2026

Harness: Terminus 2
78.2%54.8%$2.5$0.25$15

Claude Opus 4.6 Thinking

SWE 78.2%

GPT-5.4

SWE 78.2%

31

Claude Opus 4.6 Thinking

Anthropic

Benchmark source: Vals AI · Checked Sep 11, 2026

Harness: Terminus 2
78.2%63.8%$5$0.5$25

Claude Opus 4.6 Thinking

SWE 78.2%

GPT-5.4

SWE 78.2%

32

Kimi K2.7 Code

Moonshot AI

Benchmark source: Vals AI · Checked Sep 11, 2026

Harness: Terminus 2
78.2%67.04%$0.68$3.4

Claude Opus 4.6 Thinking

SWE 78.2%

GPT-5.4

SWE 78.2%

33

GPT-5.3 Codex

OpenAI

Benchmark source: Vals AI · Checked Sep 11, 2026

Harness: Terminus 2
78%57.3%$1.75$0.175$14

Claude Opus 4.6 Thinking

SWE 78.2%

GPT-5.3 Codex

SWE 78%

34

Inkling

Thinking Machines

Benchmark source: Vals AI · Checked Sep 11, 2026

Harness: Terminus 2
77.6%47.57%$0.95$0.16$4.05

Claude Sonnet 4.6

SWE 77.4%

GPT-5.3 Codex

SWE 78%

35

Claude Sonnet 4.6

Anthropic

Benchmark source: Vals AI · Checked Sep 11, 2026

Harness: Terminus 2
77.4%57.3%$3$0.3$15

Claude Sonnet 4.6

SWE 77.4%

GPT-5.3 Codex

SWE 78%

36

DeepSeek V4 Pro

DeepSeek

Benchmark source: Vals AI · Checked Sep 11, 2026

Harness: Terminus 2
77.4%50.19%$0.87$1.74

Claude Sonnet 4.6

SWE 77.4%

GPT-5.3 Codex

SWE 78%

37

GPT-5.5 Codex

OpenAI

Benchmark source: Vals AI · Checked Sep 11, 2026

Harness: Codex
76.4%83.2%$5$0.5$30

Claude Opus 4.5 Thinking

SWE 76.4%

GPT-5.5 Codex

SWE 76.4%

38

Claude Opus 4.5 Thinking

Anthropic

Benchmark source: Vals AI · Checked Sep 11, 2026

Harness: Terminus 2
76.4%N/A$5$0.5$25

Claude Opus 4.5 Thinking

SWE 76.4%

GPT-5.5 Codex

SWE 76.4%

GPT-6 Astra

OpenAI

Benchmark source: Vals AI · Checked Sep 11, 2026

Harness: Codex
N/A87.3%$10$1$50

Claude Opus 5

SWE 97%

GPT-5.6 Sol

SWE 96.2%

Muse Spark 1.3

Meta

Benchmark source: Vals AI · Checked Sep 11, 2026

Harness: Mini-SWE-agent
N/A88.8%$1.25$0.15$4.25

Claude Opus 5

SWE 97%

GPT-5.6 Sol

SWE 96.2%