Latest news

Announcements, benchmark releases, and the work behind both.

Research & Engineering9 min read

FrontierSWE

Our ultra-long-horizon coding benchmark. 
Frontier models clear only a fraction of its tasks.

Read more →
Leaderboard
#ModelHarnessAvg Rank¹Dominance²ImplementationPerformanceResearch
1
Claude Fable 5Claude Code
Claude Code2.88
88%
2.002.007.00
2
GLM-5.3Claude Code
Claude Code4.50
78%
4.005.831.33
3
Grok 4.6Grok CLI
Grok CLI4.53
78%
3.305.394.00
4
Grok 4.5Grok CLI
Grok CLI5.47
72%
6.205.673.67
5
GLM-5.2Claude Code
Claude Code6.21
67%
6.307.003.67
6
Claude Opus 4.8Claude Code
Claude Code6.35
67%
5.406.567.33
7
GPT-5.5Codex
Codex6.68
65%
8.805.117.83
8
Claude Opus 4.7Claude Code
Claude Code8.00
56%
7.208.338.33
9
Claude Opus 4.6Claude Code
Claude Code9.18
49%
9.209.119.33
10
GPT-5.4Codex
Codex9.65
46%
8.7011.067.00
11
Gemini 3.1 ProGemini CLI
Gemini CLI11.50
34%
13.809.0615.00
12
Composer 2.5Cursor CLI
Cursor CLI11.59
34%
10.2013.398.50
13
GLM-5.1Claude Code
Claude Code12.88
26%
12.9012.9412.67
14
DeepSeek V4 ProClaude Code
Claude Code13.06
25%
13.0013.1113.00
15
Kimi K2.5Kimi CLI
Kimi CLI13.26
23%
14.5011.7815.67
16
Kimi K2.6Kimi CLI
Kimi CLI13.44
22%
11.7014.4413.33
17
Qwen3.6-PlusQwen Code
Qwen Code13.82
20%
15.8012.2215.33
¹Rank: avg position across tasks (lower = better)²Dominance: win rate vs random opponent on task