AI Flash Report

GPQA Diamond leaderboard

GPQA Diamond is the hardest tier of the GPQA benchmark — graduate-level science questions designed to be Google-proof.

74 models ranked, highest score first.

GPQA Diamond leaderboard — 74 models ranked by score
# Model Company Score
1 GPT-5.5 OpenAI 93.5%
2 MiniMax-M3 MiniMax 92.9%
3 Claude Fable 5 Anthropic 92.6%
4 Qwen3.7 Max Alibaba 92.3%
5 Claude Opus 4.8 Anthropic 92.0%
6 GPT-5.3 Codex OpenAI 91.5%
7 Claude Opus 4.7 Anthropic 91.4%
8 Kimi K2.6 Kimi 91.1%
9 Grok 4.20 0309 v2 xAI 91.1%
10 GPT-5.2 OpenAI 90.3%
11 Grok 4.3 xAI 90.1%
12 Qwen3.7 Plus Alibaba 90.0%
13 DeepSeek V4 Flash DeepSeek 89.4%
14 DeepSeek V4 Pro DeepSeek 88.8%
15 Qwen3.6 Max Preview Alibaba 88.8%
16 Muse Spark Meta 88.4%
17 Qwen3.6 Plus Alibaba 88.2%
18 GPT-5.1 OpenAI 87.3%
19 GLM-5.1 Z AI 86.8%
20 Hy3-preview Tencent 86.7%
21 MiMo-V2.5-Pro Xiaomi 86.6%
22 Claude Opus 4.5 Anthropic 86.6%
23 Ring-2.6-1T InclusionAI 85.7%
24 Gemma 4 31B Google 85.7%
25 MiMo-V2.5 Xiaomi 84.9%
26 GPT-5.5 Instant OpenAI 84.6%
27 Qwen3.6 27B Alibaba 84.2%
28 Gemini 3.1 Pro Google 84.2%
29 Qwen3.6 35B A3B Alibaba 84.1%
30 DeepSeek V3.2 DeepSeek 84.0%
31 JT-35B-Flash China Mobile 82.9%
32 Gemini 3.5 Flash Google 82.8%
33 Step 3.5 Flash 2603 StepFun 82.6%
34 Step 3.7 Flash StepFun 80.9%
35 GLM 5V Turbo Z AI 80.9%
36 Claude Sonnet 4.6 Anthropic 79.7%
37 EXAONE 4.5 33B LG AI Research 79.4%
38 Gemma 4 26B A4B Google 79.2%
39 Claude Opus 4.1 Anthropic 79.1%
40 Gemini 2.5 Flash Google 79.0%
41 Gemini 3 Pro Google 78.5%
42 North Mini Code Cohere 75.7%
43 Gemma 4 12B Google 75.3%
44 Ling-2.6-1T InclusionAI 75.2%
45 Trinity Large Thinking Arcee AI 75.2%
46 Mistral Medium 3.5 Mistral 74.8%
47 Qwen3.5 Omni Flash Alibaba 74.2%
48 Kimi K2 Moonshot AI 74.1%
49 Claude Sonnet 4 Anthropic 74.0%
50 HyperNova 60B 2605 Multiverse Computing 73.3%
51 Solar Pro 3 Upstage 72.4%
52 Claude Sonnet 3.7 Anthropic 68.3%
53 Mistral Large 3 Mistral 68.0%
54 JT-MINI China Mobile 67.6%
55 GPT-5 OpenAI 67.3%
56 Gemini 2.0 Flash Google 63.6%
57 Ling 2.6 Flash InclusionAI 59.3%
58 Gemma 4 E4B Google 57.6%
59 Claude 3.5 Sonnet Anthropic 56.0%
60 DeepSeek-V3 DeepSeek 55.7%
61 LFM2.5-8B-A1B Liquid AI 51.3%
62 Grok-2 xAI 51.0%
63 Claude 3 Opus Anthropic 48.9%
64 Granite 4.1 30B IBM 48.1%
65 Granite 4.1 8B IBM 43.3%
66 Gemma 4 E2B Google 43.3%
67 Claude 3 Sonnet Anthropic 40.0%
68 Claude 3 Haiku Anthropic 37.4%
69 Gemini 1.5 Pro Google 37.1%
70 Mistral Large Mistral 35.1%
71 Claude 2.1 Anthropic 31.9%
72 Granite 4.1 3B IBM 31.4%
73 MiniCPM-V 4.6 1.3B OpenBMB 30.5%
74 MiniCPM5-1B OpenBMB 27.8%