Reasoning-Benchmarks

Komposit-Index aus Reasoning- und Wissens-Benchmarks, u. a. GPQA, HLE, MMLU-Pro

Stand der Quelle: 13. August 2026 Bei Beirat validiert: 16. August 2026 Quelle: Artificial Analysis Index (höher = besser) Top 25 von 599 Modellen
# Modell Anbieter AA Intelligence Index
1 Claude Opus 5Adaptive Reasoning, Max Effort Anthropic 63.10
2 Claude Opus 5Adaptive Reasoning, Xhigh Effort Anthropic 62.50
3 Claude Fable 5Adaptive Reasoning, Max Effort, Opus 4.8 Fallback Anthropic 62.10
4 Claude Opus 5Adaptive Reasoning, High Effort Anthropic 61.50
6 Grok 4.6high SpaceXAI 60.90
5 GPT-5.6 Solmax OpenAI 60.90
7 Kimi K3max Kimi 59.70
8 GPT-5.6 Solxhigh OpenAI 59.00
9 Claude Opus 5Adaptive Reasoning, Medium Effort Anthropic 58.60
10 Qwen3.8 Max Alibaba 58.10
11 Qwen3.8 2.4T A95B Alibaba 57.70
13 Claude Opus 4.8Adaptive Reasoning, Max Effort Anthropic 57.30
12 GPT-5.6 Solhigh OpenAI 57.30
7 Kimi K3 Kimi 57.10
14 Muse Spark 1.2xhigh Meta 56.80
15 GPT-5.6 Terramax OpenAI 56.60
16 GPT-5.5xhigh OpenAI 56.30
17 Gemini 3.7 Flashhigh Google 56.00
18 Grok 4.5high SpaceXAI 55.80
19 GPT-5.6 Solmedium OpenAI 55.60
20 Claude Sonnet 5Adaptive Reasoning, Max Effort Anthropic 55.30
21 Claude Opus 4.7Adaptive Reasoning, Max Effort Anthropic 55.00
22 GPT-5.5high OpenAI 54.70
23 Gemini 3.7 Flashmedium Google 53.40
25 Muse Spark 1.1xhigh Meta 53.20

Zeigt die Top 25 von 599 getesteten Modellen. Die vollständige Liste steht bei der Originalquelle.