Coding-Benchmarks
Komposit-Index aus Coding-Benchmarks, u. a. LiveCodeBench und SciCode
| # | Modell | Anbieter | AA Coding Index |
|---|---|---|---|
| 1 | GPT-5.6 Solxhigh | OpenAI | 78.30 |
| 2 | Claude Opus 5Adaptive Reasoning, Max Effort | Anthropic | 78.00 |
| 3 | GPT-5.6 Solmax | OpenAI | 77.40 |
| 4 | GPT-5.6 Solhigh | OpenAI | 77.20 |
| 5 | Claude Opus 5Adaptive Reasoning, Xhigh Effort | Anthropic | 77.00 |
| 6 | Grok 4.6high | SpaceXAI | 76.80 |
| 7 | GPT-5.6 Terramax | OpenAI | 76.70 |
| 8 | Claude Fable 5Adaptive Reasoning, Max Effort, Opus 4.8 Fallback | Anthropic | 76.50 |
| 9 | Claude Opus 5Adaptive Reasoning, High Effort | Anthropic | 76.50 |
| 10 | GPT-5.6 Solmedium | OpenAI | 76.30 |
| 10 | Kimi K3 | Kimi | 76.20 |
| 11 | Kimi K3max | Kimi | 76.20 |
| 12 | Gemini 3.7 Flashhigh | 76.10 | |
| 13 | GPT-5.5xhigh | OpenAI | 74.90 |
| 15 | Claude Opus 4.8Adaptive Reasoning, Max Effort | Anthropic | 74.30 |
| 14 | Claude Opus 5Adaptive Reasoning, Medium Effort | Anthropic | 74.30 |
| 16 | Claude Opus 4.7Adaptive Reasoning, Max Effort | Anthropic | 73.60 |
| 17 | Grok 4.5high | SpaceXAI | 72.40 |
| 18 | Muse Spark 1.2xhigh | Meta | 72.20 |
| 19 | Kimi K3low | Kimi | 72.00 |
| 20 | Qwen3.8 2.4T A95B | Alibaba | 71.90 |
| 21 | Qwen3.8 Max | Alibaba | 71.80 |
| 22 | GPT-5.5high | OpenAI | 71.60 |
| 23 | Gemini 3.7 Flashmedium | 71.50 | |
| 24 | Claude Sonnet 5Adaptive Reasoning, Max Effort | Anthropic | 71.50 |
Zeigt die Top 25 von 509 getesteten Modellen. Die vollständige Liste steht bei der Originalquelle.