Methodik & Datenquellen

Wir erfinden keine eigenen Bestenlisten. Unsere Rankings bündeln zwei etablierte, öffentlich nachprüfbare Quellen, je eine pro Achse. Hier steht offen, woher jede Zahl stammt, wie sie gemessen wird und was sie aussagt. Jede Quelle ist direkt verlinkt, damit du selbst nachprüfen kannst. Für KI-Agenten setzen wir bewusst kein Benchmark-Ranking ein, sondern einen kuratierten Einsatzzweck-Guide für den DACH-Raum, mehr dazu unten.

Die zwei Quellen

Reasoning

Artificial Analysis: Intelligence Index

Was gemessen wird
Ein Komposit-Index, der mehrere unabhängige Reasoning- und Wissens-Benchmarks zu einem Wert bündelt, darunter GPQA (Naturwissenschaft auf Graduate-Niveau), HLE und MMLU-Pro. Gemessen wird die allgemeine Denk- und Wissensfähigkeit, nicht eine einzelne Aufgabe.
Warum diese Quelle
Eine einzelne Benchmark lässt sich überoptimieren; ein Komposit aus mehreren ist robuster. Artificial Analysis pflegt den Index laufend und deckt praktisch alle aktuellen Modelle ab, anders als die früher genutzte, auf menschlichen Paarvergleichen basierende Vergleichs-Arena, die seit August 2025 keine neuen öffentlichen Tabellen mehr veröffentlicht.
Was der Wert bedeutet
Ein Index-Wert: Höher ist besser. Er ist relativ zum getesteten Feld und kein Prozentsatz einer einzelnen Prüfung.
Zur Originalquelle ↗ Stand der Quelle: 13. August 2026
Coding

Artificial Analysis: Coding Index

Was gemessen wird
Ein Komposit-Index aus mehreren Coding-Benchmarks (u. a. LiveCodeBench und SciCode). Geprüft wird, wie zuverlässig ein Modell lauffähigen, korrekten Code zu realen Programmieraufgaben erzeugt.
Warum diese Quelle
Kein Multiple-Choice, sondern Code, der Tests bestehen muss, über mehrere Benchmarks gemittelt. Aus derselben Quelle wie das Reasoning-Ranking, also konsistent gemessen und gepflegt.
Was der Wert bedeutet
Ein Index-Wert: Höher ist besser. Er bündelt mehrere Coding-Prüfungen zu einer Gesamtnote.
Zur Originalquelle ↗ Stand der Quelle: 13. August 2026

Agenten & Tool-Use: kuratierter Guide statt Benchmark

Für Reasoning und Coding gibt es robuste, laufend gepflegte Benchmark-Quellen. Für KI-Agenten gilt das derzeit nicht: Es existiert kein öffentliches, aktuell gepflegtes Leaderboard, das Agenten-Produkte fair und nach Einsatzzweck vergleicht. Function-Calling-Benchmarks messen einzelne Modell-Fähigkeiten (den „Motor"), nicht den praktischen Nutzen eines fertigen Agenten für eine konkrete Aufgabe (das „Auto").

Deshalb stellen wir an dieser Stelle bewusst kein Agenten-Ranking auf. Stattdessen pflegen wir einen kuratierten Einsatzzweck-Guide für den DACH-Raum: Welcher Agent eignet sich wofür, welches Modell läuft darunter, und welche nachprüfbaren Hosting- und Datenschutz-Eigenschaften hat er? Zum DACH-Agenten-Guide →

Was mit dem alten Agenten-Ranking ist: Bis Juni 2026 zeigten wir hier das Berkeley Function-Calling Leaderboard (BFCL). Wir haben diese Rubrik archiviert, weil ein veraltet wirkendes Function-Calling-Ranking auf einer Vertrauens-Seite mehr verwirrt als hilft. Die Daten und der Ingest bleiben erhalten, sobald BFCL wieder laufend aktuell publiziert, können wir die Rubrik reaktivieren.

Wie wir aktualisieren

Ein automatisierter Prozess holt die Daten jeden Sonntag aus allen zwei Quellen, schreibt sie in unsere Datenbank und stellt die jeweils Top-3 pro Achse auf der Startseite dar. Bei jeder Quelle steht oben der „Stand der Quelle", das echte Datum der Quelldaten, getrennt vom Datum, an dem wir zuletzt validiert haben. So siehst du auf einen Blick, wie aktuell die Zahlen wirklich sind. Liefert eine Quelle länger keine neuen Daten, kennzeichnen wir die betroffene Achse automatisch als eingefroren.

Quellenwechsel Juni 2026: Reasoning und Coding beziehen wir seit Juni 2026 von Artificial Analysis (Komposit-Indizes). Zuvor nutzten wir für Reasoning eine auf menschlichen Paarvergleichen basierende Arena, die seit August 2025 keine neuen öffentlichen Score-Tabellen mehr veröffentlicht und dadurch veraltete Modelle zeigte. Für Coding ersetzt der Artificial-Analysis-Index das frühere Aider-Polyglot-Board. Die frühere Agenten-Achse (Berkeley Function-Calling Leaderboard) haben wir im Juni 2026 archiviert. Siehe Abschnitt „Agenten & Tool-Use" oben.

Was diese Zahlen nicht sind

Benchmarks sind Annäherungen, keine Wahrheit. Ein hoher Score heisst nicht, dass ein Modell für deinen konkreten Anwendungsfall das beste ist: Kosten, Geschwindigkeit, Datenschutz und Verfügbarkeit zählen genauso. Wir nutzen diese Rankings als Orientierung, nicht als Urteil. Deshalb verlinken wir immer die Originalquelle und sagen offen, wo Daten veralten.

← Zurück zur Rankings-Übersicht