Methodik & Datenquellen
Wir erfinden keine eigenen Bestenlisten. Unsere Rankings bündeln zwei etablierte, öffentlich nachprüfbare Quellen, je eine pro Achse. Hier steht offen, woher jede Zahl stammt, wie sie gemessen wird und was sie aussagt. Jede Quelle ist direkt verlinkt, damit du selbst nachprüfen kannst. Für KI-Agenten setzen wir bewusst kein Benchmark-Ranking ein, sondern einen kuratierten Einsatzzweck-Guide für den DACH-Raum, mehr dazu unten.
Die zwei Quellen
Artificial Analysis: Intelligence Index
- Was gemessen wird
- Ein Komposit-Index, der mehrere unabhängige Reasoning- und Wissens-Benchmarks zu einem Wert bündelt, darunter GPQA (Naturwissenschaft auf Graduate-Niveau), HLE und MMLU-Pro. Gemessen wird die allgemeine Denk- und Wissensfähigkeit, nicht eine einzelne Aufgabe.
- Warum diese Quelle
- Eine einzelne Benchmark lässt sich überoptimieren; ein Komposit aus mehreren ist robuster. Artificial Analysis pflegt den Index laufend und deckt praktisch alle aktuellen Modelle ab, anders als die früher genutzte, auf menschlichen Paarvergleichen basierende Vergleichs-Arena, die seit August 2025 keine neuen öffentlichen Tabellen mehr veröffentlicht.
- Was der Wert bedeutet
- Ein Index-Wert: Höher ist besser. Er ist relativ zum getesteten Feld und kein Prozentsatz einer einzelnen Prüfung.
Artificial Analysis: Coding Index
- Was gemessen wird
- Ein Komposit-Index aus mehreren Coding-Benchmarks (u. a. LiveCodeBench und SciCode). Geprüft wird, wie zuverlässig ein Modell lauffähigen, korrekten Code zu realen Programmieraufgaben erzeugt.
- Warum diese Quelle
- Kein Multiple-Choice, sondern Code, der Tests bestehen muss, über mehrere Benchmarks gemittelt. Aus derselben Quelle wie das Reasoning-Ranking, also konsistent gemessen und gepflegt.
- Was der Wert bedeutet
- Ein Index-Wert: Höher ist besser. Er bündelt mehrere Coding-Prüfungen zu einer Gesamtnote.
Agenten & Tool-Use: kuratierter Guide statt Benchmark
Für Reasoning und Coding gibt es robuste, laufend gepflegte Benchmark-Quellen. Für KI-Agenten gilt das derzeit nicht: Es existiert kein öffentliches, aktuell gepflegtes Leaderboard, das Agenten-Produkte fair und nach Einsatzzweck vergleicht. Function-Calling-Benchmarks messen einzelne Modell-Fähigkeiten (den „Motor"), nicht den praktischen Nutzen eines fertigen Agenten für eine konkrete Aufgabe (das „Auto").
Deshalb stellen wir an dieser Stelle bewusst kein Agenten-Ranking auf. Stattdessen pflegen wir einen kuratierten Einsatzzweck-Guide für den DACH-Raum: Welcher Agent eignet sich wofür, welches Modell läuft darunter, und welche nachprüfbaren Hosting- und Datenschutz-Eigenschaften hat er? Zum DACH-Agenten-Guide →
Wie wir aktualisieren
Ein automatisierter Prozess holt die Daten jeden Sonntag aus allen zwei Quellen, schreibt sie in unsere Datenbank und stellt die jeweils Top-3 pro Achse auf der Startseite dar. Bei jeder Quelle steht oben der „Stand der Quelle", das echte Datum der Quelldaten, getrennt vom Datum, an dem wir zuletzt validiert haben. So siehst du auf einen Blick, wie aktuell die Zahlen wirklich sind. Liefert eine Quelle länger keine neuen Daten, kennzeichnen wir die betroffene Achse automatisch als eingefroren.
Was diese Zahlen nicht sind
Benchmarks sind Annäherungen, keine Wahrheit. Ein hoher Score heisst nicht, dass ein Modell für deinen konkreten Anwendungsfall das beste ist: Kosten, Geschwindigkeit, Datenschutz und Verfügbarkeit zählen genauso. Wir nutzen diese Rankings als Orientierung, nicht als Urteil. Deshalb verlinken wir immer die Originalquelle und sagen offen, wo Daten veralten.