News

Chinesische KI-Modelle 2026: Leistung, Preise und Einsatzgrenzen

18.08.2026

Chinesische KI-Modelle sind 2026 keine günstigen Kopien westlicher Systeme mehr. In aktuellen unabhängigen Messungen erreichen Kimi K3, Qwen3.8 Max, DeepSeek V4 Pro 0813 und GLM-5.2 Werte, die sie für anspruchsvolle Wissensarbeit, Programmierung und mehrstufige Automatisierung interessant machen. Ihre wirtschaftlichen Profile unterscheiden sich jedoch stark. Wer nur auf den Preis pro Million Tokens schaut, übersieht Antwortlänge, Tempo, Cache-Wirkung, Betriebsmodell und Datenrisiken.

Kurzfazit: Kimi K3 erzielt in der geprüften Vergleichsmessung den höchsten Leistungswert, ist aber teuer und langsam. Qwen3.8 Max liegt knapp dahinter und verarbeitet zusätzlich Bilder sowie Videos. DeepSeek V4 Pro 0813 bietet das günstigste API-Profil und ein hohes Tempo. GLM-5.2 verbindet einen soliden Leistungswert mit der höchsten gemessenen Ausgabegeschwindigkeit. Für vertrauliche Daten ist keines dieser Angebote ohne vorgängige Vertrags-, Datenschutz- und Sicherheitsprüfung geeignet.

Was «chinesische KI» in diesem Vergleich bedeutet

Der Begriff bezeichnet hier grosse Sprachmodelle chinesischer Anbieter, nicht eine einheitliche technische oder politische Kategorie. Verglichen werden DeepSeek, Alibaba Cloud mit Qwen, Moonshot mit Kimi und Z.AI mit GLM. Das Herkunftsland allein sagt wenig über Modellqualität, Lizenz, Hosting oder Datenfluss aus. Entscheidend ist die konkrete Kombination aus Modell, API-Anbieter, Region, Vertrag und eigener Systemarchitektur.

Die Kriterien sind Leistung, Ausgabegeschwindigkeit, API-Preis, Kontextfenster, Eingabemodalitäten, Gewichtsverfügbarkeit, Lizenz und betriebliche Eignung. Die Leistungswerte stammen aus dem Artificial Analysis Intelligence Index im Abrufstand vom 18. August 2026. Der Index bündelt mehrere Aufgabenklassen. Ein Wert von 60 bedeutet deshalb weder 60 Prozent Korrektheit noch eine Garantie für den eigenen Anwendungsfall.

Auf einen Blick: Die Empfehlungsskala reicht von 1 für «nicht weiter evaluieren» bis 5 für «mit klaren Kontrollen breit testen». Für einen DACH-Pilot mit nicht vertraulichen Daten ergibt sich ein Skala-Wert von 4 von 5. Für einen ungeprüften Produktionseinsatz mit Personen-, Kunden- oder Geschäftsgeheimnissen bleibt der Wert bei 1 von 5.

Leistung, Preis und Betrieb im direkten Vergleich

ModellUnabhängige MessungAPI-ListenpreisBetrieb und Kontext
Kimi K3, max60 Indexpunkte, rund 38 Output-Tokens pro Sekunde, 0,84 US-Dollar pro Indexaufgabe3,00 US-Dollar Input, 15,00 US-Dollar Output, 0,30 US-Dollar Cache-Input je Million TokensEine Million Tokens, Text und Bild, Open Weights mit eigener Kimi-Lizenz
Qwen3.8 Max58 Indexpunkte, rund 45 Output-Tokens pro Sekunde, 1,13 US-Dollar pro Indexaufgabe2,00 US-Dollar Input und 6,00 US-Dollar Output je Million TokensEine Million Tokens, Text, Bild und Video, proprietäres Max-Angebot
DeepSeek V4 Pro 0813, max53 Indexpunkte, rund 78 Output-Tokens pro Sekunde, 0,25 US-Dollar pro Indexaufgabe0,66 bis 1,32 US-Dollar Input und 1,98 bis 3,96 US-Dollar Output je Million TokensEine Million Tokens, Text, Open Weights unter MIT-Lizenz
GLM-5.2, max53 Indexpunkte, rund 153 Output-Tokens pro Sekunde, 0,33 US-Dollar pro Indexaufgabe1,40 US-Dollar Input, 4,40 US-Dollar Output, 0,26 US-Dollar Cache-Input je Million TokensEine Million Tokens, Text, Open Weights unter MIT-Lizenz

Alle Preisangaben beziehen sich auf eine Million Tokens und auf die öffentlich ausgewiesenen Anbieterpreise. Steuern, Netzwerkkosten, regionale Abweichungen, Rabatte und Infrastruktur für ein eigenes Hosting sind nicht eingerechnet. DeepSeek verwendet Tageszeitfenster. Die günstigeren Sätze gelten ausserhalb der ausgewiesenen Spitzenzeiten.

Der Preis pro Token ist nicht der Preis pro Ergebnis

Ein einfaches Rechenbeispiel zeigt die Grössenordnung. Für eine Anfrage mit 100'000 nicht gecachten Input-Tokens und 10'000 Output-Tokens entstehen nach den aktuellen Listenpreisen ungefähr 0,09 bis 0,17 US-Dollar bei DeepSeek, 0,18 US-Dollar bei GLM, 0,26 US-Dollar bei Qwen und 0,45 US-Dollar bei Kimi. Das sind keine Offerten, sondern lineare Rechenwerte ohne Nebenkosten.

In der Praxis können Reasoning-Modelle sehr viele Zwischenschritte und Output-Tokens erzeugen. Dadurch kann ein nominell günstiger Tarif teurer werden als ein höherer Tarif mit kürzeren Antworten. Die unabhängige Messung verdeutlicht diesen Effekt: Pro Indexaufgabe liegt DeepSeek bei 0,25 US-Dollar, GLM bei 0,33 US-Dollar, Kimi bei 0,84 US-Dollar und Qwen bei 1,13 US-Dollar. Für die eigene Beschaffung ist deshalb der Preis pro erfolgreich erledigtem Vorgang wichtiger als der Tokenpreis.

Cache-Tarife können wiederkehrende Systemanweisungen, grosse Dokumentgrundlagen und ähnliche Anfragen deutlich verbilligen. Sie helfen jedoch nur bei tatsächlich wiederverwendbaren Präfixen. Teams sollten Cache-Trefferquote, Output-Länge, Fehlversuche und menschliche Nacharbeit gemeinsam messen.

Kimi K3: höchste Messleistung, hoher Verbrauch

Kimi K3 erreicht mit 60 Punkten den höchsten Wert der vier verglichenen Modelle. Das Modell verarbeitet Text und Bilder und verfügt über ein Kontextfenster von rund einer Million Tokens. Das eignet sich für grosse Recherchepakete, komplexe Agentenläufe und Aufgaben, bei denen zusätzliche Modellqualität einen hohen wirtschaftlichen Wert hat.

Dem stehen 15 US-Dollar pro Million Output-Tokens und die niedrigste gemessene Ausgabegeschwindigkeit im Vergleich gegenüber. Kimi eignet sich deshalb für wertvolle, schwierige Einzelaufgaben, nicht aber automatisch für kostensensitive Massenverarbeitung oder interaktive Anwendungen mit strengen Latenzzielen. Die Gewichte sind verfügbar, die eigene Kimi-Lizenz muss aber separat gegen den vorgesehenen Einsatz geprüft werden.

Qwen3.8 Max: multimodal und leistungsstark

Qwen3.8 Max erzielt 58 Indexpunkte und unterstützt Text, Bilder sowie Videos als Eingabe. Das macht das Modell für Dokumentanalyse, visuelle Qualitätssicherung und multimodale Arbeitsabläufe interessant. Der API-Preis liegt zwischen GLM und Kimi, der gemessene Preis pro Indexaufgabe ist in diesem Feld jedoch am höchsten.

Mit rund 45 Output-Tokens pro Sekunde gehört Qwen nicht zu den schnellen Angeboten. Das proprietäre Max-Modell eignet sich für multimodale Analysen und hochwertige Assistenten, nicht aber als erste Wahl für selbst betriebenes Open-Weights-Hosting. Alibaba bietet weitere Qwen-Varianten an, doch deren Preise und Leistungswerte dürfen nicht auf Qwen3.8 Max übertragen werden.

DeepSeek und GLM: zwei unterschiedliche Effizienzstrategien

DeepSeek V4 Pro 0813 und GLM-5.2 erreichen beide 53 Indexpunkte, unterscheiden sich aber im Betrieb. DeepSeek ist bei den aktuellen API-Preisen am günstigsten und liefert rund 78 Output-Tokens pro Sekunde. Das eignet sich für umfangreiche Textverarbeitung, Coding-Aufgaben und kostenbewusste Batch-Läufe. Nicht geeignet ist es für Projekte, die zwingend Bild- oder Videoeingaben im selben Modell benötigen.

GLM-5.2 erreicht rund 153 Output-Tokens pro Sekunde und ist damit in der geprüften Messung deutlich schneller. Sein Preis liegt über DeepSeek, aber unter Qwen und Kimi. GLM eignet sich für interaktive Textanwendungen und Automatisierungen mit hohem Durchsatz. Das Modell ist nicht automatisch die beste Wahl, wenn höchste absolute Benchmarkleistung wichtiger ist als Antwortzeit und Kosten.

Für DeepSeek und GLM werden offene Gewichte sowie eine MIT-Lizenz ausgewiesen. Das schafft Optionen für eigenes Hosting und technische Kontrolle. Open Weights bedeutet dennoch nicht, dass ein produktiver Eigenbetrieb günstig oder einfach ist. Frontier-Modelle benötigen erhebliche Rechen-, Speicher- und Betriebskapazität. Hinzu kommen Modellüberwachung, Sicherheitsfilter, Updates und belastbare Ausweichpfade.

Die wichtigsten Grenzen für DACH-Unternehmen

  • Datenfluss: Vor vertraulichen Tests sind Verarbeitungsort, Unterauftragsbearbeiter, Aufbewahrung, Trainingsnutzung und Löschmechanismen schriftlich zu klären.
  • Vertrag und Lizenz: API-Nutzungsbedingungen und Modelllizenzen sind getrennte Prüfflächen. Open Weights ersetzt weder Datenschutzvertrag noch Betriebsfreigabe.
  • Qualität: Benchmarks bilden die eigene Fachsprache, Schweizer Rechtsbegriffe, interne Daten und Fehlertoleranz nur begrenzt ab. Ein eigener Testsatz ist Pflicht.
  • Steuerbarkeit: Inhaltsfilter, politische Sensitivitäten und Ablehnungsverhalten können sich zwischen Anbieter-API und Eigenbetrieb unterscheiden.
  • Lieferfähigkeit: Preise, Modelle und Endpunkte ändern schnell. Anwendungen brauchen Versionsfixierung, Kostenalarme und mindestens einen getesteten Ausweichanbieter.

Für einen ersten Pilot eignen sich öffentliche Dokumente, synthetische Daten, Coding-Aufgaben ohne Geheimnisse und klar messbare Batch-Prozesse. Nicht geeignet sind ungeprüfte Anwendungen mit Gesundheitsdaten, Personaldossiers, Kundengeheimnissen oder automatischen Entscheidungen mit Rechtswirkung.

Empfehlung: nach Vorgangskosten und Risiko auswählen

Beirat-Empfehlung: Beginne nicht mit einem allgemeinen Sieger, sondern mit drei repräsentativen Aufgaben. Teste DeepSeek als Kostenreferenz, GLM als Geschwindigkeitsreferenz und Kimi oder Qwen als Qualitätsreferenz. Miss Trefferquote, Antwortzeit, Output-Tokens, Cache-Treffer, menschliche Korrekturzeit und Fehlerkosten. Ein Modell kommt erst weiter, wenn Datenvertrag, Sicherheitsprüfung und Ausweichpfad zum gleichen Ergebnis passen.

Der Markt zeigt ein klares Muster: Chinesische Spitzenmodelle können technisch mit der internationalen Spitzengruppe konkurrieren, aber nicht jedes Modell gewinnt bei Kosten, Tempo und Betriebsfreiheit zugleich. Für Unternehmen entsteht der Vorteil durch einen kontrollierten Modellmix, nicht durch einen pauschalen Anbieterwechsel.

Stand: 18. August 2026, Preise und Messwerte wurden an diesem Tag abgerufen. Anbieter können Tarife, Endpunkte und Modellversionen jederzeit ändern.

Newsletter abonnieren