Agenten

TCO-Vergleich: Lokale LLMs vs. Cloud-APIs im Unternehmenseinsatz

19.08.2026

Die Entscheidung zwischen proprietären Cloud-Schnittstellen und lokal betriebenen Open-Weights-Modellen gehört zu den strategisch wichtigsten Architekturentscheidungen für Schweizer und europäische Unternehmen. Eine isolierte Betrachtung reiner Token-Preise greift dabei zu kurz: Wer die Total Cost of Ownership (TCO) kalkuliert, muss Hardwarebeschaffung, Stromkosten, Inferenz-Latenzen, Wartungsaufwände sowie regulatorische Anforderungen wie das Schweizer Datenschutzgesetz (nDSG) und die europäische KI-Verordnung mit einbeziehen. Dieser Leitfaden liefert eine strukturierte Gegenüberstellung aller relevanten Kostenfaktoren, konkrete Rechenbeispiele für unterschiedliche Lastprofile und eine praxiserprobte Entscheidungsmatrix für Technologieentscheider.

Definition und Einordnung der Betriebskonzepte

Bei der Bereitstellung generativer Sprachmodelle (Large Language Models, LLMs) im Enterprise-Kontext stehen Organisationen primär vor der Wahl zwischen drei grundlegenden Bereitstellungsmodellen:

  • Public Cloud-APIs (Pay-per-Token): Die Inferenz erfolgt auf der Infrastruktur grosser Modellanbieter. Das Unternehmen zahlt ausschliesslich für die verbrauchten Eingabe- und Ausgabe-Tokens. Die Betriebsverantwortung für Skalierung, Ausfallsicherheit und Modell-Updates liegt vollständig beim Anbieter.
  • Dedicated Cloud-Infrastruktur: Miete dedizierter GPU-Instanzen bei europäischen Cloud-Anbietern oder Hyperscalern (z.B. Instanzen mit NVIDIA L40S, H100 oder A100 GPUs). Das Abrechnungsmodell basiert auf festen Stundensätzen unabhängig vom tatsächlichen Token-Durchsatz.
  • On-Premises Inferenz: Eigene Server-Hardware im unternehmenseigenen Rechenzentrum oder in einer kontrollierten Colocation-Umgebung. Maximale Datenhoheit, fixe Investitionskosten (CapEx) und planbare laufende Betriebskosten (OpEx).

Die Total Cost of Ownership umfasst dabei weit mehr als die reine Rechenleistung. Sie setzt sich aus direkten Kosten (Token-Gebühren, Hardwarekauf, Strom, Lizenzen) und indirekten Kosten (Personaleinsatz für MLOps, Systemintegration, Ausfallzeiten, Compliance-Prüfungen) zusammen.

Technische Funktionsweise und Kostenfaktoren im Detail

Um die wirtschaftliche Tragfähigkeit beider Ansätze fundiert zu bewerten, müssen die technischen Treiber der Inferenzkosten analysiert werden.

Kostenstruktur bei Cloud-APIs

Cloud-APIs bieten einen sofortigen Einstieg ohne Vorabinvestitionen. Die Kosten skalieren linear mit der Nutzung:

  • Token-Asymmetrie: Ausgabe-Tokens sind bei den meisten Anbietern drei- bis viermal teurer als Eingabe-Tokens, da die Generierung autoregressiv erfolgt und mehr Rechenzyklen pro Token bindet.
  • Kontextfenster-Skalierung: Bei Retrieval-Augmented-Generation (RAG) oder langen Dokumentenanalysen steigt der Eingabetoken-Verbrauch drastisch an. Prompt-Caching kann wiederkehrende System-Instruktionen verbilligen, setzt jedoch eine konsistente Cache-Hit-Rate voraus.
  • Netzwerk-Overhead und Latenz: Externe API-Aufrufe erzeugen Netzwerk-Latenzen (Roundtrip-Zeiten von 200 bis 800 Millisekunden), was bei mehrstufigen Agenten-Workflows zu spürbaren Verzögerungen führen kann.

Kostenstruktur bei lokalen Modellen

Der Betrieb lokaler Open-Weights-Modelle (wie Llama, Mistral oder Qwen) folgt einer klassischen Fixkosten-Degression:

  • Hardware und Speicherkapazität (VRAM): Der entscheidende Kostenfaktor ist der Grafikspeicher. Ein quantisiertes 70-Milliarden-Parameter-Modell im FP8- oder INT4-Format benötigt mindestens 48 bis 80 GB VRAM (z.B. zwei NVIDIA L40S oder eine NVIDIA H100 GPU), um hohe Parallelität und ausreichend Kontext zu bedienen.
  • Moderne Inferenz-Engines: Der Einsatz hochoptimierter Inferenz-Frameworks wie vLLM, TensorRT-LLM oder TGI ermöglicht Continuous Batching und PagedAttention. Dadurch steigt der effektive Durchsatz pro GPU um den Faktor 3 bis 5 gegenüber einfachen Frameworks.
  • Energie und Rechenzentrum: Ein Enterprise-Server mit zwei Hochleistungs-GPUs verbraucht unter Last etwa 800 bis 1200 Watt. Inklusive Kühlung (PUE-Faktor) und Rackspace im Schweizer Rechenzentrum entstehen laufende Infrastrukturkosten von 300 bis 600 CHF pro Monat.
  • MLOps- und Engineering-Ressourcen: Für Setup, Modell-Updates, Quantisierung, Latenzoptimierung und Monitoring müssen personelle Kapazitäten (ca. 10 bis 20 Prozent einer Vollzeitstelle) budgetiert werden.

TCO-Vergleichstabelle und Szenarien-Analyse

Die folgende Übersicht fasst die charakteristischen Eigenschaften und Kostenstrukturen der Bereitstellungsmodelle zusammen:

Kriterium Cloud-APIs (Pay-per-Token) Dedicated GPU-Cloud On-Premises Inferenz
Investitionskosten (CapEx) 0 CHF 0 CHF Hoch (15'000 bis 45'000 CHF pro Server)
Monatliche Fixkosten (OpEx) Sehr gering (Grundgebühren / Plattform) Mittel bis hoch (800 bis 2'500 CHF je GPU-Instanz) Niedrig (Strom, RZ, Abschreibung, Wartung)
Variable Kosten Vollständig nutzungsabhängig Keine (Flatrate bei fixer Kapazität) Keine (Flatrate bei fixer Kapazität)
Datenschutz & Governance Auftragsdatenverarbeitung (AVV) erforderlich Sehr hoch bei europäischen Hostern Vollständige Datenhoheit, kein Drittzugriff
Personeller Betriebsaufwand Minimal (API-Integration) Mittel (Container, Treiber, Orchestrierung) Hoch (Hardware, Virtualisierung, MLOps)

Konkrete Lastszenarien im Kostenvergleich

Zur Bestimmung des wirtschaftlichen Kipppunkts (Break-Even) betrachten wir drei typische Unternehmensszenarien auf Monatsbasis:

  • Szenario 1: Niedriges Volumen (KMU-Einstieg, 5 Millionen Tokens/Monat): Bei Nutzung führender Cloud-APIs belaufen sich die monatlichen Kosten auf ca. 30 bis 80 CHF. Ein eigener GPU-Server wäre wirtschaftlich unrentabel, da die Fixkosten für Hardware und Betrieb die Token-Einsparungen bei weitem übersteigen. Empfehlung: Cloud-APIs.
  • Szenario 2: Mittleres Volumen (Prozessautomatisierung, 100 Millionen Tokens/Monat): Die Kosten über Cloud-APIs liegen bei etwa 600 bis 1'800 CHF pro Monat. Eine gemietete GPU-Instanz (z.B. 1x L40S für ca. 900 CHF/Monat) bewegt sich im gleichen Kostenbereich, bietet jedoch deterministische Latenzen und strikten Datenschutz. Empfehlung: Hybrides Modell oder Dedicated Cloud.
  • Szenario 3: Hohes Volumen (Enterprise RAG & Dokumenten-Workflows, 800+ Millionen Tokens/Monat): Cloud-APIs kosten hier 5'000 bis 15'000 CHF monatlich. Ein eigener Dual-GPU-Server (Anschaffung ca. 30'000 CHF, amortisiert über 3 Jahre = 830 CHF/Monat zzgl. 500 CHF RZ-Kosten) verursacht Gesamtkosten von unter 2'000 CHF monatlich inklusive Wartung. Empfehlung: On-Premises Inferenz oder Dedicated Cluster.

Entscheidungsmatrix für Führungskräfte

Für eine fundierte Architekturentscheidung sollten Schweizer Unternehmen folgende Leitkriterien heranziehen:

  • Sensitivität der Daten: Fallen die Workflows unter das Berufsgeheimnis (Art. 321 StGB), strenge FINMA-Vorgaben für Banken oder das Schweizer Datenschutzgesetz (nDSG) für besonders schützenswerte Personendaten? Wenn Daten das Unternehmensnetzwerk nicht verlassen dürfen, ist ein lokaler Betrieb oder eine dedizierte Private Cloud im Schweizer Rechtsraum zwingend.
  • Komplexität der Aufgabenstellung: Handelt es sich um strukturierte Aufgaben (Informationsextraktion, Klassifikation, Übersetzung, semantische Suche) oder um hochgradig komplexe mehrstufige Schlussfolgerungen? Spezialisierte kleine und mittlere Modelle (8B bis 70B Parameter) erreichen bei fokussierten Aufgaben oft die gleiche Qualität wie Frontier-Modelle.
  • Lastmuster und Planbarkeit: Weist das Nutzungsprofil hohe, unvorhersehbare Spitzen auf, bieten Cloud-APIs unübertroffene Elastizität. Bei planbarer Grundlast (z.B. nächtliche Batch-Verarbeitung von Dokumenten) schlägt die Kostenrechnung lokaler Hardware fast immer die Cloud.
  • Verfügbarkeit von Betriebskompetenz: Stehen interne Ressourcen für Linux-Administration, GPU-Treiber und Container-Orchestrierung zur Verfügung? Ohne entsprechendes Basis-Know-how führen lokale Setups zu verdeckten Personalkosten.

Schritt-für-Schritt Best Practices für die Implementierung

Erfolgreiche Schweizer Unternehmen implementieren LLM-Infrastruktur selten als Entweder-oder, sondern etablieren einen schrittweisen, risikominimierten Prozess:

  1. Nutzungsprofile und Token-Bedarf auditieren: Erfasse vor Hardware-Investitionen den tatsächlichen Token-Durchsatz, die Verteilung von Input- zu Output-Länge und die Latenztoleranz der Zielanwendungen.
  2. Prototypen auf Cloud-APIs aufbauen: Validiere Produktivität und Akzeptanz der KI-Anwendung mit minimalem Initialaufwand über Standard-APIs.
  3. Modell-Gateway als Abstraktionsschicht etablieren: Schalte ein einheitliches API-Gateway (z.B. LiteLLM oder ein eigenes Proxy-Gateway) zwischen deine Applikationen und die Sprachmodelle. Dies ermöglicht den nahtlosen Wechsel zwischen Cloud-Providern und lokalen Inferenz-Servern ohne Code-Anpassungen.
  4. Hybrides Routing nach Datenklasse und Kosten aktivieren: Leite unkritische Anfragen oder komplexe Reasoning-Prompts an externe Cloud-Modelle weiter, während datensensible Dokumente und volumenstarke Routine-Abfragen automatisch an den internen Inferenz-Server geroutet werden.
  5. Laufendes Monitoring der Gesamtkosten etablieren: Miss kontinuierlich GPU-Auslastung, KV-Cache-Nutzung und Token-Verbrauch, um den optimalen Zeitpunkt für Hardware-Erweiterungen oder Modell-Upgrades datenbasiert zu bestimmen.

Stand: August 2026.

Newsletter abonnieren