Vergleich: On-Prem vs. private Cloud vs. SaaS-LLM — TCO über drei Jahre
On-Premises, private Cloud oder SaaS-LLM? Der Dreijahresvergleich rechnet nicht nur Hardware und Token, sondern auch Nachweisaufwand, Lock-in und Exit — und zeigt, ab welcher Nutzungsintensität sich das Bild dreht.

Das Wichtigste auf einen Blick
- Der Preisunterschied zwischen den Betriebsmodellen entsteht selten bei der Hardware, sondern bei Personal, Nachweisaufwand und Exit.
- SaaS-LLM ist im ersten Jahr fast immer günstiger; ab etwa 25-35 Mio. verarbeiteten Token pro Monat kippt die Rechnung Richtung Eigenbetrieb.
- Private Cloud ist kein Kompromiss aus beiden Welten, sondern ein eigenes Risikoprofil: geteilte Verantwortung bei voller Nachweispflicht.
- Ohne kalkulierte Exit-Kosten ist jeder TCO-Vergleich unvollständig — Migration von Embeddings, Prompts und Feintuning ist der teuerste Posten am Vertragsende.
01Annahmen des Vergleichs
Verglichen wird ein mittelständisches Unternehmen mit 500 Mitarbeitenden, davon 180 aktive KI-Nutzende, zwei produktiven Anwendungsfällen (Dokumentenrecherche mit Retrieval und Entwurfserstellung im Kundenservice) und einem Verarbeitungsvolumen von rund 20 Mio. Token pro Monat im ersten Jahr, wachsend auf 45 Mio. im dritten Jahr. Alle Beträge sind Netto-Schätzwerte in Euro für den deutschen Markt und dienen der Struktur der Entscheidung, nicht als Angebotspreis.
Vor dem Rechnen zu klären
- Wie viele Token verarbeiten die geplanten Anwendungsfälle realistisch pro Monat?
- Welche Datenklassen werden verarbeitet und welche dürfen den eigenen Verantwortungsbereich verlassen?
- Welche Verfügbarkeit ist vertraglich zugesagt und welche wird tatsächlich gebraucht?
- Wer erbringt die Nachweise gegenüber Aufsicht und Auditor — intern oder der Anbieter?
- Welche Kündigungsfrist und welche Datenrückgabeform stehen im Vertrag?
02TCO über 36 Monate im Direktvergleich
| Kostenblock | On-Premises | Private Cloud | SaaS-LLM |
|---|---|---|---|
| Hardware / Reservierung | 180.000 (2x GPU-Server, Netz, USV) | 0 (in Instanzpreis enthalten) | 0 |
| Infrastrukturbetrieb 36 Mon. | 54.000 (Strom, Kühlung, Colocation) | 260.000 (dedizierte GPU-Instanzen) | 0 |
| Nutzung / Token 36 Mon. | 0 | 0 (in Instanz enthalten) | 230.000 |
| Personal (Betrieb, MLOps) | 300.000 (1,0 VZÄ) | 180.000 (0,6 VZÄ) | 90.000 (0,3 VZÄ) |
| Compliance & Nachweise | 60.000 (voll intern) | 70.000 (geteilte Verantwortung) | 85.000 (Lieferantenprüfung, AVV, Transfer) |
| Exit / Migration (kalkuliert) | 20.000 | 60.000 | 110.000 |
| Summe 36 Monate | 614.000 | 570.000 | 515.000 |
Bei dieser Nutzungsintensität liegen alle drei Modelle in derselben Größenordnung — die häufig behauptete Kostenersparnis des SaaS-Modells schrumpft auf rund 16 Prozent gegenüber Eigenbetrieb, sobald Lieferantenprüfung und Exit mitgerechnet werden. Entscheidend ist der Verlauf: On-Premises hat eine hohe Anfangsinvestition und flache Folgekosten, SaaS eine flache Kurve, die mit dem Volumen linear steigt.
| Dimension | On-Premises | Private Cloud | SaaS-LLM |
|---|---|---|---|
| Datenhoheit | vollständig | vertraglich zugesichert | abhängig von Region und Subunternehmern |
| Nachweisaufwand NIS2UmsuCG | hoch intern, gut belegbar | mittel, Abgrenzung nötig | gering intern, aber abhängig von Anbieterauskunft |
| Zeit bis Produktivbetrieb | 3-6 Monate | 6-10 Wochen | 2-4 Wochen |
| Lock-in-Tiefe | niedrig (offene Gewichte möglich) | mittel (Plattformdienste) | hoch (Modell, Prompts, Embeddings, Tooling) |
| Skalierung nach oben | hardwarebegrenzt | elastisch, kostenpflichtig | sofort elastisch |
03Ab wann sich die Rechnung dreht
Der Kipppunkt liegt nicht bei einer Mitarbeitendenzahl, sondern beim Token-Volumen und der Gleichmäßigkeit der Last. Bei kontinuierlicher Auslastung amortisiert sich eigene GPU-Kapazität in der hier gerechneten Konfiguration ab etwa 25 bis 35 Mio. Token pro Monat. Bei stark schwankender Last bleibt SaaS auch bei hohem Jahresvolumen günstiger, weil Leerlaufzeiten nicht bezahlt werden.
Kipppunkt selbst prüfen
- Token-Volumen der letzten drei Monate aus dem Anbieter-Reporting ziehen, nicht schätzen
- Lastprofil über den Tag erfassen: gleichmäßig oder Spitzen?
- Preis pro 1.000 Token gegen kalkulierte Kosten pro 1.000 Token im Eigenbetrieb stellen
- Personalkosten ehrlich ansetzen — Eigenbetrieb ohne 0,8 VZÄ ist keine belastbare Planung
- Exit-Kosten als eigene Zeile führen, nicht in Sonstiges
04Empfehlung nach Anwendungsfall
| Ausgangslage | Empfehlung | Begründung |
|---|---|---|
| Erste Pilotphase, unklarer Nutzen | SaaS-LLM | geringe Anfangsinvestition, schneller Erkenntnisgewinn, kurze Vertragslaufzeit wählen |
| KRITIS-Betreiber, personenbezogene oder Betriebsdaten | On-Premises | Nachweisführung bleibt vollständig im eigenen Verantwortungsbereich |
| Stabiles, hohes Volumen ohne besondere Datenklassen | private Cloud | elastisch bei planbaren Kosten, geteilte Verantwortung vertraglich sauber abgrenzbar |
| Stark schwankende Last, wenige Nutzende | SaaS-LLM | Leerlauf wird nicht bezahlt, Kipppunkt wird nicht erreicht |
Keine dieser Empfehlungen ersetzt die Lieferantenprüfung. Ein SaaS-Modell kann regulatorisch tragfähig sein, wenn Anbieter, Region und Subunternehmerkette belastbar dokumentiert sind — und Eigenbetrieb ist nicht automatisch konform, wenn Protokollierung und Zugriffskontrolle fehlen.
Häufige Fragen
Ist On-Premises-KI grundsätzlich teurer als SaaS?
Nein. Im ersten Jahr fast immer, über drei Jahre hinweg nur bei niedrigem oder stark schwankendem Volumen. Bei gleichmäßiger Last ab etwa 25 bis 35 Mio. Token pro Monat kehrt sich das Verhältnis in der hier gerechneten Konfiguration um.
Welche Kostenposten fehlen in Anbieterangeboten am häufigsten?
Personalaufwand für Betrieb und MLOps, der interne Aufwand für Nachweise und Lieferantenprüfung sowie die Exit-Kosten für Migration von Embeddings, Prompts und Feintuning.
Erfüllt eine private Cloud die Anforderungen an Datenhoheit?
Nur soweit sie vertraglich zugesichert und technisch belegbar ist. Entscheidend sind Standort der Verarbeitung, Subunternehmerkette, Zugriffsmöglichkeiten des Betreibers und die Abgrenzung der geteilten Verantwortung im Vertrag.
Wie kalkuliert man Exit-Kosten realistisch?
Als Projekt: Neuaufbau des Retrieval-Index, Portierung der Prompts, erneutes Feintuning, Revalidierung der Ausgaben und Paralleltrieb während der Umstellung. In der Praxis liegt das bei SaaS-Setups deutlich über den reinen Datenexportkosten.
Primärquellen
- Verordnung (EU) 2024/1689 (KI-Verordnung), konsolidierte Fassung
EUR-Lex · 2024-07-12
- BSI-Standard 200-2: IT-Grundschutz-Methodik
Bundesamt für Sicherheit in der Informationstechnik · 2017-10-01
- Richtlinie (EU) 2022/2555 (NIS-2-Richtlinie)
EUR-Lex · 2022-12-14
- Verordnung (EU) 2023/2854 (Data Act)
EUR-Lex · 2023-12-13
Weiterführende Artikel
Der deutsche KI-Compliance-Stack 2026: NIS2UmsuCG, KI-VO, DSGVO und CRA
05. August 2026 · 16 Min.
Lokale KI im Unternehmen: Referenzarchitektur für souveränen Betrieb
19. August 2026 · 11 Min.
Unterliegt Ihr KI-Anbieter der NIS2? Ein 10-Fragen-Test
14. August 2026 · 11 Min.
Souveräne KI in Deutschland: was hinter den Umfragen steckt
26. August 2026 · 9 Min.
Vergleich: GPU-Sizing für ein 70B-Modell — L40S vs. H100 vs. MI300X
28. August 2026 · 11 Min.