Anbieter-Bewertung

Vergleich: On-Prem vs. private Cloud vs. SaaS-LLM — TCO über drei Jahre

On-Premises, private Cloud oder SaaS-LLM? Der Dreijahresvergleich rechnet nicht nur Hardware und Token, sondern auch Nachweisaufwand, Lock-in und Exit — und zeigt, ab welcher Nutzungsintensität sich das Bild dreht.

Fryderyk Pryjma11 Min. Lesezeit
Abstrakte Illustration dreier Kostensäulen für On-Premises-Rack, private Cloud und SaaS-Cloud entlang einer Dreijahresachse

Das Wichtigste auf einen Blick

  • Der Preisunterschied zwischen den Betriebsmodellen entsteht selten bei der Hardware, sondern bei Personal, Nachweisaufwand und Exit.
  • SaaS-LLM ist im ersten Jahr fast immer günstiger; ab etwa 25-35 Mio. verarbeiteten Token pro Monat kippt die Rechnung Richtung Eigenbetrieb.
  • Private Cloud ist kein Kompromiss aus beiden Welten, sondern ein eigenes Risikoprofil: geteilte Verantwortung bei voller Nachweispflicht.
  • Ohne kalkulierte Exit-Kosten ist jeder TCO-Vergleich unvollständig — Migration von Embeddings, Prompts und Feintuning ist der teuerste Posten am Vertragsende.

01Annahmen des Vergleichs

Verglichen wird ein mittelständisches Unternehmen mit 500 Mitarbeitenden, davon 180 aktive KI-Nutzende, zwei produktiven Anwendungsfällen (Dokumentenrecherche mit Retrieval und Entwurfserstellung im Kundenservice) und einem Verarbeitungsvolumen von rund 20 Mio. Token pro Monat im ersten Jahr, wachsend auf 45 Mio. im dritten Jahr. Alle Beträge sind Netto-Schätzwerte in Euro für den deutschen Markt und dienen der Struktur der Entscheidung, nicht als Angebotspreis.

Vor dem Rechnen zu klären

  • Wie viele Token verarbeiten die geplanten Anwendungsfälle realistisch pro Monat?
  • Welche Datenklassen werden verarbeitet und welche dürfen den eigenen Verantwortungsbereich verlassen?
  • Welche Verfügbarkeit ist vertraglich zugesagt und welche wird tatsächlich gebraucht?
  • Wer erbringt die Nachweise gegenüber Aufsicht und Auditor — intern oder der Anbieter?
  • Welche Kündigungsfrist und welche Datenrückgabeform stehen im Vertrag?

02TCO über 36 Monate im Direktvergleich

Geschätzte Gesamtkosten über drei Jahre je Betriebsmodell (Netto, EUR)
KostenblockOn-PremisesPrivate CloudSaaS-LLM
Hardware / Reservierung180.000 (2x GPU-Server, Netz, USV)0 (in Instanzpreis enthalten)0
Infrastrukturbetrieb 36 Mon.54.000 (Strom, Kühlung, Colocation)260.000 (dedizierte GPU-Instanzen)0
Nutzung / Token 36 Mon.00 (in Instanz enthalten)230.000
Personal (Betrieb, MLOps)300.000 (1,0 VZÄ)180.000 (0,6 VZÄ)90.000 (0,3 VZÄ)
Compliance & Nachweise60.000 (voll intern)70.000 (geteilte Verantwortung)85.000 (Lieferantenprüfung, AVV, Transfer)
Exit / Migration (kalkuliert)20.00060.000110.000
Summe 36 Monate614.000570.000515.000

Bei dieser Nutzungsintensität liegen alle drei Modelle in derselben Größenordnung — die häufig behauptete Kostenersparnis des SaaS-Modells schrumpft auf rund 16 Prozent gegenüber Eigenbetrieb, sobald Lieferantenprüfung und Exit mitgerechnet werden. Entscheidend ist der Verlauf: On-Premises hat eine hohe Anfangsinvestition und flache Folgekosten, SaaS eine flache Kurve, die mit dem Volumen linear steigt.

Nicht-monetäre Bewertungsdimensionen
DimensionOn-PremisesPrivate CloudSaaS-LLM
Datenhoheitvollständigvertraglich zugesichertabhängig von Region und Subunternehmern
Nachweisaufwand NIS2UmsuCGhoch intern, gut belegbarmittel, Abgrenzung nötiggering intern, aber abhängig von Anbieterauskunft
Zeit bis Produktivbetrieb3-6 Monate6-10 Wochen2-4 Wochen
Lock-in-Tiefeniedrig (offene Gewichte möglich)mittel (Plattformdienste)hoch (Modell, Prompts, Embeddings, Tooling)
Skalierung nach obenhardwarebegrenztelastisch, kostenpflichtigsofort elastisch

03Ab wann sich die Rechnung dreht

Der Kipppunkt liegt nicht bei einer Mitarbeitendenzahl, sondern beim Token-Volumen und der Gleichmäßigkeit der Last. Bei kontinuierlicher Auslastung amortisiert sich eigene GPU-Kapazität in der hier gerechneten Konfiguration ab etwa 25 bis 35 Mio. Token pro Monat. Bei stark schwankender Last bleibt SaaS auch bei hohem Jahresvolumen günstiger, weil Leerlaufzeiten nicht bezahlt werden.

Kipppunkt selbst prüfen

  • Token-Volumen der letzten drei Monate aus dem Anbieter-Reporting ziehen, nicht schätzen
  • Lastprofil über den Tag erfassen: gleichmäßig oder Spitzen?
  • Preis pro 1.000 Token gegen kalkulierte Kosten pro 1.000 Token im Eigenbetrieb stellen
  • Personalkosten ehrlich ansetzen — Eigenbetrieb ohne 0,8 VZÄ ist keine belastbare Planung
  • Exit-Kosten als eigene Zeile führen, nicht in Sonstiges

04Empfehlung nach Anwendungsfall

Welches Modell zu welchem Ausgangspunkt passt
AusgangslageEmpfehlungBegründung
Erste Pilotphase, unklarer NutzenSaaS-LLMgeringe Anfangsinvestition, schneller Erkenntnisgewinn, kurze Vertragslaufzeit wählen
KRITIS-Betreiber, personenbezogene oder BetriebsdatenOn-PremisesNachweisführung bleibt vollständig im eigenen Verantwortungsbereich
Stabiles, hohes Volumen ohne besondere Datenklassenprivate Cloudelastisch bei planbaren Kosten, geteilte Verantwortung vertraglich sauber abgrenzbar
Stark schwankende Last, wenige NutzendeSaaS-LLMLeerlauf wird nicht bezahlt, Kipppunkt wird nicht erreicht

Keine dieser Empfehlungen ersetzt die Lieferantenprüfung. Ein SaaS-Modell kann regulatorisch tragfähig sein, wenn Anbieter, Region und Subunternehmerkette belastbar dokumentiert sind — und Eigenbetrieb ist nicht automatisch konform, wenn Protokollierung und Zugriffskontrolle fehlen.

Häufige Fragen

Ist On-Premises-KI grundsätzlich teurer als SaaS?

Nein. Im ersten Jahr fast immer, über drei Jahre hinweg nur bei niedrigem oder stark schwankendem Volumen. Bei gleichmäßiger Last ab etwa 25 bis 35 Mio. Token pro Monat kehrt sich das Verhältnis in der hier gerechneten Konfiguration um.

Welche Kostenposten fehlen in Anbieterangeboten am häufigsten?

Personalaufwand für Betrieb und MLOps, der interne Aufwand für Nachweise und Lieferantenprüfung sowie die Exit-Kosten für Migration von Embeddings, Prompts und Feintuning.

Erfüllt eine private Cloud die Anforderungen an Datenhoheit?

Nur soweit sie vertraglich zugesichert und technisch belegbar ist. Entscheidend sind Standort der Verarbeitung, Subunternehmerkette, Zugriffsmöglichkeiten des Betreibers und die Abgrenzung der geteilten Verantwortung im Vertrag.

Wie kalkuliert man Exit-Kosten realistisch?

Als Projekt: Neuaufbau des Retrieval-Index, Portierung der Prompts, erneutes Feintuning, Revalidierung der Ausgaben und Paralleltrieb während der Umstellung. In der Praxis liegt das bei SaaS-Setups deutlich über den reinen Datenexportkosten.

Primärquellen

Weiterführende Artikel