Anbieter-Bewertung

Vergleich: GPU-Sizing für ein 70B-Modell — L40S vs. H100 vs. MI300X

Speicherbedarf, Tokens pro Sekunde, Stromaufnahme und Beschaffbarkeit: der nüchterne Vergleich dreier Beschleuniger für den souveränen Betrieb eines 70-Milliarden-Parameter-Modells.

Fryderyk Pryjma11 Min. Lesezeit
Abstrakte redaktionelle Illustration dreier GPU-Beschleunigerkarten nebeneinander vor Serverschränken in Petrol und Sandbeige

Das Wichtigste auf einen Blick

  • Ein 70B-Modell braucht in FP16 rund 140 GB Speicher — in FP8 genügt eine einzelne MI300X, in INT4 auch eine H100.
  • Generative Inferenz ist bandbreitengebunden: die Speicherbandbreite bestimmt die Tokens pro Sekunde stärker als die Rechenleistung.
  • L40S ist die günstigste Einstiegsoption für Piloten, skaliert über PCIe aber schlecht auf mehr als vier Karten.
  • H100 SXM liefert die beste Latenz je Nutzer, MI300X den günstigsten Speicher je Gigabyte und den einfachsten Einzelkartenbetrieb.
  • Unterdimensionierung erzeugt Wartezeiten, Wartezeiten erzeugen Schatten-IT — Sizing ist damit auch eine Datenschutzmaßnahme.

01Warum GPU-Sizing die teuerste Fehlentscheidung im souveränen KI-Betrieb ist

Wer ein 70-Milliarden-Parameter-Modell im eigenen Rechenzentrum betreiben will, entscheidet mit der GPU-Auswahl über drei Jahre Kostenstruktur, über die erreichbare Antwortzeit und indirekt über die Nachweisfähigkeit gegenüber BSI und Marktüberwachung. Die Hardware ist der einzige Posten, den Sie nach dem Kauf nicht mehr elastisch anpassen können.

Der Vergleich in diesem Beitrag betrachtet drei in Europa realistisch beschaffbare Beschleuniger: NVIDIA L40S (48 GB GDDR6, PCIe), NVIDIA H100 (80 GB HBM3, SXM oder PCIe) und AMD Instinct MI300X (192 GB HBM3). Bewertet werden Speicherbedarf, Durchsatz, Betriebsaufwand und Beschaffbarkeit — nicht Benchmark-Spitzenwerte.

02Speicherbedarf: was ein 70B-Modell tatsächlich belegt

Die Quantisierung entscheidet, wie viele Karten Sie brauchen. Die folgende Tabelle zeigt den reinen Gewichtsbedarf und die praxisnahe Mindestbestückung inklusive KV-Cache für 8k Kontext und moderate Nebenläufigkeit.

Speicherbedarf eines 70B-Modells nach Quantisierung
QuantisierungGewichtePraxisbedarf inkl. KV-CacheMindestbestückung L40S (48 GB)Mindestbestückung H100 (80 GB)Mindestbestückung MI300X (192 GB)
FP16 / BF16ca. 140 GB170–200 GB4–5 Karten3 Karten2 Karten
FP8ca. 70 GB95–115 GB3 Karten2 Karten1 Karte
INT4 / AWQca. 37 GB55–70 GB2 Karten1 Karte1 Karte

Die Zahl der Karten ist kein reiner Kostenfaktor. Jede zusätzliche Karte bedeutet Tensor-Parallelität über NVLink oder PCIe — und damit Kommunikationsaufwand, der bei PCIe-Systemen wie dem L40S deutlich stärker durchschlägt als bei NVLink-gekoppelten H100-Knoten.

03Direktvergleich: L40S, H100 und MI300X im Betriebsprofil

Die folgende Gegenüberstellung fasst die betrieblich relevanten Eigenschaften zusammen. Preisangaben sind Orientierungswerte für den deutschen Markt im Jahr 2026 und variieren je nach Abnahmemenge und Systemintegrator.

Beschleuniger im Vergleich (Orientierungswerte 2026)
KriteriumL40SH100 SXMMI300X
Speicher48 GB GDDR680 GB HBM3192 GB HBM3
Speicherbandbreiteca. 864 GB/sca. 3,35 TB/sca. 5,3 TB/s
Verbrauch (TDP)350 W700 W750 W
KopplungPCIeNVLinkInfinity Fabric
Rack-AnforderungLuftkühlung möglichWasserkühlung empfohlenWasserkühlung empfohlen
Software-ReifeCUDA, ausgereiftCUDA, ausgereiftROCm, gute Abdeckung für gängige Inferenz-Stacks
Beschaffbarkeit DEgutangespanntmittel, wachsend
Listenpreis je Karteca. 8.000–11.000 €ca. 28.000–35.000 €ca. 20.000–26.000 €

Der entscheidende Unterschied liegt in der Speicherbandbreite. Generative Inferenz ist im Decoding-Schritt bandbreitengebunden, nicht rechengebunden. Ein L40S liefert deshalb trotz solider Rechenleistung erheblich weniger Tokens pro Sekunde als sein Preis vermuten lässt.

04Durchsatz und Latenz: was Sie pro Sekunde erwarten dürfen

Die folgenden Richtwerte gelten für ein 70B-Modell in FP8 mit vLLM oder einem vergleichbaren Serving-Stack, 8k Kontext und Batchgrößen im typischen Unternehmensbetrieb. Sie ersetzen keinen eigenen Lasttest, geben aber die Größenordnung verlässlich wieder.

Richtwerte Durchsatz und Latenz (70B, FP8, 8k Kontext)
KonfigurationTokens/s je NutzerGesamtdurchsatz bei 16 parallelen AnfragenBemerkung
4× L40S12–18150–250 Tokens/sPCIe-Kommunikation limitiert die Skalierung
2× H100 SXM35–50550–800 Tokens/sbestes Verhältnis Latenz zu Komplexität
1× MI300X30–45450–700 Tokens/sEinzelkarte, keine Tensor-Parallelität nötig
8× H100 SXM45–601.800–2.600 Tokens/sfür Mandantenbetrieb oder mehrere Modelle

05Entscheidungslogik nach Einsatzszenario

Es gibt keine generell beste Karte. Es gibt drei klar unterscheidbare Ausgangslagen, die jeweils eine andere Antwort verlangen.

Empfehlung nach Szenario
SzenarioEmpfehlungBegründung
Pilot, 10–30 Fachnutzer, bestehendes luftgekühltes Rack2–4× L40S mit INT4/FP8niedrigste Einstiegshürde, keine Rechenzentrumsumbauten
Produktivbetrieb, 100+ Nutzer, RAG und Dokumentenanalyse2–4× H100 SXMbeste Latenz, ausgereifter CUDA-Stack, breite Toolunterstützung
Ein großes Modell, minimale Knotenanzahl, Kostendruck je GB Speicher1–2× MI300X192 GB je Karte vermeiden Tensor-Parallelität komplett
Mehrere Modelle parallel, Mandantentrennung8× H100 oder 4× MI300XIsolation je Modell statt Zeitscheibenbetrieb

Vor der Beschaffung zu klären

  • Zielwert für Tokens pro Sekunde und Nutzer bei Spitzenlast schriftlich festgelegt
  • Maximale Kontextlänge und erwartete Zahl paralleler Anfragen dokumentiert
  • Quantisierungsstrategie mit den Fachbereichen auf Qualitätsverlust geprüft
  • Stromanschluss und Kühlleistung je Rack gegen die TDP der Zielbestückung gerechnet
  • Serving-Stack (vLLM, TGI, TensorRT-LLM oder ROCm-Äquivalent) auf Kompatibilität getestet
  • Lieferzeit und Ersatzteilverfügbarkeit vertraglich zugesichert
  • Exit-Szenario definiert: Was passiert mit der Hardware, wenn das Modell gewechselt wird?

06Regulatorische Nebenwirkungen der Hardwarewahl

Die GPU-Entscheidung ist auch eine Compliance-Entscheidung. Wer On-Premises betreibt, übernimmt Pflichten, die bei einem SaaS-Anbieter beim Dienstleister lägen — behält dafür aber die volle Kontrolle über Protokollierung und Datenfluss.

Nachweisfähigkeit im Eigenbetrieb

  • Protokollierung der Modellzugriffe erfüllt die Anforderungen aus Art. 12 KI-VO
  • Verfügbarkeits- und Wiederanlaufkonzept ist Teil der NIS2-Risikomaßnahmen
  • Patchstand von Treibern, Firmware und Serving-Stack ist dokumentiert und auditierbar
  • Physische Zutrittskontrolle zum GPU-Rack ist geregelt
  • Kapazitätsplanung ist als Kontinuitätsmaßnahme dokumentiert

Ein häufig übersehener Punkt: Unterdimensionierte Hardware führt zu Wartezeiten, Wartezeiten führen zu Schatten-IT, und Schatten-IT ist der schnellste Weg, personenbezogene Daten in einem nicht bewerteten Drittlandsdienst zu verarbeiten. Sizing ist damit auch eine Datenschutzmaßnahme.

Häufige Fragen

Reicht eine einzelne GPU für ein 70B-Modell?

Nur mit aggressiver Quantisierung. Eine MI300X mit 192 GB trägt ein 70B-Modell in FP8 problemlos allein, eine H100 mit 80 GB erst ab INT4. Beim L40S mit 48 GB ist der Einzelkartenbetrieb für 70B nicht praxistauglich.

Wie stark verliert ein Modell durch Quantisierung an Qualität?

FP8 ist in der Praxis nahezu verlustfrei. INT4 kostet je nach Verfahren spürbar Qualität bei Aufgaben mit langen Schlussketten, ist für Zusammenfassungen und Klassifikation aber meist unproblematisch. Prüfen Sie den Verlust immer an eigenen Fachdaten, nicht an öffentlichen Benchmarks.

Ist AMD ROCm für Produktivbetrieb reif genug?

Für gängige Inferenz-Stacks ja. Die Abdeckung populärer Serving-Frameworks ist gut, die Werkzeuglandschaft rund um Feinabstimmung und Profiling bleibt gegenüber CUDA schmaler. Wer ausschließlich Inferenz betreibt, hat mit MI300X ein tragfähiges Angebot.

Wie viel Strom braucht eine 70B-Installation?

Eine Bestückung mit zwei H100 SXM zieht unter Last rund 1,4 kW allein für die Beschleuniger, zuzüglich Host, Netzwerk und Kühlung realistisch 2,2 bis 2,8 kW. Rechnen Sie diesen Wert in die Dreijahreskosten ein.

Lohnt sich der Eigenbetrieb gegenüber SaaS überhaupt?

Ab etwa 40 bis 60 aktiven Fachnutzern mit regelmäßiger Nutzung kippt die Rechnung typischerweise zugunsten des Eigenbetriebs. Die detaillierte Gegenüberstellung finden Sie in unserem TCO-Vergleich.

Primärquellen

Weiterführende Artikel