Vergleich: GPU-Sizing für ein 70B-Modell — L40S vs. H100 vs. MI300X
Speicherbedarf, Tokens pro Sekunde, Stromaufnahme und Beschaffbarkeit: der nüchterne Vergleich dreier Beschleuniger für den souveränen Betrieb eines 70-Milliarden-Parameter-Modells.

Das Wichtigste auf einen Blick
- Ein 70B-Modell braucht in FP16 rund 140 GB Speicher — in FP8 genügt eine einzelne MI300X, in INT4 auch eine H100.
- Generative Inferenz ist bandbreitengebunden: die Speicherbandbreite bestimmt die Tokens pro Sekunde stärker als die Rechenleistung.
- L40S ist die günstigste Einstiegsoption für Piloten, skaliert über PCIe aber schlecht auf mehr als vier Karten.
- H100 SXM liefert die beste Latenz je Nutzer, MI300X den günstigsten Speicher je Gigabyte und den einfachsten Einzelkartenbetrieb.
- Unterdimensionierung erzeugt Wartezeiten, Wartezeiten erzeugen Schatten-IT — Sizing ist damit auch eine Datenschutzmaßnahme.
01Warum GPU-Sizing die teuerste Fehlentscheidung im souveränen KI-Betrieb ist
Wer ein 70-Milliarden-Parameter-Modell im eigenen Rechenzentrum betreiben will, entscheidet mit der GPU-Auswahl über drei Jahre Kostenstruktur, über die erreichbare Antwortzeit und indirekt über die Nachweisfähigkeit gegenüber BSI und Marktüberwachung. Die Hardware ist der einzige Posten, den Sie nach dem Kauf nicht mehr elastisch anpassen können.
Der Vergleich in diesem Beitrag betrachtet drei in Europa realistisch beschaffbare Beschleuniger: NVIDIA L40S (48 GB GDDR6, PCIe), NVIDIA H100 (80 GB HBM3, SXM oder PCIe) und AMD Instinct MI300X (192 GB HBM3). Bewertet werden Speicherbedarf, Durchsatz, Betriebsaufwand und Beschaffbarkeit — nicht Benchmark-Spitzenwerte.
02Speicherbedarf: was ein 70B-Modell tatsächlich belegt
Die Quantisierung entscheidet, wie viele Karten Sie brauchen. Die folgende Tabelle zeigt den reinen Gewichtsbedarf und die praxisnahe Mindestbestückung inklusive KV-Cache für 8k Kontext und moderate Nebenläufigkeit.
| Quantisierung | Gewichte | Praxisbedarf inkl. KV-Cache | Mindestbestückung L40S (48 GB) | Mindestbestückung H100 (80 GB) | Mindestbestückung MI300X (192 GB) |
|---|---|---|---|---|---|
| FP16 / BF16 | ca. 140 GB | 170–200 GB | 4–5 Karten | 3 Karten | 2 Karten |
| FP8 | ca. 70 GB | 95–115 GB | 3 Karten | 2 Karten | 1 Karte |
| INT4 / AWQ | ca. 37 GB | 55–70 GB | 2 Karten | 1 Karte | 1 Karte |
Die Zahl der Karten ist kein reiner Kostenfaktor. Jede zusätzliche Karte bedeutet Tensor-Parallelität über NVLink oder PCIe — und damit Kommunikationsaufwand, der bei PCIe-Systemen wie dem L40S deutlich stärker durchschlägt als bei NVLink-gekoppelten H100-Knoten.
03Direktvergleich: L40S, H100 und MI300X im Betriebsprofil
Die folgende Gegenüberstellung fasst die betrieblich relevanten Eigenschaften zusammen. Preisangaben sind Orientierungswerte für den deutschen Markt im Jahr 2026 und variieren je nach Abnahmemenge und Systemintegrator.
| Kriterium | L40S | H100 SXM | MI300X |
|---|---|---|---|
| Speicher | 48 GB GDDR6 | 80 GB HBM3 | 192 GB HBM3 |
| Speicherbandbreite | ca. 864 GB/s | ca. 3,35 TB/s | ca. 5,3 TB/s |
| Verbrauch (TDP) | 350 W | 700 W | 750 W |
| Kopplung | PCIe | NVLink | Infinity Fabric |
| Rack-Anforderung | Luftkühlung möglich | Wasserkühlung empfohlen | Wasserkühlung empfohlen |
| Software-Reife | CUDA, ausgereift | CUDA, ausgereift | ROCm, gute Abdeckung für gängige Inferenz-Stacks |
| Beschaffbarkeit DE | gut | angespannt | mittel, wachsend |
| Listenpreis je Karte | ca. 8.000–11.000 € | ca. 28.000–35.000 € | ca. 20.000–26.000 € |
Der entscheidende Unterschied liegt in der Speicherbandbreite. Generative Inferenz ist im Decoding-Schritt bandbreitengebunden, nicht rechengebunden. Ein L40S liefert deshalb trotz solider Rechenleistung erheblich weniger Tokens pro Sekunde als sein Preis vermuten lässt.
04Durchsatz und Latenz: was Sie pro Sekunde erwarten dürfen
Die folgenden Richtwerte gelten für ein 70B-Modell in FP8 mit vLLM oder einem vergleichbaren Serving-Stack, 8k Kontext und Batchgrößen im typischen Unternehmensbetrieb. Sie ersetzen keinen eigenen Lasttest, geben aber die Größenordnung verlässlich wieder.
| Konfiguration | Tokens/s je Nutzer | Gesamtdurchsatz bei 16 parallelen Anfragen | Bemerkung |
|---|---|---|---|
| 4× L40S | 12–18 | 150–250 Tokens/s | PCIe-Kommunikation limitiert die Skalierung |
| 2× H100 SXM | 35–50 | 550–800 Tokens/s | bestes Verhältnis Latenz zu Komplexität |
| 1× MI300X | 30–45 | 450–700 Tokens/s | Einzelkarte, keine Tensor-Parallelität nötig |
| 8× H100 SXM | 45–60 | 1.800–2.600 Tokens/s | für Mandantenbetrieb oder mehrere Modelle |
05Entscheidungslogik nach Einsatzszenario
Es gibt keine generell beste Karte. Es gibt drei klar unterscheidbare Ausgangslagen, die jeweils eine andere Antwort verlangen.
| Szenario | Empfehlung | Begründung |
|---|---|---|
| Pilot, 10–30 Fachnutzer, bestehendes luftgekühltes Rack | 2–4× L40S mit INT4/FP8 | niedrigste Einstiegshürde, keine Rechenzentrumsumbauten |
| Produktivbetrieb, 100+ Nutzer, RAG und Dokumentenanalyse | 2–4× H100 SXM | beste Latenz, ausgereifter CUDA-Stack, breite Toolunterstützung |
| Ein großes Modell, minimale Knotenanzahl, Kostendruck je GB Speicher | 1–2× MI300X | 192 GB je Karte vermeiden Tensor-Parallelität komplett |
| Mehrere Modelle parallel, Mandantentrennung | 8× H100 oder 4× MI300X | Isolation je Modell statt Zeitscheibenbetrieb |
Vor der Beschaffung zu klären
- Zielwert für Tokens pro Sekunde und Nutzer bei Spitzenlast schriftlich festgelegt
- Maximale Kontextlänge und erwartete Zahl paralleler Anfragen dokumentiert
- Quantisierungsstrategie mit den Fachbereichen auf Qualitätsverlust geprüft
- Stromanschluss und Kühlleistung je Rack gegen die TDP der Zielbestückung gerechnet
- Serving-Stack (vLLM, TGI, TensorRT-LLM oder ROCm-Äquivalent) auf Kompatibilität getestet
- Lieferzeit und Ersatzteilverfügbarkeit vertraglich zugesichert
- Exit-Szenario definiert: Was passiert mit der Hardware, wenn das Modell gewechselt wird?
06Regulatorische Nebenwirkungen der Hardwarewahl
Die GPU-Entscheidung ist auch eine Compliance-Entscheidung. Wer On-Premises betreibt, übernimmt Pflichten, die bei einem SaaS-Anbieter beim Dienstleister lägen — behält dafür aber die volle Kontrolle über Protokollierung und Datenfluss.
Nachweisfähigkeit im Eigenbetrieb
- Protokollierung der Modellzugriffe erfüllt die Anforderungen aus Art. 12 KI-VO
- Verfügbarkeits- und Wiederanlaufkonzept ist Teil der NIS2-Risikomaßnahmen
- Patchstand von Treibern, Firmware und Serving-Stack ist dokumentiert und auditierbar
- Physische Zutrittskontrolle zum GPU-Rack ist geregelt
- Kapazitätsplanung ist als Kontinuitätsmaßnahme dokumentiert
Ein häufig übersehener Punkt: Unterdimensionierte Hardware führt zu Wartezeiten, Wartezeiten führen zu Schatten-IT, und Schatten-IT ist der schnellste Weg, personenbezogene Daten in einem nicht bewerteten Drittlandsdienst zu verarbeiten. Sizing ist damit auch eine Datenschutzmaßnahme.
Häufige Fragen
Reicht eine einzelne GPU für ein 70B-Modell?
Nur mit aggressiver Quantisierung. Eine MI300X mit 192 GB trägt ein 70B-Modell in FP8 problemlos allein, eine H100 mit 80 GB erst ab INT4. Beim L40S mit 48 GB ist der Einzelkartenbetrieb für 70B nicht praxistauglich.
Wie stark verliert ein Modell durch Quantisierung an Qualität?
FP8 ist in der Praxis nahezu verlustfrei. INT4 kostet je nach Verfahren spürbar Qualität bei Aufgaben mit langen Schlussketten, ist für Zusammenfassungen und Klassifikation aber meist unproblematisch. Prüfen Sie den Verlust immer an eigenen Fachdaten, nicht an öffentlichen Benchmarks.
Ist AMD ROCm für Produktivbetrieb reif genug?
Für gängige Inferenz-Stacks ja. Die Abdeckung populärer Serving-Frameworks ist gut, die Werkzeuglandschaft rund um Feinabstimmung und Profiling bleibt gegenüber CUDA schmaler. Wer ausschließlich Inferenz betreibt, hat mit MI300X ein tragfähiges Angebot.
Wie viel Strom braucht eine 70B-Installation?
Eine Bestückung mit zwei H100 SXM zieht unter Last rund 1,4 kW allein für die Beschleuniger, zuzüglich Host, Netzwerk und Kühlung realistisch 2,2 bis 2,8 kW. Rechnen Sie diesen Wert in die Dreijahreskosten ein.
Lohnt sich der Eigenbetrieb gegenüber SaaS überhaupt?
Ab etwa 40 bis 60 aktiven Fachnutzern mit regelmäßiger Nutzung kippt die Rechnung typischerweise zugunsten des Eigenbetriebs. Die detaillierte Gegenüberstellung finden Sie in unserem TCO-Vergleich.
Primärquellen
- Verordnung (EU) 2024/1689 über künstliche Intelligenz
Amt für Veröffentlichungen der EU · 2024-07-12
- Richtlinie (EU) 2022/2555 (NIS2)
Amt für Veröffentlichungen der EU · 2022-12-27
- BSI-Grundschutz-Baustein SYS.1.9 Terminalserver und Rechenzentrumsbetrieb
Bundesamt für Sicherheit in der Informationstechnik · 2025-02-01
- Energieeffizienzgesetz (EnEfG), Anforderungen an Rechenzentren
Bundesministerium für Wirtschaft und Klimaschutz · 2023-11-17
Weiterführende Artikel
Vergleich: On-Prem vs. private Cloud vs. SaaS-LLM — TCO über drei Jahre
21. August 2026 · 11 Min.
Lokale KI im Unternehmen: Referenzarchitektur für souveränen Betrieb
19. August 2026 · 11 Min.
Unterliegt Ihr KI-Anbieter der NIS2? Ein 10-Fragen-Test
14. August 2026 · 11 Min.
Souveräne KI in Deutschland: was hinter den Umfragen steckt
26. August 2026 · 9 Min.