# Hardware Assessment — GPU Server für LLM-Workloads Date: 2026-07-06 Status: Draft for internal review Budget: ~50.000 € ## TL;DR Die Beobachtung vom Bestandsserver (CPU < 10 %, RAM < 150 GB, GPUs zeitweise voll ausgelastet) ist typisch: **LLM-Inference ist fast reine GPU-Last.** Downscaling von CPU und RAM ist richtig. Bei der GPU empfehle ich statt einer halben H100-NVL-Konfiguration die **NVIDIA RTX PRO 6000 Blackwell Server Edition (96 GB)** — mehr VRAM als eine H100 NVL, in Single-GPU-Inference- Benchmarks gleichauf oder schneller, für etwa **ein Drittel des Preises** (~9–10 k€ statt ~31 k€). Gesamtsystem landet grob bei **20–25 k€ inkl. Support** — deutlich unter Budget. ## 1. Einordnung des Bestandsservers Die Referenz-Konfiguration (DL380a Gen11, 2× Xeon 6526Y, 512 GB RAM, 2× H100 NVL) ist für den Inference-Use-Case überdimensioniert: - **CPU < 10 %**: erwartbar — bei GPU-Inference macht die CPU nur Tokenizing, Scheduling und I/O. 2× 16 Kerne sind unnötig. - **RAM < 100–150 GB**: davon ist erfahrungsgemäß ein großer Teil Page-Cache. Echter Bedarf: Modell-Staging + Services, deutlich unter 128 GB. - **2× H100 NVL**: NVLink-Pärchen lohnt sich nur, wenn ein Modell über beide GPUs gespannt wird (Tensor-Parallel). Für Modelle ≤ 96 GB unnötig. ## 2. GPU-Empfehlung | | RTX PRO 6000 Blackwell SE | H100 NVL | L40S | |---|---|---|---| | VRAM | **96 GB GDDR7** | 94 GB HBM3 | 48 GB GDDR6 | | Speicherbandbreite | 1.792 GB/s | 3.900 GB/s | 864 GB/s | | FP8/FP4 | ✅ / ✅ (Blackwell) | ✅ / ❌ | ❌ / ❌ | | NVLink | ❌ (hier irrelevant, 1 GPU) | ✅ | ❌ | | Straßenpreis (ca.) | **~9–10 k€** | ~31 k€ | ~8 k€ | - Benchmarks 2026 zeigen die RTX PRO 6000 bei Single-GPU-LLM-Inference **gleichauf bis vor der H100** bei ~28 % niedrigeren Kosten pro Token ([cloudrift.ai](https://www.cloudrift.ai/blog/benchmarking-rtx6000-vs-datacenter-gpus), [openmetal.io](https://openmetal.io/resources/blog/comparing-the-nvidia-rtx-pro-6000-vs-h100-for-ai-inference/)). - Gegenüber der in den Notizen angesetzten 48-GB-Karte (L40S-Klasse): doppelter VRAM und > 2× Bandbreite für ähnliches Geld — 96 GB erlauben 70B-Modelle in FP8 bzw. viel KV-Cache für parallele Nutzer ([gpuperhour.com](https://gpuperhour.com/compare/l40s-vs-rtx-pro-6000-blackwell)). - H100 NVL nur dann, wenn später auf 2 GPUs mit Tensor-Parallelität erweitert werden soll — dafür gibt es hier kein Anzeichen. ⚠️ Mit dem Distributor klären, welche HPE-Plattform (DL380 Gen11/Gen12 bzw. DL380a) für die RTX PRO 6000 Blackwell SE qualifiziert ist. ## 3. Empfohlene Konfiguration (angelehnt an das Referenz-Angebot) | Komponente | Referenz-Server | Empfehlung neu | Begründung | |---|---|---|---| | Chassis | DL380a Gen11 | DL380 Gen11/Gen12 mit GPU-Kit (oder DL380a) | 1 GPU braucht kein 4-GPU-Chassis | | CPU | 2× Xeon 6526Y (32C) | **1× Xeon 16C** (z. B. 6526Y o. kleiner) | CPU-Last < 10 % beobachtet | | RAM | 512 GB (8× 64 GB) | **128 GB (8× 16 GB)** | Alle 8 Kanäle belegt (Bandbreite), Upgrade-Pfad auf 256 GB frei | | Boot-SSD | 2× 960 GB NVMe | 2× 960 GB NVMe (RAID 1) | unverändert | | Daten-SSD | — | **+ 2× 3,84 TB NVMe (RAID 1)** | Modelle + Vektor-Index der Datei-Suche | | NIC | 2× 25 GbE + 4× 1 GbE | 1× 25/10 GbE SFP28 + 1 GbE (Mgmt) | Indizierung zieht die SMB-Shares übers Netz — 1 GbE wäre der Flaschenhals | | GPU | 2× H100 NVL 94 GB | **1× RTX PRO 6000 Blackwell SE 96 GB** | s. o. | | PSU | 4× 1800–2200 W | 2× 1800 W (redundant) | 1 GPU à 600 W | | iLO Adv + Support | 5 J. | 5 J. Tech Care Essential | unverändert | **Grobe Kostenschätzung:** Server-Basis + CPU + RAM + Storage ≈ 10–12 k€, GPU ≈ 9–10 k€, Support ≈ 4–6 k€ → **~23–28 k€**. Es bleibt Budget für Einrichtung/Software-Dienstleistung (RAG-Pipeline!) und ggf. eine zweite GPU später — das Chassis dafür gleich mit einplanen (Riser/Netzteile). ## 4. Passt eine GPU für "viele Nutzer"? Ja, für den beschriebenen Fall (Nicht-Power-User, Chat + Datei-Suche): - Nicht-Power-User erzeugen wenig gleichzeitige Last; realistisch sind 5–20 parallele Anfragen selbst bei 100+ angebundenen Usern. - vLLM mit einem 20–32B-Modell in FP8 auf 96 GB bedient das komfortabel; ein 70B-Modell geht ebenfalls, mit weniger Parallelitäts-Headroom. - Wachstumspfad: zweite RTX PRO 6000 nachrüsten (zwei unabhängige vLLM-Instanzen bzw. Modell-Replikation — kein NVLink nötig). ## Quellen - [RTX PRO 6000 vs H100/H200/L40S LLM Inference Benchmarks (cloudrift.ai)](https://www.cloudrift.ai/blog/benchmarking-rtx6000-vs-datacenter-gpus) - [RTX PRO 6000 Pricing July 2026 (Thunder Compute)](https://www.thundercompute.com/blog/nvidia-rtx-pro-6000-pricing) - [L40S vs RTX PRO 6000 (gpuperhour)](https://gpuperhour.com/compare/l40s-vs-rtx-pro-6000-blackwell) - [RTX PRO 6000 vs H100 for AI Inference (OpenMetal)](https://openmetal.io/resources/blog/comparing-the-nvidia-rtx-pro-6000-vs-h100-for-ai-inference/) - [RTX PRO 6000 Benchmarks: 30B AWQ, 70B FP8, Cost per Mtok (Spheron)](https://www.spheron.network/blog/rent-nvidia-rtx-pro-6000/)