Add base plays for all hosts, nvidia_gpu role, GPU pre-work items
- run.yml: base plays (geerlingguy.security) for jira and git; gpu01 play with security + docker + nvidia_gpu - roles/nvidia_gpu: driver pinned >=580 (Blackwell), CUDA repo, container toolkit incl. the nvidia-ctk runtime configure step - manuals/20260714-nvidia-driver-install.md: dated per convention, corrected (pinned -server driver instead of autoinstall+cuda-drivers mix, toolkit optional, added missing nvidia-ctk/docker restart step) - gpu01 folder: planning docs under notes/, runbooks under manuals/, scripts/; convention documented in CLAUDE.md - scripts/share-analysis.ps1: read-only SMB share analysis for the Windows server (projektplan §2.1) - TODO.md: Phase-0 pre-work items from the projektplan Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
This commit is contained in:
@@ -0,0 +1,90 @@
|
||||
# Hardware Assessment — GPU Server für LLM-Workloads
|
||||
|
||||
Date: 2026-07-06
|
||||
Status: Draft for internal review
|
||||
Budget: ~50.000 €
|
||||
|
||||
## TL;DR
|
||||
|
||||
Die Beobachtung vom Bestandsserver (CPU < 10 %, RAM < 150 GB, GPUs zeitweise
|
||||
voll ausgelastet) ist typisch: **LLM-Inference ist fast reine GPU-Last.**
|
||||
Downscaling von CPU und RAM ist richtig. Bei der GPU empfehle ich statt einer
|
||||
halben H100-NVL-Konfiguration die **NVIDIA RTX PRO 6000 Blackwell Server
|
||||
Edition (96 GB)** — mehr VRAM als eine H100 NVL, in Single-GPU-Inference-
|
||||
Benchmarks gleichauf oder schneller, für etwa **ein Drittel des Preises**
|
||||
(~9–10 k€ statt ~31 k€). Gesamtsystem landet grob bei **20–25 k€ inkl.
|
||||
Support** — deutlich unter Budget.
|
||||
|
||||
## 1. Einordnung des Bestandsservers
|
||||
|
||||
Die Referenz-Konfiguration (DL380a Gen11, 2× Xeon 6526Y, 512 GB RAM,
|
||||
2× H100 NVL) ist für den Inference-Use-Case überdimensioniert:
|
||||
|
||||
- **CPU < 10 %**: erwartbar — bei GPU-Inference macht die CPU nur
|
||||
Tokenizing, Scheduling und I/O. 2× 16 Kerne sind unnötig.
|
||||
- **RAM < 100–150 GB**: davon ist erfahrungsgemäß ein großer Teil
|
||||
Page-Cache. Echter Bedarf: Modell-Staging + Services, deutlich unter 128 GB.
|
||||
- **2× H100 NVL**: NVLink-Pärchen lohnt sich nur, wenn ein Modell über beide
|
||||
GPUs gespannt wird (Tensor-Parallel). Für Modelle ≤ 96 GB unnötig.
|
||||
|
||||
## 2. GPU-Empfehlung
|
||||
|
||||
| | RTX PRO 6000 Blackwell SE | H100 NVL | L40S |
|
||||
|---|---|---|---|
|
||||
| VRAM | **96 GB GDDR7** | 94 GB HBM3 | 48 GB GDDR6 |
|
||||
| Speicherbandbreite | 1.792 GB/s | 3.900 GB/s | 864 GB/s |
|
||||
| FP8/FP4 | ✅ / ✅ (Blackwell) | ✅ / ❌ | ❌ / ❌ |
|
||||
| NVLink | ❌ (hier irrelevant, 1 GPU) | ✅ | ❌ |
|
||||
| Straßenpreis (ca.) | **~9–10 k€** | ~31 k€ | ~8 k€ |
|
||||
|
||||
- Benchmarks 2026 zeigen die RTX PRO 6000 bei Single-GPU-LLM-Inference
|
||||
**gleichauf bis vor der H100** bei ~28 % niedrigeren Kosten pro Token
|
||||
([cloudrift.ai](https://www.cloudrift.ai/blog/benchmarking-rtx6000-vs-datacenter-gpus),
|
||||
[openmetal.io](https://openmetal.io/resources/blog/comparing-the-nvidia-rtx-pro-6000-vs-h100-for-ai-inference/)).
|
||||
- Gegenüber der in den Notizen angesetzten 48-GB-Karte (L40S-Klasse):
|
||||
doppelter VRAM und > 2× Bandbreite für ähnliches Geld — 96 GB erlauben
|
||||
70B-Modelle in FP8 bzw. viel KV-Cache für parallele Nutzer
|
||||
([gpuperhour.com](https://gpuperhour.com/compare/l40s-vs-rtx-pro-6000-blackwell)).
|
||||
- H100 NVL nur dann, wenn später auf 2 GPUs mit Tensor-Parallelität erweitert
|
||||
werden soll — dafür gibt es hier kein Anzeichen.
|
||||
|
||||
⚠️ Mit dem Distributor klären, welche HPE-Plattform (DL380 Gen11/Gen12 bzw.
|
||||
DL380a) für die RTX PRO 6000 Blackwell SE qualifiziert ist.
|
||||
|
||||
## 3. Empfohlene Konfiguration (angelehnt an das Referenz-Angebot)
|
||||
|
||||
| Komponente | Referenz-Server | Empfehlung neu | Begründung |
|
||||
|---|---|---|---|
|
||||
| Chassis | DL380a Gen11 | DL380 Gen11/Gen12 mit GPU-Kit (oder DL380a) | 1 GPU braucht kein 4-GPU-Chassis |
|
||||
| CPU | 2× Xeon 6526Y (32C) | **1× Xeon 16C** (z. B. 6526Y o. kleiner) | CPU-Last < 10 % beobachtet |
|
||||
| RAM | 512 GB (8× 64 GB) | **128 GB (8× 16 GB)** | Alle 8 Kanäle belegt (Bandbreite), Upgrade-Pfad auf 256 GB frei |
|
||||
| Boot-SSD | 2× 960 GB NVMe | 2× 960 GB NVMe (RAID 1) | unverändert |
|
||||
| Daten-SSD | — | **+ 2× 3,84 TB NVMe (RAID 1)** | Modelle + Vektor-Index der Datei-Suche |
|
||||
| NIC | 2× 25 GbE + 4× 1 GbE | 1× 25/10 GbE SFP28 + 1 GbE (Mgmt) | Indizierung zieht die SMB-Shares übers Netz — 1 GbE wäre der Flaschenhals |
|
||||
| GPU | 2× H100 NVL 94 GB | **1× RTX PRO 6000 Blackwell SE 96 GB** | s. o. |
|
||||
| PSU | 4× 1800–2200 W | 2× 1800 W (redundant) | 1 GPU à 600 W |
|
||||
| iLO Adv + Support | 5 J. | 5 J. Tech Care Essential | unverändert |
|
||||
|
||||
**Grobe Kostenschätzung:** Server-Basis + CPU + RAM + Storage ≈ 10–12 k€,
|
||||
GPU ≈ 9–10 k€, Support ≈ 4–6 k€ → **~23–28 k€**. Es bleibt Budget für
|
||||
Einrichtung/Software-Dienstleistung (RAG-Pipeline!) und ggf. eine zweite GPU
|
||||
später — das Chassis dafür gleich mit einplanen (Riser/Netzteile).
|
||||
|
||||
## 4. Passt eine GPU für "viele Nutzer"?
|
||||
|
||||
Ja, für den beschriebenen Fall (Nicht-Power-User, Chat + Datei-Suche):
|
||||
|
||||
- Nicht-Power-User erzeugen wenig gleichzeitige Last; realistisch sind
|
||||
5–20 parallele Anfragen selbst bei 100+ angebundenen Usern.
|
||||
- vLLM mit einem 20–32B-Modell in FP8 auf 96 GB bedient das komfortabel;
|
||||
ein 70B-Modell geht ebenfalls, mit weniger Parallelitäts-Headroom.
|
||||
- Wachstumspfad: zweite RTX PRO 6000 nachrüsten (zwei unabhängige
|
||||
vLLM-Instanzen bzw. Modell-Replikation — kein NVLink nötig).
|
||||
|
||||
## Quellen
|
||||
|
||||
- [RTX PRO 6000 vs H100/H200/L40S LLM Inference Benchmarks (cloudrift.ai)](https://www.cloudrift.ai/blog/benchmarking-rtx6000-vs-datacenter-gpus)
|
||||
- [RTX PRO 6000 Pricing July 2026 (Thunder Compute)](https://www.thundercompute.com/blog/nvidia-rtx-pro-6000-pricing)
|
||||
- [L40S vs RTX PRO 6000 (gpuperhour)](https://gpuperhour.com/compare/l40s-vs-rtx-pro-6000-blackwell)
|
||||
- [RTX PRO 6000 vs H100 for AI Inference (OpenMetal)](https://openmetal.io/resources/blog/comparing-the-nvidia-rtx-pro-6000-vs-h100-for-ai-inference/)
|
||||
- [RTX PRO 6000 Benchmarks: 30B AWQ, 70B FP8, Cost per Mtok (Spheron)](https://www.spheron.network/blog/rent-nvidia-rtx-pro-6000/)
|
||||
Reference in New Issue
Block a user