Hardware

DGX Spark im Detail: 128 GB Unified Memory und die reale Parallelität

Start  /  Artikel  /  NVIDIA DGX Spark: wie viele Anfragen pro Sekunde – und was wirklich parallel läuft

Die NVIDIA DGX Spark ist der kompakte KI-Server für Unternehmen, die größer denken als eine RTX-5090, aber keinen Rack-Server im Keller brauchen. Mit 128 GB Unified Memory, 1 PetaFLOP Rechenleistung und einer integrierten CPU/GPU-Architektur (Grace Blackwell, GB10 Superchip) ist sie die Antwort auf die Frage: «Kann ein einzelner Desktop-Server 50–100 Mitarbeiter lokal bedienen?»

Die kurze Antwort: Ja, für die meisten KMU-Text- und RAG-Anwendungen. Aber – und das ist der Punkt – «Anfragen pro Sekunde» ist bei einer LLM die falsche Metrik. Was wirklich zählt: Wie viele Mitarbeiter können gleichzeitig fragen, wie lang sind die Antworten, und wie schnell ist die Maschine dabei? Genau das rechnen wir im Folgenden durch.

Die Hardware-Zahlen, die Sie kennen sollten

Die DGX Spark ist ein All-in-One-Desktop-Server (ca. die Größe eines kompakten Desktop-PCs) mit folgenden Kernwerten:

KomponenteWertWas das für Sie bedeutet
CPU + GPUGrace Blackwell GB10 Superchip, 20 CPU-Kerne + 6.144 CUDA-KerneEin Chip, der CPU- und GPU-Aufgaben vereint – kein Daten-Transfer zwischen zwei Prozessoren
Memory128 GB Unified LPDDR5xCPU und GPU teilen sich denselben Speicher – ein 70B-Modell + Kontext + mehrere Sessions passen rein
Memory-Bandbreite273 GB/sDer entscheidende Wert für LLM-Geschwindigkeit – je mehr Bandbreite, desto mehr Tokens pro Sekunde
Rechenleistung1 PetaFLOPGenug, um große Modelle zu betreiben – aber der Flaschenhains ist die Bandbreite, nicht die FLOPs
Strom~100–200 W im Lastfall, ~30–50 W im Idledeutlich sparsamer als eine RTX-5090-Maschine, die ~600–800 W im Lastfall zieht

Der wichtigste Wert ist die Memory-Bandbreite (273 GB/s). LLM-Inferenz ist bandbreitenlimitiert, nicht rechenlimitiert: Das Modell muss bei jedem Token die gesamten Gewichtungen durch den Speicher lesen. Je mehr Bandbreite, desto schneller die Antwort. Die DGX Spark hat damit für ihre Größe sehr gute Bandbreite – nicht die einer H100 oder A100, aber deutlich mehr als eine RTX-4090/5090.

Wie viele Anfragen pro Sekunde – die ehrliche Rechnung

Eine LLM erzeugt keine «Anfragen pro Sekunde» wie ein Webserver. Eine Anfrage ist die Erzeugung von 100–2.000 Tokens. Bei der DGX Spark mit typischen Modellen:

ModellSpeicherTokens/Sekunde (1 User)Dauer einer 500-Token-Antwort
7B Q4~5 GB60–100 tok/s5–8 Sek.
14B Q6~10 GB40–70 tok/s8–12 Sek.
70B Q4~40 GB25–45 tok/s11–20 Sek.
200B Q4~100 GB10–20 tok/s25–50 Sek.

Die «Anfragen pro Sekunde»-Frage ist damit falsch gestellt. Die richtige Frage ist: Wie viele User können parallel 500-Token-Antworten bekommen, bevor die Antwortzeit auf mehr als 20 Sekunden steigt?

Wie viel parallel läuft – der entscheidende Unterschied zur 5090

Der Unterschied zwischen RTX-5090 und DGX Spark ist nicht die Geschwindigkeit pro User, sondern der Parallelitätsspielraum. Die 5090 hat 32 GB VRAM, der Spark hat 128 GB Unified Memory – das sind viermal so viel Speicher.

Genau das ist der Kernvorteil: Wenn 20 Mitarbeiter gleichzeitig fragen, spürt die 5090 die Last, der Spark nicht. Der Spark ist der Server für Betriebe, die die KI wirklich im Alltag einsetzen lassen wollen – nicht nur als gelegentliches Tool.

Was die DGX Spark in der Praxis kann – und was nicht

Sehr gut:

Weniger gut / nicht dafür gebaut:

Die DGX Spark ist der Sweet Spot für den österreichischen Mittelstand: groß genug für die meisten KMU, kompakt genug, um auf einen Schreibtisch zu passen, sparsam genug, um die Stromrechnung nicht sprengen zu lassen.

Die klare Empfehlung

Die DGX Spark ist die richtige Antwort, wenn:

Wenn Sie klein starten und nur 5–15 Mitarbeiter die KI aktiv nutzen, ist die RTX-5090 der günstigere Einstieg. Wenn Sie von Anfang an groß denken und 30+ Mitarbeiter bedienen wollen, ist die DGX Spark die richtige Wahl – ohne dass Sie später umziehen müssen. LokaleKI setzt beide auf – ab 2.000 € für das Setup, zzgl. Hardware zum jeweils günstigsten Preis – mit dem Modell, der RAG-Konfiguration und dem Monitoring, die zu Ihrem Betrieb passen.

So lösen Sie es – mit lokaler KI

Ein KI-Server direkt in Ihrem Unternehmen. Einmal investieren statt monatelang abonnieren – alle Daten bleiben im Haus.

1

KI-Check – kostenlos

In einem 30-Minuten-Gespräch klären wir Ihre Anforderungen, Ihre Daten und die passende Hardware.

2

Hardware zum günstigsten Preis

Vom kompakten NVIDIA DGX Spark (128 GB) bis zur RTX-5090-Maschine – wir beschaffen, liefern und installieren.

3

Ihr Wissen wird angebunden

Dokumente, Prozesse und Know-how werden lokal verbunden. Jeder Mitarbeiter bekommt eine sichere Chat-Oberfläche.

Installation & Setup ab 2.000 € zzgl. MwSt. · Hardware zum jeweils günstigsten verfügbaren Preis · laufende Wartung zu festen Konditionen

Mehr über die komplette Lösung, Preise und das Vorgehen: Startseite von LokaleKI →