Die NVIDIA DGX Spark ist der kompakte KI-Server für Unternehmen, die größer denken als eine RTX-5090, aber keinen Rack-Server im Keller brauchen. Mit 128 GB Unified Memory, 1 PetaFLOP Rechenleistung und einer integrierten CPU/GPU-Architektur (Grace Blackwell, GB10 Superchip) ist sie die Antwort auf die Frage: «Kann ein einzelner Desktop-Server 50–100 Mitarbeiter lokal bedienen?»
Die kurze Antwort: Ja, für die meisten KMU-Text- und RAG-Anwendungen. Aber – und das ist der Punkt – «Anfragen pro Sekunde» ist bei einer LLM die falsche Metrik. Was wirklich zählt: Wie viele Mitarbeiter können gleichzeitig fragen, wie lang sind die Antworten, und wie schnell ist die Maschine dabei? Genau das rechnen wir im Folgenden durch.
Die Hardware-Zahlen, die Sie kennen sollten
Die DGX Spark ist ein All-in-One-Desktop-Server (ca. die Größe eines kompakten Desktop-PCs) mit folgenden Kernwerten:
| Komponente | Wert | Was das für Sie bedeutet |
|---|---|---|
| CPU + GPU | Grace Blackwell GB10 Superchip, 20 CPU-Kerne + 6.144 CUDA-Kerne | Ein Chip, der CPU- und GPU-Aufgaben vereint – kein Daten-Transfer zwischen zwei Prozessoren |
| Memory | 128 GB Unified LPDDR5x | CPU und GPU teilen sich denselben Speicher – ein 70B-Modell + Kontext + mehrere Sessions passen rein |
| Memory-Bandbreite | 273 GB/s | Der entscheidende Wert für LLM-Geschwindigkeit – je mehr Bandbreite, desto mehr Tokens pro Sekunde |
| Rechenleistung | 1 PetaFLOP | Genug, um große Modelle zu betreiben – aber der Flaschenhains ist die Bandbreite, nicht die FLOPs |
| Strom | ~100–200 W im Lastfall, ~30–50 W im Idle | deutlich sparsamer als eine RTX-5090-Maschine, die ~600–800 W im Lastfall zieht |
Der wichtigste Wert ist die Memory-Bandbreite (273 GB/s). LLM-Inferenz ist bandbreitenlimitiert, nicht rechenlimitiert: Das Modell muss bei jedem Token die gesamten Gewichtungen durch den Speicher lesen. Je mehr Bandbreite, desto schneller die Antwort. Die DGX Spark hat damit für ihre Größe sehr gute Bandbreite – nicht die einer H100 oder A100, aber deutlich mehr als eine RTX-4090/5090.
Wie viele Anfragen pro Sekunde – die ehrliche Rechnung
Eine LLM erzeugt keine «Anfragen pro Sekunde» wie ein Webserver. Eine Anfrage ist die Erzeugung von 100–2.000 Tokens. Bei der DGX Spark mit typischen Modellen:
| Modell | Speicher | Tokens/Sekunde (1 User) | Dauer einer 500-Token-Antwort |
|---|---|---|---|
| 7B Q4 | ~5 GB | 60–100 tok/s | 5–8 Sek. |
| 14B Q6 | ~10 GB | 40–70 tok/s | 8–12 Sek. |
| 70B Q4 | ~40 GB | 25–45 tok/s | 11–20 Sek. |
| 200B Q4 | ~100 GB | 10–20 tok/s | 25–50 Sek. |
Die «Anfragen pro Sekunde»-Frage ist damit falsch gestellt. Die richtige Frage ist: Wie viele User können parallel 500-Token-Antworten bekommen, bevor die Antwortzeit auf mehr als 20 Sekunden steigt?
Wie viel parallel läuft – der entscheidende Unterschied zur 5090
Der Unterschied zwischen RTX-5090 und DGX Spark ist nicht die Geschwindigkeit pro User, sondern der Parallelitätsspielraum. Die 5090 hat 32 GB VRAM, der Spark hat 128 GB Unified Memory – das sind viermal so viel Speicher.
- RTX-5090 (32 GB): Ein 14B-Modell belegt ~10 GB, plus 2–4 User-Kontexte à ~4–8 GB, plus KV-Cache → 25–30 GB belegt, ~2–5 GB frei. 3–6 gleichzeitige User mit 32K Kontext, dann wird es knapp.
- DGX Spark (128 GB): Ein 70B-Modell belegt ~40 GB, plus 10–20 User-Kontexte à ~4–8 GB, plus KV-Cache → 80–100 GB belegt, ~30–50 GB frei. 15–30 gleichzeitige User mit 32K Kontext, ohne dass die Antwortzeit kippt.
Genau das ist der Kernvorteil: Wenn 20 Mitarbeiter gleichzeitig fragen, spürt die 5090 die Last, der Spark nicht. Der Spark ist der Server für Betriebe, die die KI wirklich im Alltag einsetzen lassen wollen – nicht nur als gelegentliches Tool.
Was die DGX Spark in der Praxis kann – und was nicht
Sehr gut:
- 15–30 Mitarbeiter als primäre lokale KI-Instanz (Text, RAG, Mails, Summaries, interne Knowledge-Basis).
- 70B-Modelle in Q4–Q6 mit 32K–128K Kontext – der qualitative Sprung gegenüber 14B.
- Einzige Maschine, kein Rack, kein Serverraum, ~100–200 W Strom, leise (im Vergleich zur 5090 mit ihren 575 W TGP).
- RAG über große Dokumentenkorpora (10.000–100.000 Dokumente) – genug Speicher für Vektordatenbank + Modell + Kontext.
Weniger gut / nicht dafür gebaut:
- Heavy Bild-/Video-Generierung (Stable Diffusion, Sora-ähnliches) – das braucht dedizierte GPU-Hardware mit mehr VRAM-Bandbreite.
- Sehr große Multimodal-Modelle (Vision + Sprache, >200B) – möglich, aber langsam.
- 100+ gleichzeitige User mit 128K Kontext – dann reicht selbst der Spark nicht, dann brauchen Sie zwei Instanzen.
Die DGX Spark ist der Sweet Spot für den österreichischen Mittelstand: groß genug für die meisten KMU, kompakt genug, um auf einen Schreibtisch zu passen, sparsam genug, um die Stromrechnung nicht sprengen zu lassen.
Die klare Empfehlung
Die DGX Spark ist die richtige Antwort, wenn:
- Ihr Betrieb 15–100 Mitarbeiter hat und die KI von den meisten aktiv genutzt wird.
- Sie 70B-Modelle fahren wollen (bessere Qualität bei RAG, Fachaufgaben, langem Kontext).
- Sie keinen dedizierten Serverraum haben und einen kompakten Desktop-Server auf dem Schreibtisch oder im Büro wollen.
- Sie Sparsamkeit wollen: ~100–200 W im Lastfall statt ~600–800 W einer RTX-5090-Maschine.
Wenn Sie klein starten und nur 5–15 Mitarbeiter die KI aktiv nutzen, ist die RTX-5090 der günstigere Einstieg. Wenn Sie von Anfang an groß denken und 30+ Mitarbeiter bedienen wollen, ist die DGX Spark die richtige Wahl – ohne dass Sie später umziehen müssen. LokaleKI setzt beide auf – ab 2.000 € für das Setup, zzgl. Hardware zum jeweils günstigsten Preis – mit dem Modell, der RAG-Konfiguration und dem Monitoring, die zu Ihrem Betrieb passen.