Software-Stack

Ollama, LM Studio, Open WebUI: So arbeiten die drei Komponenten zusammen

Start  /  Artikel  /  Ollama, LM Studio & Open WebUI: der Software-Stack für lokale KI erklärt

Wenn Sie «lokale KI» sagen, meinen Sie in der Regel drei offene Programme, die in einem Rechner zusammenarbeiten: Ollama als die Komponente, die die Modelle lädt und ausführt, LM Studio als das komfortable Download- und Einstell-Tool, und Open WebUI als die Chat-Oberfläche, mit der Ihre Mitarbeiter wirklich arbeiten. Das ist der Standard-Stack, den fast jeder lokale KI-Betrieb verwendet – und den LokaleKI in Ihrem Haus installiert.

Die gute Nachricht: Keines davon braucht ein Abo, eine Cloud oder einen US-Server. Alles läuft auf Ihrer Hardware, Ihre Daten und Prompts bleiben im Haus. Im Folgenden erklären wir, was jede Komponente genau macht, wie sie zusammenpassen – und wie Sie wissen, welche Sie wirklich brauchen.

Die drei Ebenen in einem Satz

Stellen Sie sich das System wie ein Restaurant vor: die Küche kocht, die Karte sagt, was es gibt, und der Service bringt das Essen zum Gast. So auch bei der lokalen KI:

Diese Trennung ist kein Zufall: Jede Komponente hat genau einen Job, dadurch ist das System modular – Sie können Teile austauschen, ohne das Ganze umzukippen.

Ollama: die Rechenkammer im Hintergrund

Ollama ist ein kleines Programm, das als Service im Hintergrund läuft. Sie fragen es per Kommando oder API: «Lade das Modell Llama-3-70B», und es lädt die Gewichte von der Festplatte, legt sie in den Arbeitsspeicher (VRAM) und beantwortet Anfragen. Ollama spricht die offene OpenAI-kompatible API – das bedeutet, dass praktisch jedes Chat-Tool, das an OpenAI angedockt ist, auch an Ollama angedockt werden kann. Genau darauf baut Open WebUI.

Warum ist das clever? Weil Ollama die Hardware ausreizt, aber keine eigene Oberfläche mitschleift. Es macht einen Job sauber: Modelle verwalten und ausführen, mit mehreren Modellen gleichzeitig, mit Kontextsteuerung und sauberem VRAM-Management. Für einen stabilen Betrieb ist es der wichtigste Baustein.

LM Studio: das Tool, mit dem Sie die Hardware bestücken

LM Studio ist ein grafisches Programm (Windows, Mac, Linux), mit dem Sie Modelle bequem aus dem Hugging-Face-Katalog laden, quantisierte Varianten auswählen und sofort testen. Es zeigt Ihnen live: Wie viel VRAM wird belegt, wie schnell erzeugt das Modell, wie hoch die GPU-Temperatur? Damit finden Sie den Sweet-Spot zwischen Modellgröße, Quantisierung und Geschwindigkeit – zum Beispiel «Q6-Kompression, 14B-Modell, 32K Kontext, bei 45 Tokens pro Sekunde».

In einem professionellen Setup nutzen wir LM Studio vor allem einmalig, beim Inbetriebnehmen: um die für Ihre Anwendung beste Modell-/Quantisierungskombination zu finden und dann in Ollama zu verankern. Ihr Alltag läuft danach über Ollama + Open WebUI, LM Studio bleibt als Werkzeug in der Tasche.

Open WebUI: die Oberfläche, die Ihre Mitarbeiter sehen

Open WebUI ist die Chat-Oberfläche im Browser. Es sieht aus wie ChatGPT, aber alles bleibt im Haus: Benutzerverwaltung, Gruppen, Datei-Uploads, RAG-Integration, Prompt-Vorlagen. Hier verknüpfen Sie das Modell mit Ihrem firmeneigenen Wissenskorpus – die Mitarbeiter schreiben einfach in ein Feld, und die KI antwortet auf Basis Ihrer Dokumente.

Genau das ist der Teil, der das System «gebrauchstüchtig» macht: Ohne Open WebUI (oder ein vergleichbares Frontend) wäre Ollama ein reines Backend, das nur Entwickler per Kommandozeile ansprechen könnten. Mit Open WebUI haben 5, 20 oder 50 Mitarbeiter eine Chat-Oberfläche, die aussieht wie die der großen Anbieter – nur dass jede Anfrage lokal rechnet.

Wie die drei zusammenarbeiten – ein konkreter Ablauf

Ein typischer Arbeitsablauf im Haus sieht so aus:

Der Punkt ist: Die drei Komponenten tun genau das, was sie können. Ollama rechnet, LM Studio richtet ein, Open WebUI liefert die Benutzererfahrung. LokaleKI setzt genau diesen Stack bei Ihnen auf – mit dem Modell, der Quantisierung und den RAG-Quellen, die zu Ihrer Anwendung passen (Installation & Setup ab 2.000 €).

Was Sie in der Praxis wirklich brauchen

Die kurze Antwort: Ollama + Open WebUI sind die Pflicht, LM Studio ist das nützliche Werkzeug für die Erstinstallation – danach optional. Auf einer DGX Spark oder einem RTX-5090-Rechner läuft dieser Stack vollständig lokal, für den Betrieb ohne Internetverbindung, mit optionaler Anbindung an Ihren LDAP-/Active-Directory-Login.

Wenn Sie unsicher sind, welche Kombination für Ihre Größe und Ihren Anwendungsfall richtig ist, klären wir das im kostenlosen Erstgespräch. Sie bekommen am Ende eine klare Empfehlung – vom kompakten Spark-Setup bis zu einem mehrstufigen Aufbau, der Ihre Mitarbeiterzahl deckt.

So lösen Sie es – mit lokaler KI

Ein KI-Server direkt in Ihrem Unternehmen. Einmal investieren statt monatelang abonnieren – alle Daten bleiben im Haus.

1

KI-Check – kostenlos

In einem 30-Minuten-Gespräch klären wir Ihre Anforderungen, Ihre Daten und die passende Hardware.

2

Hardware zum günstigsten Preis

Vom kompakten NVIDIA DGX Spark (128 GB) bis zur RTX-5090-Maschine – wir beschaffen, liefern und installieren.

3

Ihr Wissen wird angebunden

Dokumente, Prozesse und Know-how werden lokal verbunden. Jeder Mitarbeiter bekommt eine sichere Chat-Oberfläche.

Installation & Setup ab 2.000 € zzgl. MwSt. · Hardware zum jeweils günstigsten verfügbaren Preis · laufende Wartung zu festen Konditionen

Mehr über die komplette Lösung, Preise und das Vorgehen: Startseite von LokaleKI →