Wenn Sie «lokale KI» sagen, meinen Sie in der Regel drei offene Programme, die in einem Rechner zusammenarbeiten: Ollama als die Komponente, die die Modelle lädt und ausführt, LM Studio als das komfortable Download- und Einstell-Tool, und Open WebUI als die Chat-Oberfläche, mit der Ihre Mitarbeiter wirklich arbeiten. Das ist der Standard-Stack, den fast jeder lokale KI-Betrieb verwendet – und den LokaleKI in Ihrem Haus installiert.
Die gute Nachricht: Keines davon braucht ein Abo, eine Cloud oder einen US-Server. Alles läuft auf Ihrer Hardware, Ihre Daten und Prompts bleiben im Haus. Im Folgenden erklären wir, was jede Komponente genau macht, wie sie zusammenpassen – und wie Sie wissen, welche Sie wirklich brauchen.
Die drei Ebenen in einem Satz
Stellen Sie sich das System wie ein Restaurant vor: die Küche kocht, die Karte sagt, was es gibt, und der Service bringt das Essen zum Gast. So auch bei der lokalen KI:
- Ollama = die Küche. Lädt die KI-Modelle und rechnet sie aus. Die eigentliche Rechenarbeit läuft hier – unsichtbar im Hintergrund.
- LM Studio = die Karte mit Backoffice. Ein grafisches Tool zum Download, Einrichten und Feintunen von Modellen. Ideal, um die Hardware optimal zu bestücken.
- Open WebUI = der Saal. Die Chat-Oberfläche im Browser, mit der Ihre Mitarbeiter tatsächlich schreiben, Fragen stellen und Dokumente hochladen.
Diese Trennung ist kein Zufall: Jede Komponente hat genau einen Job, dadurch ist das System modular – Sie können Teile austauschen, ohne das Ganze umzukippen.
Ollama: die Rechenkammer im Hintergrund
Ollama ist ein kleines Programm, das als Service im Hintergrund läuft. Sie fragen es per Kommando oder API: «Lade das Modell Llama-3-70B», und es lädt die Gewichte von der Festplatte, legt sie in den Arbeitsspeicher (VRAM) und beantwortet Anfragen. Ollama spricht die offene OpenAI-kompatible API – das bedeutet, dass praktisch jedes Chat-Tool, das an OpenAI angedockt ist, auch an Ollama angedockt werden kann. Genau darauf baut Open WebUI.
Warum ist das clever? Weil Ollama die Hardware ausreizt, aber keine eigene Oberfläche mitschleift. Es macht einen Job sauber: Modelle verwalten und ausführen, mit mehreren Modellen gleichzeitig, mit Kontextsteuerung und sauberem VRAM-Management. Für einen stabilen Betrieb ist es der wichtigste Baustein.
LM Studio: das Tool, mit dem Sie die Hardware bestücken
LM Studio ist ein grafisches Programm (Windows, Mac, Linux), mit dem Sie Modelle bequem aus dem Hugging-Face-Katalog laden, quantisierte Varianten auswählen und sofort testen. Es zeigt Ihnen live: Wie viel VRAM wird belegt, wie schnell erzeugt das Modell, wie hoch die GPU-Temperatur? Damit finden Sie den Sweet-Spot zwischen Modellgröße, Quantisierung und Geschwindigkeit – zum Beispiel «Q6-Kompression, 14B-Modell, 32K Kontext, bei 45 Tokens pro Sekunde».
In einem professionellen Setup nutzen wir LM Studio vor allem einmalig, beim Inbetriebnehmen: um die für Ihre Anwendung beste Modell-/Quantisierungskombination zu finden und dann in Ollama zu verankern. Ihr Alltag läuft danach über Ollama + Open WebUI, LM Studio bleibt als Werkzeug in der Tasche.
Open WebUI: die Oberfläche, die Ihre Mitarbeiter sehen
Open WebUI ist die Chat-Oberfläche im Browser. Es sieht aus wie ChatGPT, aber alles bleibt im Haus: Benutzerverwaltung, Gruppen, Datei-Uploads, RAG-Integration, Prompt-Vorlagen. Hier verknüpfen Sie das Modell mit Ihrem firmeneigenen Wissenskorpus – die Mitarbeiter schreiben einfach in ein Feld, und die KI antwortet auf Basis Ihrer Dokumente.
Genau das ist der Teil, der das System «gebrauchstüchtig» macht: Ohne Open WebUI (oder ein vergleichbares Frontend) wäre Ollama ein reines Backend, das nur Entwickler per Kommandozeile ansprechen könnten. Mit Open WebUI haben 5, 20 oder 50 Mitarbeiter eine Chat-Oberfläche, die aussieht wie die der großen Anbieter – nur dass jede Anfrage lokal rechnet.
Wie die drei zusammenarbeiten – ein konkreter Ablauf
Ein typischer Arbeitsablauf im Haus sieht so aus:
- Ein Mitarbeiter öffnet Open WebUI im Browser und loggt sich mit seinem Firmen-Account ein.
- Er fragt: «Was steht in unserem Liefervertrag von Juli zur Zahlungsfrist?»
- Open WebUI leitet die Anfrage an Ollama weiter.
- Ollama legt die Frage plus die relevanten Dokumenten-Chunkes (aus dem RAG-System) ins LLM und erzeugt die Antwort.
- Die Antwort geht zurück durch Ollama an Open WebUI, das sie dem Mitarbeiter anzeigt.
- Nichts davon verlässt das Haus. Kein Token fliegt über das Internet.
Der Punkt ist: Die drei Komponenten tun genau das, was sie können. Ollama rechnet, LM Studio richtet ein, Open WebUI liefert die Benutzererfahrung. LokaleKI setzt genau diesen Stack bei Ihnen auf – mit dem Modell, der Quantisierung und den RAG-Quellen, die zu Ihrer Anwendung passen (Installation & Setup ab 2.000 €).
Was Sie in der Praxis wirklich brauchen
Die kurze Antwort: Ollama + Open WebUI sind die Pflicht, LM Studio ist das nützliche Werkzeug für die Erstinstallation – danach optional. Auf einer DGX Spark oder einem RTX-5090-Rechner läuft dieser Stack vollständig lokal, für den Betrieb ohne Internetverbindung, mit optionaler Anbindung an Ihren LDAP-/Active-Directory-Login.
Wenn Sie unsicher sind, welche Kombination für Ihre Größe und Ihren Anwendungsfall richtig ist, klären wir das im kostenlosen Erstgespräch. Sie bekommen am Ende eine klare Empfehlung – vom kompakten Spark-Setup bis zu einem mehrstufigen Aufbau, der Ihre Mitarbeiterzahl deckt.