Ihr Unternehmen verfügt über Jahre an Wissen – Verträge, Prozesse, Produktdokumente, interne Richtlinien, Support-Knowledge-Bases. Dieses Wissen ist verstreut, schwer auffindbar, und jeder Neueinsteiger muss es neu lernen. Retrieval-Augmented Generation (RAG) ist die Technik, mit der Sie all das Ihrem lokalen KI-System «beibringen» – ohne das Modell neu zu trainieren.
Der große Vorteil gegenüber einem rein generativen Chat: Die KI antwortet nur aus dem, was Sie ihr gegeben haben – aus Ihrem Korpus. Nicht aus Trainingsdaten, die sie von irgendwoher «weiß». Und: Wenn Sie ein Dokument aus Ihrem Korpus entfernen, kennt es die KI nie – kein Ghost-Wissen, keine verinnerlichten Daten. Genau das macht RAG zum Rückgrat jeder seriösen lokalen KI-Lösung.
Was RAG im Kern macht – ein Bild
Stellen Sie sich einen Bibliothekar vor, der auf Ihre Frage antwortet, aber nur aus den Büchern, die in seiner Bibliothek liegen. RAG arbeitet genau so:
- Retrieval (R): Das System holt die relevantesten Passagen aus Ihrem Dokumentenkorpus – nicht das ganze Korpus, nur die Fragmente, die zu Ihrer Frage passen.
- Augmented Generation (AG): Diese Fragmente werden in das Kontextfenster des LLM gelegt, zusammen mit Ihrer Frage. Das LLM schreibt die Antwort auf Basis dieser Fragmente.
- Quellenverweis: Im Idealfall zeigt die Oberfläche die Quelle (Dokument, Abschnitt) an, damit Sie nachprüfen können.
Das Ergebnis: Ihre KI kann über Ihre eigenen Daten sprechen, zitiert aus ihnen – und halluziniert deutlich weniger als ein Chat, der nur auf den Trainingsdaten aufsetzt.
Chunking: wie Dokumente in verwertbare Fragmente zerlegt werden
Ihr Korpus besteht aus hundert, tausend oder zehntausenden Dokumenten – PDFs, Word-Dateien, Excel-Tabellen, HTML, Markdown. Die KI kann nicht «ein ganzes Dokument» lesen, weil das Kontextfenster begrenzt ist. Deshalb wird jedes Dokument in Chunks zerlegt – typischerweise 200 bis 1.000 Tokens pro Chunk, mit einem kleinen Überlapp (10–20 %), damit keine Information an der Chunk-Grenze verloren geht.
Die Chunk-Größe ist ein Kompromiss: Zu klein (50 Tokens) → zu viel Rauschen, Kontext geht verloren. Zu groß (5.000 Tokens) → die KI bekommt zu viel Kontext pro Anfrage, das Kontextfenster wird voll und die Treffergenauigkeit sinkt. Die Praxis zeigt: 300–800 Tokens mit 10–20 % Overlap ist der Sweet Spot für die meisten Dokumententypen.
Vektordatenbank: wie die KI «findet», was zu Ihrer Frage passt
Ein Chunk ist Text. Aber die KI muss auf eine Frage («Was steht zur Zahlungsfrist?») die richtigen Chunk-Gruppen finden – selbst wenn die Frage nicht exakt die Wörter des Dokuments verwendet. Das macht der Embedding-Prozess: Jeder Chunk wird in einen Zahlenvektor umgewandelt, der seine Bedeutung kodiert. Ähnliche Bedeutungen liegen im Zahlenraum nah beieinander.
Diese Vektoren werden in einer Vektordatenbank (z.B. Qdrant, Chroma, pgvector) gespeichert. Wenn jemand eine Frage stellt, wird die Frage ebenfalls in einen Vektor umgewandelt, und die Datenbank liefert die top-k ähnlichsten Chunks (typisch 3–10) zurück. Ein zusätzlicher Reranker sortiert diese Vorschläge nach echter Relevanz, bevor sie ins LLM gehen. Das Ergebnis: Die KI bekommt genau die richtigen Absätze – auch wenn die Frage andere Wörter verwendet als das Dokument.
Die Pipeline im Detail – was technisch passiert
Ein typischer RAG-Ablauf, wie ihn LokaleKI in Ihrem Haus aufbaut:
- 1. Ingest: Ihre Dokumente (PDF, DOCX, XLSX, HTML, Markdown) werden in den System-Index eingespielt.
- 2. Chunking: Die Dokumente werden in 300–800-Token-Blöcke mit Overlap zerlegt.
- 3. Embedding: Ein lokales Embedding-Modell (z.B. bge-m3, nomic-embed) wandelt jeden Chunk in einen Vektor um.
- 4. Speicherung: Vektoren + Chunks landen in der Vektordatenbank, angereichert mit Metadaten (Dateiname, Datum, Abteilung, Klassifikation).
- 5. Retrieval: Bei einer Frage wird der Frage-Vektor erzeugt, die Vektordatenbank liefert die top-k Chunks.
- 6. Reranking: Ein Reranker-Modell sortiert die Chunks nach Relevanz.
- 7. Generation: Die sortierten Chunks + Ihre Frage + eine systemische Instruktion («Antworte nur auf Basis des Kontexts») gehen ins LLM, das die Antwort schreibt.
- 8. Zitation: Die Antwort zeigt die Quellen an (Datei, Abschnitt), damit Ihr Mitarbeiter nachprüfen kann.
Jeder dieser Schritte läuft lokal. Kein Vektor, kein Chunk, keine Frage verlässt das Haus. Das ist der Unterschied zu Cloud-RAG, bei dem das ganze Korpus auf einem fremden Server liegt.
Was RAG gut kann – und wo die Grenzen liegen
RAG ist das richtige Werkzeug, wenn:
- Ihr Wissen in Text-Dokumenten liegt (Verträge, Richtlinien, Handbücher, Support-KB, E-Mails).
- Sie aktuelles Wissen brauchen – RAG aktualisiert sich, wenn Sie neue Dokumente einspielen, ohne dass das Modell neu trainiert wird.
- Sie Quellen nachvollziehen müssen (Compliance, DSGVO, internes Audit).
- Sie keine Halluzinationen wollen – RAG antwortet nur, was im Korpus steht, und sagt «ich weiß es nicht», wenn die Information fehlt.
RAG ist nicht die Antwort auf jedes Problem. Für numerische Auswertungen (Excel, Datenbanken) ist ein direkter Datenbank-Abzug oft besser. Für die Analyse von Bildern oder Videos braucht es ein anderes Modell-Setup (Multimodalität) – dazu ein eigener Artikel. Für die meisten KMU-Textanwendungen ist RAG aber der Standard, den Ihre Mitarbeiter wirklich nutzen wollen.
Wie das in der Praxis bei Ihnen abläuft
LokaleKI richtet RAG in Ihrem Haus ein, mit einem konkreten Vorgehen:
- 1. Korpus-Aufnahme: Wir scannen Ihre bestehenden Dokumente, identifizieren die relevanten Quellen und vereinbaren ein Einspiel-Format.
- 2. Ingest & Index: Die Dokumente werden chunked, embedded und in die Vektordatenbank eingespielt – typischerweise innerhalb von ein bis zwei Arbeitstagen.
- 3. Test & Kalibrierung: Wir testen mit realen Fragen, kalibrieren Chunk-Größe und Reranker, bis die Trefferquote stimmt.
- 4. Go-Live: Ihre Mitarbeiter bekommen die Open-WebUI-Oberfläche mit RAG-Anbindung. Neue Dokumente können Sie per Upload selbst einspielen – oder wir übernehmen das im Wartungsvertrag.
- 5. Laufende Pflege: Im Wartungsvertrag übernehmen wir das Re-Index bei größeren Korpus-Änderungen und die Kontrolle, dass der Vektor-Index aktuell bleibt.
Am Ende haben Sie eine KI, die auf Basis Ihrer eigenen Dokumente antwortet, mit Quellenangabe, und ohne dass ein einziges Token das Haus verlässt.