Wissensmanagement

RAG erklärt: Wie Ihre KI auf Basis Ihrer eigenen Dokumente antwortet

Start  /  Artikel  /  RAG (Retrieval-Augmented Generation): So liest Ihre KI Ihr Firmenwissen

Ihr Unternehmen verfügt über Jahre an Wissen – Verträge, Prozesse, Produktdokumente, interne Richtlinien, Support-Knowledge-Bases. Dieses Wissen ist verstreut, schwer auffindbar, und jeder Neueinsteiger muss es neu lernen. Retrieval-Augmented Generation (RAG) ist die Technik, mit der Sie all das Ihrem lokalen KI-System «beibringen» – ohne das Modell neu zu trainieren.

Der große Vorteil gegenüber einem rein generativen Chat: Die KI antwortet nur aus dem, was Sie ihr gegeben haben – aus Ihrem Korpus. Nicht aus Trainingsdaten, die sie von irgendwoher «weiß». Und: Wenn Sie ein Dokument aus Ihrem Korpus entfernen, kennt es die KI nie – kein Ghost-Wissen, keine verinnerlichten Daten. Genau das macht RAG zum Rückgrat jeder seriösen lokalen KI-Lösung.

Was RAG im Kern macht – ein Bild

Stellen Sie sich einen Bibliothekar vor, der auf Ihre Frage antwortet, aber nur aus den Büchern, die in seiner Bibliothek liegen. RAG arbeitet genau so:

Das Ergebnis: Ihre KI kann über Ihre eigenen Daten sprechen, zitiert aus ihnen – und halluziniert deutlich weniger als ein Chat, der nur auf den Trainingsdaten aufsetzt.

Chunking: wie Dokumente in verwertbare Fragmente zerlegt werden

Ihr Korpus besteht aus hundert, tausend oder zehntausenden Dokumenten – PDFs, Word-Dateien, Excel-Tabellen, HTML, Markdown. Die KI kann nicht «ein ganzes Dokument» lesen, weil das Kontextfenster begrenzt ist. Deshalb wird jedes Dokument in Chunks zerlegt – typischerweise 200 bis 1.000 Tokens pro Chunk, mit einem kleinen Überlapp (10–20 %), damit keine Information an der Chunk-Grenze verloren geht.

Die Chunk-Größe ist ein Kompromiss: Zu klein (50 Tokens) → zu viel Rauschen, Kontext geht verloren. Zu groß (5.000 Tokens) → die KI bekommt zu viel Kontext pro Anfrage, das Kontextfenster wird voll und die Treffergenauigkeit sinkt. Die Praxis zeigt: 300–800 Tokens mit 10–20 % Overlap ist der Sweet Spot für die meisten Dokumententypen.

Vektordatenbank: wie die KI «findet», was zu Ihrer Frage passt

Ein Chunk ist Text. Aber die KI muss auf eine Frage («Was steht zur Zahlungsfrist?») die richtigen Chunk-Gruppen finden – selbst wenn die Frage nicht exakt die Wörter des Dokuments verwendet. Das macht der Embedding-Prozess: Jeder Chunk wird in einen Zahlenvektor umgewandelt, der seine Bedeutung kodiert. Ähnliche Bedeutungen liegen im Zahlenraum nah beieinander.

Diese Vektoren werden in einer Vektordatenbank (z.B. Qdrant, Chroma, pgvector) gespeichert. Wenn jemand eine Frage stellt, wird die Frage ebenfalls in einen Vektor umgewandelt, und die Datenbank liefert die top-k ähnlichsten Chunks (typisch 3–10) zurück. Ein zusätzlicher Reranker sortiert diese Vorschläge nach echter Relevanz, bevor sie ins LLM gehen. Das Ergebnis: Die KI bekommt genau die richtigen Absätze – auch wenn die Frage andere Wörter verwendet als das Dokument.

Die Pipeline im Detail – was technisch passiert

Ein typischer RAG-Ablauf, wie ihn LokaleKI in Ihrem Haus aufbaut:

Jeder dieser Schritte läuft lokal. Kein Vektor, kein Chunk, keine Frage verlässt das Haus. Das ist der Unterschied zu Cloud-RAG, bei dem das ganze Korpus auf einem fremden Server liegt.

Was RAG gut kann – und wo die Grenzen liegen

RAG ist das richtige Werkzeug, wenn:

RAG ist nicht die Antwort auf jedes Problem. Für numerische Auswertungen (Excel, Datenbanken) ist ein direkter Datenbank-Abzug oft besser. Für die Analyse von Bildern oder Videos braucht es ein anderes Modell-Setup (Multimodalität) – dazu ein eigener Artikel. Für die meisten KMU-Textanwendungen ist RAG aber der Standard, den Ihre Mitarbeiter wirklich nutzen wollen.

Wie das in der Praxis bei Ihnen abläuft

LokaleKI richtet RAG in Ihrem Haus ein, mit einem konkreten Vorgehen:

Am Ende haben Sie eine KI, die auf Basis Ihrer eigenen Dokumente antwortet, mit Quellenangabe, und ohne dass ein einziges Token das Haus verlässt.

So lösen Sie es – mit lokaler KI

Ein KI-Server direkt in Ihrem Unternehmen. Einmal investieren statt monatelang abonnieren – alle Daten bleiben im Haus.

1

KI-Check – kostenlos

In einem 30-Minuten-Gespräch klären wir Ihre Anforderungen, Ihre Daten und die passende Hardware.

2

Hardware zum günstigsten Preis

Vom kompakten NVIDIA DGX Spark (128 GB) bis zur RTX-5090-Maschine – wir beschaffen, liefern und installieren.

3

Ihr Wissen wird angebunden

Dokumente, Prozesse und Know-how werden lokal verbunden. Jeder Mitarbeiter bekommt eine sichere Chat-Oberfläche.

Installation & Setup ab 2.000 € zzgl. MwSt. · Hardware zum jeweils günstigsten verfügbaren Preis · laufende Wartung zu festen Konditionen

Mehr über die komplette Lösung, Preise und das Vorgehen: Startseite von LokaleKI →