Grundlagen

Was ist ein LLM? Das Herzstück Ihrer lokalen KI, verständlich erklärt

Start  /  Artikel  /  Was ist ein LLM? Tokens, Gewichtungen und Kontextfenster verständlich erklärt

Ein LLM (Large Language Model, auf Deutsch: großes Sprachmodell) ist ein neuronales Netz, das gelernt hat, Sprache fortzusetzen. Klingt nach Magie, ist aber reiner Mechanik: Es verarbeitet Text in kleinsten Bausteinen, den Tokens, und rechnet daraus Schritt für Schritt das nächste Wort bzw. den nächsten Token heraus. Genau das – nichts anderes – machen ChatGPT, Claude oder Gemini, nur eben auf fremden Servern. Die gute Nachricht: Dieses Modell können Sie 1:1 in Ihrem Haus betreiben. Und deshalb sollten Sie wissen, wie es tickt.

In diesem Artikel bekommen Sie die drei Begriffe, die Sie sonst nur vage kennen – Tokens, Gewichtungen und das Kontextfenster – verständlich erklärt. Am Ende wissen Sie, wovon die Leistung und der Speicherbedarf Ihrer lokalen KI abhängen – und können die Zahlen, die Ihnen jemand vorlegt, selbst einordnen.

Tokens: die kleinsten Bausteine Ihrer KI

Ein LLM liest Sprache nicht wortweise, sondern in Tokens. Ein Token ist ein kleines Textfragment: ein Wort, ein Wortteil, eine Zahl, ein Zeichensatz. «Kunst» ist ein Token, «Kunststoff» wird zu zwei oder drei. Die Faustregel: 1 Token ≈ 3–4 Zeichen, also grob ein halbes bis ein ganzes Wort. Ein Satz mit 15 Wörtern ist damit rund 20–30 Tokens.

Warum ist das wichtig? Weil alles an Tokens gemessen wird – die Geschwindigkeit, der Speicher, später auch die Nutzung. Wenn ein Anbieter «Prozesskosten pro 1.000 Tokens» nennt oder Ihr lokales Modell mit «128.000 Kontext-Tokens» beworben wird, reden beide über dieselbe Währung. Wer Tokens versteht, versteht jede Leistungsangabe, die er hört.

Gewichtungen: wo das «Wissen» tatsächlich steckt

Ein LLM besteht aus Milliarden kleiner Recheneinheiten, die durch Gewichtungen (engl. weights) miteinander verbunden sind. Eine Gewichtung ist eine einzelne Zahl, die festlegt, wie stark eine Verbindung wirkt. Ein modernes Sprachmodell hat typischerweise 7 Milliarden (7B) bis 70 Milliarden (70B) und mehr solcher Zahlen. «70B-Modell» heißt schlicht: 70 Milliarden Gewichtungen.

Diese Zahlen sind das eigentliche Gehirn: Sie wurden beim Training auf riesigen Textmengen angepasst, damit das Modell Sprache, Fakten, Stil und Argumentation erzeugen kann. Genau das ist der Teil, den Ihre lokale KI auf die Festplatte lädt. Wenn später von «Modellgröße» oder «Dateigröße» die Rede ist, ist davon die Rede – und genau sie entscheidet, wie viel Arbeitsspeicher (VRAM) Ihr Server braucht.

Kontextfenster: wie viel Hintergrund passt ins Arbeitsgedächtnis

Jedes LLM hat ein Kontextfenster (context window) – die Menge an Tokens, die es gleichzeitig «im Kopf» halten kann: Ihre Frage, die Dokumente, die Sie eingelegt haben, und den schon geschriebenen Teil der Antwort. Übliche Größen sind 8.000, 32.000 oder 128.000 Tokens. Ein Buch mit 100.000 Wörtern sind grob 130.000–150.000 Tokens – das passt in ein 128K-Fenster, aber nicht in eines mit 8.000.

Dieser Punkt ist der wichtigste, wenn Sie lokal ein eigenes Wissenssystem aufbauen: Mit RAG (eigener Artikel) legen Sie die relevanten Dokument-Abschnitte genau in dieses Fenster, statt das ganze Archiv. Das Kontextfenster begrenzt, wie viel Hintergrund die KI bei einer Antwort gleichzeitig sehen kann – und damit auch, wie viel Speicher und Rechenzeit jede Antwort kostet.

Warum das für Ihre Hardware-Entscheidung entscheidend ist

Zusammengefasst entscheiden vier Zahlen über Ihre lokale KI:

Genau diese vier Werte bestimmen, ob die kompakte NVIDIA DGX Spark oder ein RTX-5090-Rechner der richtige Einstieg für Ihre Größe ist – und ob 5, 20 oder 100 Mitarbeiter davon profitieren. LokaleKI hilft Ihnen, diese Zahlen auf Ihre konkreten Anforderungen abzubilden – vom kostenlosen Erstgespräch bis zum fertig laufenden, lokal installierten System (Setup ab 2.000 €). Wenn Sie wissen wollen, welche Größe Sie brauchen, reicht ein 30-Minuten-Gespräch.

Kurzantwort, wenn Sie nur das Wesentliche brauchen

Ein LLM ist ein neuronales Netz aus Milliarden Gewichtungen, das Sprache in Tokens zerlegt und daraus das nächste Wort vorhersagt. Die drei Zahlen, die Sie kennen sollten: Modellgröße (7B–70B+), wie stark die Gewichtungen komprimiert sind (Q4–Q8) und wie viel Kontext das Modell gleichzeitig tragen kann. Alles andere – Ollama, Open WebUI, RAG – ist die Hülle drumherum, damit Ihre Mitarbeiter damit im Alltag arbeiten können.

So lösen Sie es – mit lokaler KI

Ein KI-Server direkt in Ihrem Unternehmen. Einmal investieren statt monatelang abonnieren – alle Daten bleiben im Haus.

1

KI-Check – kostenlos

In einem 30-Minuten-Gespräch klären wir Ihre Anforderungen, Ihre Daten und die passende Hardware.

2

Hardware zum günstigsten Preis

Vom kompakten NVIDIA DGX Spark (128 GB) bis zur RTX-5090-Maschine – wir beschaffen, liefern und installieren.

3

Ihr Wissen wird angebunden

Dokumente, Prozesse und Know-how werden lokal verbunden. Jeder Mitarbeiter bekommt eine sichere Chat-Oberfläche.

Installation & Setup ab 2.000 € zzgl. MwSt. · Hardware zum jeweils günstigsten verfügbaren Preis · laufende Wartung zu festen Konditionen

Mehr über die komplette Lösung, Preise und das Vorgehen: Startseite von LokaleKI →