Ratgeber · Lokale KI

Lokale KI: Welche Hardware, welche Modelle, welche Kosten?

Lokale KI heißt: Das Sprachmodell läuft auf Ihrem eigenen Server oder bei einem deutschen Hoster, nicht bei OpenAI oder Anthropic. Das schützt sensible Daten. Aber welche Hardware braucht man dafür, und was kostet das?

Daniel Wolf
Daniel Wolf

Gründer von 2moove · Stand: Oktober 2026 · Lesezeit 8 Min.

Kurz gesagt

  • Offene Modelle wie Qwen, Gemma, Mistral oder gpt-oss dürfen Sie meist frei im Unternehmen nutzen (Apache 2.0 oder MIT).
  • Faustregel für den Speicherbedarf: Milliarden Parameter × Bit pro Gewicht ÷ 8 in Gigabyte, plus Puffer für den Kontext.
  • Ein 8-Milliarden-Modell braucht in 4-Bit-Quantisierung rund 5 GB, ein 70-Milliarden-Modell rund 43 GB.
  • Grafikkarten sind 2026 deutlich teurer geworden. Für den Start ist Miete bei einem EU-Hoster oft die bessere Wahl.

Warum lokale KI?

Der wichtigste Grund ist Datenschutz: Personal-, Gesundheits- oder Vertragsdaten verlassen Ihr Netz nicht. Die Datenschutzkonferenz bezeichnet technisch geschlossene Systeme in ihrer Orientierungshilfe zu KI als vorzugswürdig, wenn personenbezogene Daten verarbeitet werden.

Weitere Gründe: keine Abhängigkeit von einem US-Anbieter, planbare Kosten bei vielen Anfragen und volle Kontrolle über Modellversionen. Das BSI nennt in seinem Papier zu generativen KI-Modellen Abhängigkeit und fehlende Vertraulichkeit der Eingaben ausdrücklich als Risiken.

Speicherbedarf (4-Bit, Ollama)

ModellgrößeSpeicher Q4Speicher Q8
8 Mrd.5,2 GB8,9 GB
14 Mrd.9,3 GB16 GB
32 Mrd.20 GB35 GB
70 Mrd.43 GB75 GB

Werte ohne Kontextspeicher. Quelle: Modellangaben in der Ollama-Bibliothek. Stand: Oktober 2026.

Welche Modelle gibt es?

Stand Oktober 2026 sind unter anderem diese offenen Modelle für Unternehmen interessant:

ModellLizenzHinweis
Qwen 3.8 (z. B. 27B)Apache 2.0stark in Deutsch und Werkzeugnutzung
Gemma 4 (bis 31B)Apache 2.0von Google, gut für mittlere Hardware
Mistral Small 4Apache 2.0europäischer Anbieter
gpt-oss-20b / 120bApache 2.020b läuft mit 16 GB, 120b auf einer 80-GB-GPU
Llama 4Community LicenseNutzungsgrenze bei 700 Mio. Nutzern im Monat

Quellen: Modellkarten der Anbieter. Stand: Oktober 2026.

Welches Modell passt, entscheidet sich am besten im Test mit Ihren echten Aufgaben. Ein kleineres Modell, das Ihre Aufgabe zuverlässig löst, ist besser als ein großes, das Sie nicht betreiben können.

Welche Hardware brauche ich?

Entscheidend ist der Grafikspeicher (VRAM). Das Modell muss vollständig hineinpassen, plus Platz für den Kontext, also die Texte, die gerade verarbeitet werden.

HardwareSpeicherPreis (Stand 2026)
NVIDIA RTX 509032 GBab 5.999 € (UVP 2.099 €)
NVIDIA DGX Spark128 GB9.299 €
NVIDIA RTX PRO 6000 Blackwell96 GB13.250 €
Apple Mac Studio M5 Ultrabis 512 GBab 6.599 €

Marktpreise im Handel, Stand Juni bis Oktober 2026. Preise sind 2026 stark gestiegen.

Für ein Team, das gelegentlich Fragen stellt, reicht oft eine Workstation mit 32 GB. Für viele gleichzeitige Nutzer braucht es einen Server mit Software wie vLLM, die Anfragen bündelt.

Kaufen oder mieten?

Wer erst testen will, mietet besser. Deutsche und europäische Anbieter wie IONOS AI Model Hub, STACKIT AI Model Serving oder OVHcloud AI Endpoints bieten offene Modelle mit Rechenzentren in der EU an, oft über eine OpenAI-kompatible Schnittstelle.

Kaufen lohnt sich, wenn Sie das Modell dauerhaft und intensiv nutzen oder Daten Ihr eigenes Netz gar nicht verlassen dürfen.

Welche Software läuft darauf?

  • Ollama: einfacher Einstieg, ideal für Tests und kleine Teams. Ratgeber zu Ollama
  • vLLM: für den produktiven Betrieb mit vielen gleichzeitigen Anfragen.
  • Open WebUI: Chat-Oberfläche für Ihr Team, mit eigener Lizenz.
  • n8n: verbindet das Modell mit Ihren Systemen und Abläufen.

Nächster Schritt

KI im eigenen Haus mit 2moove

Wir testen Modelle mit Ihren Aufgaben und rechnen Kauf, Miete und Cloud gegeneinander.

Mehr erfahren

Stand: Oktober 2026. Preise ohne Gewähr. Keine Rechtsberatung.

Häufige Fragen

Ihre Frage ist nicht dabei? Fragen Sie uns direkt im Erstgespräch.

Frage stellen
Wie viel Grafikspeicher braucht ein lokales Sprachmodell?

Faustregel: Milliarden Parameter × Bit pro Gewicht ÷ 8 ergibt Gigabyte. Ein 8-Milliarden-Modell braucht in 4-Bit-Quantisierung rund 5 GB, ein 70-Milliarden-Modell rund 43 GB – plus Speicher für den Kontext.

Ist lokale KI so gut wie ChatGPT?

Für viele Unternehmensaufgaben wie Zusammenfassen, Klassifizieren oder Antworten aus Dokumenten reichen offene Modelle mittlerer Größe heute gut aus. Für sehr anspruchsvolle Aufgaben sind die großen Cloud-Modelle oft noch stärker. Der Test mit Ihren Aufgaben entscheidet.

Darf ich offene Modelle kommerziell nutzen?

Bei Modellen unter Apache 2.0 oder MIT in der Regel ja. Einige Modelle wie Llama haben eigene Lizenzen mit Bedingungen. Prüfen Sie die Lizenz des jeweiligen Modells.

Was kostet lokale KI im Betrieb?

Es fallen keine Gebühren pro Anfrage an, dafür Strom, Wartung, Updates und Abschreibung der Hardware – oder die monatliche Miete beim Hoster.

Passt lokale KI zu Ihren Daten? Finden wir es heraus.

Im kostenlosen Erstgespräch klären wir, welche Daten wohin dürfen und ob sich lokale KI für Sie rechnet.

  • Kostenlos und unverbindlich
  • Antwort innerhalb von 24 Std.
  • Remote oder vor Ort
Daniel Wolf, Geschäftsführer der 2moove technologies GmbH

Ansprechpartner

Daniel Wolf

Gründer und Geschäftsführer 2moove

Über 20 Jahre Softwareentwicklung und mehr als 12 Jahre Data Engineering, heute mit Schwerpunkt auf n8n und generativer KI. Studium an der TU Dresden.

Stand dieser Seite: Oktober 2026

Kostenloses Erstgespräch

2moove technologies GmbH

Ihr Partner für KI, Automatisierung & digitale Prozesse

Haben Sie Fragen? Schreiben Sie uns gerne.

Kontaktieren Sie uns jetzt