Lokale KI: Welche Hardware, welche Modelle, welche Kosten?
Lokale KI heißt: Das Sprachmodell läuft auf Ihrem eigenen Server oder bei einem deutschen Hoster, nicht bei OpenAI oder Anthropic. Das schützt sensible Daten. Aber welche Hardware braucht man dafür, und was kostet das?
Gründer von 2moove · Stand: Oktober 2026 · Lesezeit 8 Min.
Kurz gesagt
- Offene Modelle wie Qwen, Gemma, Mistral oder gpt-oss dürfen Sie meist frei im Unternehmen nutzen (Apache 2.0 oder MIT).
- Faustregel für den Speicherbedarf: Milliarden Parameter × Bit pro Gewicht ÷ 8 in Gigabyte, plus Puffer für den Kontext.
- Ein 8-Milliarden-Modell braucht in 4-Bit-Quantisierung rund 5 GB, ein 70-Milliarden-Modell rund 43 GB.
- Grafikkarten sind 2026 deutlich teurer geworden. Für den Start ist Miete bei einem EU-Hoster oft die bessere Wahl.
Warum lokale KI?
Der wichtigste Grund ist Datenschutz: Personal-, Gesundheits- oder Vertragsdaten verlassen Ihr Netz nicht. Die Datenschutzkonferenz bezeichnet technisch geschlossene Systeme in ihrer Orientierungshilfe zu KI als vorzugswürdig, wenn personenbezogene Daten verarbeitet werden.
Weitere Gründe: keine Abhängigkeit von einem US-Anbieter, planbare Kosten bei vielen Anfragen und volle Kontrolle über Modellversionen. Das BSI nennt in seinem Papier zu generativen KI-Modellen Abhängigkeit und fehlende Vertraulichkeit der Eingaben ausdrücklich als Risiken.
Speicherbedarf (4-Bit, Ollama)
| Modellgröße | Speicher Q4 | Speicher Q8 |
|---|---|---|
| 8 Mrd. | 5,2 GB | 8,9 GB |
| 14 Mrd. | 9,3 GB | 16 GB |
| 32 Mrd. | 20 GB | 35 GB |
| 70 Mrd. | 43 GB | 75 GB |
Werte ohne Kontextspeicher. Quelle: Modellangaben in der Ollama-Bibliothek. Stand: Oktober 2026.
Welche Modelle gibt es?
Stand Oktober 2026 sind unter anderem diese offenen Modelle für Unternehmen interessant:
| Modell | Lizenz | Hinweis |
|---|---|---|
| Qwen 3.8 (z. B. 27B) | Apache 2.0 | stark in Deutsch und Werkzeugnutzung |
| Gemma 4 (bis 31B) | Apache 2.0 | von Google, gut für mittlere Hardware |
| Mistral Small 4 | Apache 2.0 | europäischer Anbieter |
| gpt-oss-20b / 120b | Apache 2.0 | 20b läuft mit 16 GB, 120b auf einer 80-GB-GPU |
| Llama 4 | Community License | Nutzungsgrenze bei 700 Mio. Nutzern im Monat |
Quellen: Modellkarten der Anbieter. Stand: Oktober 2026.
Welches Modell passt, entscheidet sich am besten im Test mit Ihren echten Aufgaben. Ein kleineres Modell, das Ihre Aufgabe zuverlässig löst, ist besser als ein großes, das Sie nicht betreiben können.
Welche Hardware brauche ich?
Entscheidend ist der Grafikspeicher (VRAM). Das Modell muss vollständig hineinpassen, plus Platz für den Kontext, also die Texte, die gerade verarbeitet werden.
| Hardware | Speicher | Preis (Stand 2026) |
|---|---|---|
| NVIDIA RTX 5090 | 32 GB | ab 5.999 € (UVP 2.099 €) |
| NVIDIA DGX Spark | 128 GB | 9.299 € |
| NVIDIA RTX PRO 6000 Blackwell | 96 GB | 13.250 € |
| Apple Mac Studio M5 Ultra | bis 512 GB | ab 6.599 € |
Marktpreise im Handel, Stand Juni bis Oktober 2026. Preise sind 2026 stark gestiegen.
Für ein Team, das gelegentlich Fragen stellt, reicht oft eine Workstation mit 32 GB. Für viele gleichzeitige Nutzer braucht es einen Server mit Software wie vLLM, die Anfragen bündelt.
Kaufen oder mieten?
Wer erst testen will, mietet besser. Deutsche und europäische Anbieter wie IONOS AI Model Hub, STACKIT AI Model Serving oder OVHcloud AI Endpoints bieten offene Modelle mit Rechenzentren in der EU an, oft über eine OpenAI-kompatible Schnittstelle.
Kaufen lohnt sich, wenn Sie das Modell dauerhaft und intensiv nutzen oder Daten Ihr eigenes Netz gar nicht verlassen dürfen.
Welche Software läuft darauf?
- Ollama: einfacher Einstieg, ideal für Tests und kleine Teams. Ratgeber zu Ollama
- vLLM: für den produktiven Betrieb mit vielen gleichzeitigen Anfragen.
- Open WebUI: Chat-Oberfläche für Ihr Team, mit eigener Lizenz.
- n8n: verbindet das Modell mit Ihren Systemen und Abläufen.
Nächster Schritt
KI im eigenen Haus mit 2moove
Wir testen Modelle mit Ihren Aufgaben und rechnen Kauf, Miete und Cloud gegeneinander.
Stand: Oktober 2026. Preise ohne Gewähr. Keine Rechtsberatung.
Wie viel Grafikspeicher braucht ein lokales Sprachmodell?
Faustregel: Milliarden Parameter × Bit pro Gewicht ÷ 8 ergibt Gigabyte. Ein 8-Milliarden-Modell braucht in 4-Bit-Quantisierung rund 5 GB, ein 70-Milliarden-Modell rund 43 GB – plus Speicher für den Kontext.
Ist lokale KI so gut wie ChatGPT?
Für viele Unternehmensaufgaben wie Zusammenfassen, Klassifizieren oder Antworten aus Dokumenten reichen offene Modelle mittlerer Größe heute gut aus. Für sehr anspruchsvolle Aufgaben sind die großen Cloud-Modelle oft noch stärker. Der Test mit Ihren Aufgaben entscheidet.
Darf ich offene Modelle kommerziell nutzen?
Bei Modellen unter Apache 2.0 oder MIT in der Regel ja. Einige Modelle wie Llama haben eigene Lizenzen mit Bedingungen. Prüfen Sie die Lizenz des jeweiligen Modells.
Was kostet lokale KI im Betrieb?
Es fallen keine Gebühren pro Anfrage an, dafür Strom, Wartung, Updates und Abschreibung der Hardware – oder die monatliche Miete beim Hoster.
Weiterlesen im Ratgeber
Was kostet KI-Automatisierung?
Kostenblöcke, laufende Kosten und wie Sie den Nutzen rechnen.
Ollama im Unternehmen
Was Ollama kann, wo die Grenzen liegen und wann vLLM besser passt.
RAG einfach erklärt
Wie KI mit Ihrem Firmenwissen antwortet – mit Quellen.
Claude oder ChatGPT im Unternehmen?
Pläne, Datenschutz und EU-Verarbeitung im Vergleich.
Passt lokale KI zu Ihren Daten? Finden wir es heraus.
Im kostenlosen Erstgespräch klären wir, welche Daten wohin dürfen und ob sich lokale KI für Sie rechnet.
- Kostenlos und unverbindlich
- Antwort innerhalb von 24 Std.
- Remote oder vor Ort
Über 20 Jahre Softwareentwicklung und mehr als 12 Jahre Data Engineering, heute mit Schwerpunkt auf n8n und generativer KI. Studium an der TU Dresden.
Stand dieser Seite: Oktober 2026
Lokale KI für Ihr Unternehmen?
Kostenlos und unverbindlich – Antwort in 24 Std.
2moove technologies GmbH
Ihr Partner für KI, Automatisierung & digitale Prozesse
Haben Sie Fragen? Schreiben Sie uns gerne.