Lokale KI: Sprachmodelle, die Ihr Unternehmen nie verlassen
Wir richten Open-Source-Sprachmodelle auf Ihren Servern oder in einer deutschen Cloud ein – mit Chat für Ihr Team, Anbindung an Ihre Dokumente und klaren Rechten. Für Verträge, Personal- und Kundendaten, die nicht in fremde Hände gehören.
- Daten bleiben im Haus
- Herstellerunabhängig
- Mit Cloud kombinierbar
Ihre KI im eigenen Haus
Was wir für Sie aufbauen
- Sprachmodell auf Ihrem ServerOder in einer deutschen Cloud – Sie behalten die Kontrolle
- Chat für Ihr TeamEinfache Oberfläche mit Anmeldung und Rollen
- Ihre Dokumente angebundenAntworten mit Quellenangabe aus Ihrem Wissen
- Automatisierte AbläufeMit n8n an ERP, CRM und Ablage
- Rechte und ProtokollWer darf was sehen, alles nachvollziehbar
Wir bringen Erfahrung aus Projekten für Unternehmen wie diese mit
Was ist lokale KI?
Lokale KI bedeutet, dass ein Sprachmodell auf Servern läuft, die Ihr Unternehmen kontrolliert – im eigenen Rechenzentrum oder bei einem deutschen Cloud-Anbieter. Eingaben, Dokumente und Antworten verlassen diese Umgebung nicht. Möglich machen das offene Modelle wie Qwen, Gemma, Mistral oder gpt-oss, die für den Unternehmenseinsatz frei nutzbar sind.
Damit wird KI auch dort nutzbar, wo öffentliche Dienste nicht in Frage kommen: bei Verträgen, Personalakten, Patientendaten, Konstruktionsunterlagen oder Angeboten.
Lokale KI ist kein Entweder-oder. Oft ist die beste Lösung eine Mischung aus lokalem Modell für sensible Daten und Cloud-Modell für den Rest.
Cloud-KI, deutsche Cloud oder eigener Server?
Drei Wege zu einer datenschutzfreundlichen KI. Welcher passt, hängt von Ihren Daten, Ihrer IT und Ihrem Budget ab.
Cloud-KI mit EU-Verarbeitung
- Wo laufen die Daten?
- Beim KI-Anbieter, Verarbeitung in der EU, vertraglich geregelt
- Modelle
- Stärkste aktuelle Modelle
- Start
- Sofort
- Kosten
- Pro Nutzer oder nach Nutzung
- Gut für
- Allgemeine Aufgaben mit unkritischen Daten
Open-Source-Modell in deutscher Cloud
- Wo laufen die Daten?
- Bei einem deutschen Anbieter wie IONOS oder STACKIT
- Modelle
- Gute offene Modelle
- Start
- Schnell, keine Hardware nötig
- Kosten
- Nach Nutzung
- Gut für
- Sensible Daten ohne eigene Hardware
Eigener Server
- Wo laufen die Daten?
- In Ihrem Rechenzentrum
- Modelle
- Gute offene Modelle Ihrer Wahl
- Start
- Vorlauf für Hardware und Einrichtung
- Kosten
- Einmalig Hardware, danach Betrieb
- Gut für
- Sehr sensible Daten, viele Anfragen, volle Kontrolle
| Cloud-KI mit EU-Verarbeitung | Open-Source-Modell in deutscher Cloud | Eigener Server | |
|---|---|---|---|
| Wo laufen die Daten? | Beim KI-Anbieter, Verarbeitung in der EU, vertraglich geregelt | Bei einem deutschen Anbieter wie IONOS oder STACKIT | In Ihrem Rechenzentrum |
| Modelle | Stärkste aktuelle Modelle | Gute offene Modelle | Gute offene Modelle Ihrer Wahl |
| Start | Sofort | Schnell, keine Hardware nötig | Vorlauf für Hardware und Einrichtung |
| Kosten | Pro Nutzer oder nach Nutzung | Nach Nutzung | Einmalig Hardware, danach Betrieb |
| Gut für | Allgemeine Aufgaben mit unkritischen Daten | Sensible Daten ohne eigene Hardware | Sehr sensible Daten, viele Anfragen, volle Kontrolle |
Welche Hardware braucht lokale KI?
Faustregel: Je größer das Modell, desto mehr Grafikspeicher. Die Werte gelten für komprimierte Modelle (4 Bit) ohne den Speicher für lange Gespräche.
Klein (7–8 Mrd. Parameter)
- Speicher
- ca. 5 GB
- Passende Hardware
- Arbeitsplatz-Grafikkarte oder aktueller Mac
- Gut für
- Klassifizieren, Zusammenfassen, einfache Fragen
Mittel (14 Mrd.)
- Speicher
- ca. 9 GB
- Passende Hardware
- Grafikkarte mit 16–24 GB
- Gut für
- Interner Chat, Texte, Übersetzungen
Groß (27–32 Mrd.)
- Speicher
- ca. 20 GB
- Passende Hardware
- z. B. RTX 5090 mit 32 GB
- Gut für
- Dokumentenfragen, Agenten, anspruchsvolle Texte
Sehr groß (70 Mrd. und mehr)
- Speicher
- ca. 43 GB und mehr
- Passende Hardware
- z. B. RTX PRO 6000 mit 96 GB, DGX Spark mit 128 GB oder Server-GPUs
- Gut für
- Viele Nutzer, komplexe Analysen
| Speicher | Passende Hardware | Gut für | |
|---|---|---|---|
| Klein (7–8 Mrd. Parameter) | ca. 5 GB | Arbeitsplatz-Grafikkarte oder aktueller Mac | Klassifizieren, Zusammenfassen, einfache Fragen |
| Mittel (14 Mrd.) | ca. 9 GB | Grafikkarte mit 16–24 GB | Interner Chat, Texte, Übersetzungen |
| Groß (27–32 Mrd.) | ca. 20 GB | z. B. RTX 5090 mit 32 GB | Dokumentenfragen, Agenten, anspruchsvolle Texte |
| Sehr groß (70 Mrd. und mehr) | ca. 43 GB und mehr | z. B. RTX PRO 6000 mit 96 GB, DGX Spark mit 128 GB oder Server-GPUs | Viele Nutzer, komplexe Analysen |
Speicherwerte: Modellgrößen der Ollama-Bibliothek (Qwen3, Llama 3.3). Preisbeispiele: RTX 5090 ab 5.999 € (01.10.2026), RTX PRO 6000 Blackwell 13.250 € (13.06.2026), NVIDIA DGX Spark 9.299 € (23.07.2026). Grafikkarten sind 2026 deutlich teurer geworden. Stand: Oktober 2026.
Welche Modelle wir einsetzen
Wir sind an keinen Hersteller gebunden und wählen das Modell nach Aufgabe, Sprache, Lizenz und Hardware. Eine Auswahl aktueller offener Modelle:
Qwen 3.8
Sehr stark bei Texten und Mehrsprachigkeit, auch als Version mit 27 Milliarden Parametern. Lizenz: Apache 2.0.
Gemma 4
Offene Modelle von Google bis 31 Milliarden Parameter, seit April 2026 unter Apache 2.0.
Mistral Small 4
Europäischer Anbieter aus Frankreich, effizient und mit langem Kontext. Lizenz: Apache 2.0.
gpt-oss
Offene Modelle von OpenAI. Die große Version läuft auf einer einzelnen Grafikkarte mit 80 GB. Lizenz: Apache 2.0.
DeepSeek
Sehr leistungsfähig, braucht in voller Größe aber Rechenzentrums-Hardware. Lizenz: MIT.
Llama 4
Bekannte Modellfamilie von Meta mit eigener Lizenz, die wir vor dem Einsatz prüfen.
Wofür Unternehmen lokale KI nutzen
Typische Einsätze, bei denen die Daten das Haus nicht verlassen sollen.
Interner KI-Chat
Ein sicherer Chat für alle Mitarbeitenden – statt privater ChatGPT-Konten mit Firmendaten.
Fragen an eigene Dokumente
Handbücher, Richtlinien und Verträge durchsuchen, mit Quelle zu jeder Antwort. Mehr zur KI-Wissensdatenbank
Verträge und Akten prüfen
Klauseln finden, Fristen herausziehen, Abweichungen markieren – ohne Daten an Dritte.
Übersetzen und Zusammenfassen
Vertrauliche Berichte, Protokolle und E-Mails in Sekunden verdichten oder übersetzen.
Agenten mit sensiblen Daten
KI-Agenten, die Personal- oder Kundendaten verarbeiten, mit lokalem Modell. Mehr zu KI-Agenten
Assistent für Entwickler
Code-Vorschläge und Erklärungen, ohne dass Quellcode das Unternehmen verlässt.
Erfahrung aus Projekten
Wir bringen Erfahrung aus Projekten mit, in denen Datenschutz, Sicherheit und eigene Infrastruktur entscheidend waren.
Industriekonzern · Siemens
Cloud- und selbst betriebene Modelle
KI-Plattform mit Claude, Azure OpenAI und Gemini sowie selbst betriebenen Open-Source-Modellen wie DeepSeek und Qwen – je nach Aufgabe, Datenschutz und Kosten.
Öffentliche Verwaltung · Univention
Souveräner Arbeitsplatz nach BSI
Migration einer Identitätsverwaltung auf Kubernetes für openDesk, mit Ausrichtung am BSI IT-Grundschutz.
So kommt die KI in Ihr Haus
Vier Schritte. Nach jedem Schritt entscheiden Sie, ob es weitergeht.
Mit dem Erstgespräch starten- 1
Bedarf und Daten klären
Welche Aufgaben, welche Daten, wie viele Nutzer? Wir klären auch, was in die Cloud darf und was nicht.
Ergebnis: eine klare Anforderung.
- 2
Modell und Hardware testen
Wir testen zwei bis drei Modelle mit Ihren echten Aufgaben und rechnen Hardware, Miete und Cloud gegeneinander.
Ergebnis: eine Entscheidung auf Basis von Zahlen.
- 3
Aufbau
Server, Modell, Chat-Oberfläche, Anmeldung, Rechte und Anbindung an Ihre Dokumente und Systeme.
Ergebnis: eine lokale KI, die Ihr Team nutzen kann.
- 4
Betrieb
Updates, Überwachung, neue Modelle, Schulung. Auf Wunsch übernimmt Ihre IT nach sauberer Übergabe.
Ergebnis: eine KI, die aktuell und sicher bleibt.
Was kostet lokale KI?
Die Kosten hängen vor allem von Modellgröße, Nutzerzahl und Betriebsform ab. Nach dem kostenlosen Erstgespräch bekommen Sie ein schriftliches Angebot mit klarem Umfang.
Was den Aufwand bestimmt:
- Modellgröße und Qualität der Antworten
- Zahl der gleichzeitigen Nutzer
- Eigene Hardware, Miete oder deutsche Cloud
- Anbindung an Dokumente und Systeme
- Betrieb und Updates
Hardware oder Miete?
Eigene Hardware lohnt sich bei vielen Anfragen und sehr sensiblen Daten. Für den Einstieg sind Open-Source-Modelle bei deutschen Cloud-Anbietern oft günstiger: Sie zahlen nach Nutzung und brauchen keine eigene Grafikkarte.
Wir rechnen beide Wege mit Ihren Zahlen durch, bevor Sie investieren.
Häufige Fragen zu lokaler KI
Ihre Frage ist nicht dabei? Stellen Sie sie direkt im Erstgespräch.
Frage stellenWas ist lokale KI?
Lokale KI bedeutet, dass ein Sprachmodell auf Servern läuft, die Ihr Unternehmen kontrolliert – im eigenen Rechenzentrum oder bei einem deutschen Cloud-Anbieter. Eingaben, Dokumente und Antworten verlassen diese Umgebung nicht.
Ist lokale KI DSGVO-konform?
Lokale KI erleichtert den Datenschutz deutlich, weil keine Daten an einen fremden KI-Anbieter gehen. Die Datenschutzkonferenz bezeichnet technisch geschlossene Systeme als vorzugswürdig. Rechtsgrundlage, Zugriffsrechte und Löschkonzept brauchen Sie trotzdem. Das ersetzt keine Rechtsberatung.
Wie gut sind lokale Modelle im Vergleich zu ChatGPT oder Claude?
Für viele Alltagsaufgaben wie Zusammenfassen, Übersetzen, Klassifizieren und Fragen zu eigenen Dokumenten reichen aktuelle offene Modelle gut aus. Bei sehr komplexen Analysen sind die stärksten Cloud-Modelle oft besser. Wir testen beides mit Ihren eigenen Aufgaben, bevor Sie entscheiden.
Welche Hardware braucht man für lokale KI?
Das hängt von der Modellgröße und der Zahl der gleichzeitigen Nutzer ab. Ein Modell mit 8 Milliarden Parametern braucht in komprimierter Form rund 5 GB Grafikspeicher, ein Modell mit 70 Milliarden Parametern rund 43 GB – jeweils plus Speicher für den Gesprächsverlauf.
Was kostet eine lokale KI?
Die Kosten setzen sich aus Hardware oder Miete, Einrichtung und Betrieb zusammen. Grafikkarten sind 2026 deutlich teurer geworden. Eine Alternative ohne eigene Hardware sind Open-Source-Modelle bei deutschen Cloud-Anbietern, die nach Nutzung abrechnen.
Was ist Ollama und reicht das für ein Unternehmen?
Ollama ist ein kostenloses Werkzeug, mit dem sich offene Sprachmodelle einfach lokal starten lassen. Für Tests und kleine Teams ist es ideal. Wenn viele Menschen gleichzeitig arbeiten, setzen wir auf Server-Software wie vLLM, die Anfragen effizienter verarbeitet.
Dürfen Open-Source-Modelle kommerziell genutzt werden?
Das regelt die Lizenz des jeweiligen Modells. Viele aktuelle Modelle wie Qwen, Gemma 4, Mistral Small oder gpt-oss stehen unter Apache 2.0, DeepSeek unter MIT. Llama nutzt eine eigene Lizenz mit Bedingungen. Wir prüfen die Lizenz vor jedem Einsatz.
Kann man lokale KI und Cloud-KI kombinieren?
Ja, und das ist oft die beste Lösung: sensible Daten über das lokale Modell, allgemeine Aufgaben über ein starkes Cloud-Modell mit EU-Verarbeitung. Eine zentrale Schnittstelle entscheidet je Anfrage, welches Modell genutzt wird.
Sensible Daten, aber trotzdem KI? Das geht.
Im kostenlosen Erstgespräch klären wir, ob lokale KI, deutsche Cloud oder eine Mischung für Sie am besten passt.
- Kostenlos und unverbindlich
- Antwort innerhalb von 24 Std.
- Remote oder vor Ort
Über 20 Jahre Softwareentwicklung und mehr als 12 Jahre Data Engineering, heute mit Schwerpunkt auf n8n und generativer KI. Studium an der TU Dresden.
Stand dieser Seite: Oktober 2026
Lokale KI für Ihr Unternehmen
Kostenlos und unverbindlich – Antwort in 24 Std.
2moove technologies GmbH
Ihr Partner für KI, Automatisierung & digitale Prozesse
Haben Sie Fragen? Schreiben Sie uns gerne.