Was „lokale KI“ eigentlich heißt
Wer von „lokaler KI“ spricht, meint oft zwei verschiedene Dinge. Diese Unterscheidung ist die wichtigste in der ganzen Debatte.
- Das Modell läuft lokal: Das Sprachmodell selbst rechnet auf Ihrer Hardware oder in Ihrem Rechenzentrum. Keine Anfrage verlässt Ihre Umgebung.
- Daten und Wissen liegen lokal: Dokumente, Wissensbasis, Memory, Rechte und Protokolle liegen bei Ihnen. Das Sprachmodell kann trotzdem extern sein und bekommt nur den Ausschnitt, den es für eine Aufgabe braucht.
Beides wird gern als „eigene KI“ verkauft. Für Ihre Entscheidung ist der Unterschied aber erheblich. Im ersten Fall tragen Sie die Rechenlast und akzeptieren die Grenzen offener Modelle. Im zweiten Fall behalten Sie die Kontrolle über das, was Ihr Unternehmen ausmacht, und nutzen trotzdem die stärksten verfügbaren Modelle. Der Begriff On-Premise-KI beschreibt meist den ersten Fall, also KI auf eigener Infrastruktur.
Warum gerade so viele nach lokaler KI suchen
Das Interesse an lokaler KI und an einer eigenen KI im Unternehmen ist in den letzten Monaten deutlich gestiegen. Dafür gibt es drei nachvollziehbare Gründe.
- Datenschutz bremst: Laut einer Bitkom-Umfrage unter 603 Unternehmen ab 20 Beschäftigten nutzen erstmals 57 Prozent der Unternehmen in Deutschland KI. Unter den Nutzern nennen 66 Prozent die Anforderungen an den Datenschutz als Hemmnis (Bitkom, 14.09.2026).
- Abhängigkeit von wenigen Anbietern: Viele Geschäftsführer wollen nicht, dass Kernprozesse an Preisen, Bedingungen oder Verfügbarkeit eines einzelnen US-Anbieters hängen.
- Offene Modelle sind besser geworden: Modelle mit frei verfügbaren Gewichten lassen sich heute mit Werkzeugen wie Ollama oder vLLM vergleichsweise einfach auf eigenen Servern betreiben. Selbst OpenAI hat mit gpt-oss offene Modelle unter Apache-2.0-Lizenz veröffentlicht (OpenAI).
Die Suchergebnisse zu „lokale KI“ zeigen allerdings vor allem Anleitungen für den eigenen PC und Anbieterwerbung. Für ein Unternehmen ist die Frage eine andere: Welche Betriebsart passt zu meinen Daten, Aufgaben und Ressourcen?
Die vier Betriebsarten im Vergleich
Zwischen „alles in der Cloud“ und „alles im eigenen Keller“ gibt es zwei sinnvolle Zwischenstufen. In der Praxis sind es vier Betriebsarten:
| Betriebsart | Wo liegen die Daten? | Modellqualität | Aufwand für Sie | Passt für |
|---|---|---|---|---|
| Betreute Cloud-Instanz | Beim Anbieter, Modelle per API, wo möglich mit EU-Verarbeitung | Sehr hoch, Zugriff auf führende Modelle | Gering | Schneller Start, breite Aufgaben, normale Vertraulichkeit |
| Auf Ihrem Server | Eigene Hardware oder eigener Cloud-Account, z. B. in Deutschland | Je nach Modellwahl hoch bis sehr hoch | Mittel | Klare Vorgaben zum Speicherort, eigene IT vorhanden |
| Hybrid | Wissen, Memory, Agenten und Protokoll bei Ihnen, einzelne Anfragen an ein Modell per API | Sehr hoch für anspruchsvolle Aufgaben | Mittel | Die meisten Mittelständler mit sensiblem Wissen |
| Vollständig lokal | Alles im Haus, offene Modelle über Ollama oder vLLM | Gut für Standardaufgaben, schwächer bei komplexem Schlussfolgern | Hoch | Streng vertrauliche Daten, Geheimnisschutz, abgeschottete Netze |
Keine Betriebsart ist pauschal die richtige. Entscheidend ist, welche Daten in welche Aufgabe fließen und wie gut ein Modell diese Aufgabe lösen muss.
Was lokale Modelle heute können und was nicht
Bekannte Familien offener Modelle sind unter anderem Llama von Meta, die Modelle von Mistral, Qwen von Alibaba, Gemma von Google und gpt-oss von OpenAI. Sie liegen in vielen Größen vor, von kleinen Modellen für einen Arbeitsplatzrechner bis zu großen Modellen für Rechenzentrums-GPUs.
Wo lokale Modelle gut sind
- Texte zusammenfassen und umformulieren
- Im eigenen Wissen suchen und Antworten mit Quellen geben, etwa über RAG
- Dokumente, E-Mails oder Tickets klassifizieren und Daten extrahieren
- Entwürfe für Standardschreiben erstellen
Wo die Grenzen liegen
- Komplexes Schlussfolgern: Bei mehrstufigen Analysen und schwierigen Abwägungen liegen offene Modelle in der Regel hinter den stärksten proprietären Modellen.
- Agentenaufgaben: Wenn eine KI selbstständig Werkzeuge nutzt, mehrere Schritte plant und Fehler korrigiert, zeigen sich die Unterschiede besonders deutlich.
- Größe kostet: Je näher ein offenes Modell an die Spitzenmodelle heranreicht, desto größer ist es meist und desto mehr Hardware braucht es.
Prüfen Sie deshalb nicht „das beste Modell“, sondern das passende Modell für jede Aufgabe. Ein kleines lokales Modell für die Wissenssuche und ein starkes Modell per API für die Angebotsanalyse sind kein Widerspruch.
Was Sie für den lokalen Betrieb brauchen
Ein Modell herunterzuladen ist einfach. Eine eigene KI im Unternehmen zuverlässig zu betreiben ist eine andere Aufgabe. Planen Sie diese Punkte ein:
- Hardware: Für flüssiges Arbeiten mit mehreren Nutzern brauchen Sie GPUs mit ausreichend Grafikspeicher (VRAM). Die nötige Größe hängt vom Modell, von der Zahl gleichzeitiger Nutzer und von der Länge der Dokumente ab.
- Betrieb: Jemand muss Server, Container (etwa mit Docker), Modellserver und Schnittstellen am Laufen halten, auch im Urlaub und nachts.
- Updates: Modelle, Bibliotheken und Betriebssystem brauchen regelmäßige Aktualisierung. Neue Modellversionen sollten Sie vor dem Wechsel mit Ihren eigenen Aufgaben testen.
- Zugriffsrechte: Die KI darf nur zeigen, was die jeweilige Person auch sonst sehen darf. Das erfordert eine Anbindung an Ihre Rechteverwaltung.
- Backups: Wissensbasis, Memory und Konfiguration müssen gesichert und wiederherstellbar sein.
- Monitoring und Protokoll: Sie sollten sehen, wer was gefragt hat, welche Aktionen ausgelöst wurden und ob das System stabil läuft.
- Sicherheit: Ein lokaler Modellserver ist ein neues System im Netz. Er braucht Härtung, Netztrennung und Schutz vor Missbrauch. Mehr dazu im Ratgeber Sicherheit von KI-Agenten.
Diese Arbeit verschwindet nicht. Sie liegt entweder bei Ihrer IT oder bei einem Dienstleister, der den Betrieb übernimmt.
Der unterschätzte Punkt: Wem gehört das Wissen?
In der Diskussion „lokal oder Cloud“ steht meist das Modell im Mittelpunkt. Auf lange Sicht ist etwas anderes wichtiger: das Wissen, das Ihre KI über Ihr Unternehmen aufbaut. Dazu gehören die Wissensbasis, das Memory mit Entscheidungen und Zusammenhängen, die Regeln für Agenten und das Protokoll aller Vorgänge.
Sprachmodelle entwickeln sich schnell. Was heute führend ist, wird in einem Jahr überholt sein. Ihr Unternehmenswissen dagegen wächst über Jahre. Daraus folgen zwei Grundsätze:
- Wissen und Memory gehören in Ihre Hoheit, in einem Format, das Sie exportieren und weiterverwenden können.
- Modelle sollten austauschbar sein, ohne dass Sie Wissen, Einstellungen oder Identität Ihrer KI neu aufbauen müssen.
Eine lokale Wissensdatenbank ist deshalb oft der wirksamste Schritt, auch wenn das Modell selbst extern bleibt. Wie Sie Wissen dafür aufbereiten, lesen Sie im Ratgeber Wissensmanagement mit KI und in ChatGPT mit eigenen Daten.
Entscheidungshilfe: lokal, hybrid oder Cloud?
Beantworten Sie für jeden geplanten Anwendungsfall diese Fragen:
- Welche Daten fließen ein: öffentliche Informationen, interne Dokumente, personenbezogene Daten oder Geschäftsgeheimnisse?
- Gibt es vertragliche, berufsrechtliche oder behördliche Vorgaben, die eine Verarbeitung außerhalb Ihrer Umgebung ausschließen?
- Wie anspruchsvoll ist die Aufgabe: Zusammenfassen und Suchen oder mehrstufige Analyse mit Werkzeugnutzung?
- Wie viele Personen nutzen die KI gleichzeitig, und wie schnell müssen Antworten kommen?
- Haben Sie IT-Kapazität für Betrieb, Updates und Sicherheit, oder soll ein Partner das übernehmen?
- Wie wichtig ist es, Modelle später wechseln zu können?
Faustregeln
- Vollständig lokal, wenn Daten das Haus unter keinen Umständen verlassen dürfen und die Aufgaben mit offenen Modellen gut lösbar sind.
- Hybrid, wenn Ihr Wissen sensibel ist, Sie aber für anspruchsvolle Aufgaben die stärksten Modelle nutzen wollen.
- Auf Ihrem Server, wenn der Speicherort klar geregelt sein muss und Sie eigene Infrastruktur oder einen eigenen Cloud-Account haben.
- Betreute Cloud, wenn Sie schnell starten wollen und Ihre Daten mit Auftragsverarbeitungsvertrag und geeigneten Garantien verarbeitet werden dürfen.
Die Antwort kann je Anwendungsfall unterschiedlich ausfallen. Eine strukturierte Einschätzung bietet der KI-Check.
Datenschutz: was lokal ändert und was nicht
Die DSGVO verbietet die Cloud nicht. Wer einen Dienstleister mit der Verarbeitung personenbezogener Daten beauftragt, braucht einen Vertrag zur Auftragsverarbeitung nach Art. 28 DSGVO und muss prüfen, ob der Anbieter geeignete technische und organisatorische Maßnahmen trifft.
Für Übermittlungen in die USA gilt seit dem 10. Juli 2023 der Angemessenheitsbeschluss zum EU-US Data Privacy Framework. Das Gericht der EU hat ihn im September 2025 bestätigt. Gegen dieses Urteil ist ein Rechtsmittel beim Europäischen Gerichtshof anhängig (Rechtssache C-703/25 P). Wer US-Anbieter nutzt, sollte deshalb Standardvertragsklauseln als zweite Grundlage vorsehen und die Entwicklung beobachten. Den aktuellen Stand finden Sie bei der Europäischen Kommission.
Lokaler Betrieb reduziert die Zahl der Beteiligten und der Übermittlungen. Er ersetzt aber kein Datenschutzkonzept. Auch eine vollständig lokale KI braucht:
- ein Rechtekonzept, damit niemand über die KI an Daten kommt, die er nicht sehen darf
- ein Löschkonzept für Wissensbasis, Memory und Protokolle
- eine Rechtsgrundlage und Zweckbindung für die Verarbeitung
- Transparenz gegenüber Mitarbeitenden und gegebenenfalls eine Datenschutz-Folgenabschätzung
Mehr zur Cloud-Nutzung lesen Sie im Ratgeber ChatGPT und Datenschutz im Unternehmen.
Wie ELEVUM das umsetzt
ELEVUM baut jedem Unternehmen eine eigene Unternehmens-KI: eine eigene Instanz mit Namen, Memory, Wissen, spezialisierten KI-Agenten, Integrationen, Freigaben und Audit. Grundlage ist ELEVUM AI Core. Er ist modellunabhängig: Über den AI Provider Layer lassen sich Sprachmodelle austauschbar anbinden, während Memory und Identität Ihrer KI erhalten bleiben.
Eine Instanz kann auf vier Arten laufen:
- Betreute Cloud-Instanz: Sprachmodelle per API, wo möglich mit EU-Verarbeitung.
- Auf Ihrem Server: auf eigener Hardware im Haus oder in Ihrem eigenen Cloud-Account oder Rechenzentrum, zum Beispiel in Deutschland.
- Hybrid: Wissen, Memory, Agenten und Protokoll laufen bei Ihnen. Nur für anspruchsvolle Aufgaben wird ein Sprachmodell per API gefragt.
- Vollständig lokal: mit offenen Modellen über Ollama oder vLLM, ohne dass Daten das Haus verlassen.
Welche Betriebsart passt, entscheiden wir gemeinsam pro Projekt, anhand Ihrer Daten, Aufgaben und Vorgaben. Details zur Architektur finden Sie unter Technologie, zu Schutzmaßnahmen unter Sicherheit und Datenschutz und zum Preismodell unter Kosten.