NMS - New Media Service GmbH
Drei Personen arbeiten gemeinsam an einem Arbeitsplatz

Lokale KI im Unternehmen aufbauen und Firmenwissen anbinden

Lokale und hybride KI mit eigenem Firmenwissen: KI-Hosting in Deutschland, Rechte aus SharePoint, eigener KI-Server und was Copilot anders macht.

News

Eine KI weiß viel über die Welt und nichts über Ihr Unternehmen. Sie kennt keine Angebote aus dem letzten Jahr, keine Wartungsberichte, kein Qualitätshandbuch und nicht das, was zwei langjährige Kollegen über eine bestimmte Anlage im Kopf haben. Genau dieses Wissen macht eine KI im Alltag erst nützlich.

Die Frage ist deshalb nicht, ob man es der KI zugänglich macht, sondern wo. Wir unterstützen Unternehmen dabei, hochwertige KI-Lösungen im eigenen Unternehmen oder hybrid aufzubauen und ihr Wissen dafür bereitzustellen, ausgerichtet an den Anforderungen von DSGVO und NIS2. Dieser Beitrag zeigt, wie das geht, mit den Rechten, die im Unternehmen ohnehin gelten. Hybrid heißt dabei: Vertrauliches bleibt auf Systemen unter Ihrer Kontrolle, Unkritisches darf über einen Cloud-Dienst laufen, nach Regeln, die Sie festlegen.

Warum das Thema gerade jetzt drängt

Drei Zahlen, alle aus diesem und dem letzten Jahr:

  • 57 Prozent der Unternehmen ab 20 Beschäftigten setzen inzwischen KI ein. Aber 59 Prozent davon schöpfen das Potenzial nach eigener Einschätzung überhaupt nicht aus. (Bitkom, 14.09.2026)
  • In rund vier von zehn Unternehmen wissen oder vermuten die Verantwortlichen, dass Beschäftigte private KI-Zugänge für die Arbeit nutzen. Offiziell bereitgestellt hat generative KI nur gut ein Viertel. (Bitkom, 21.10.2025)
  • Im Schnitt gehen jedes Jahr 1,3 Millionen Menschen in Rente, nur rund 800.000 rücken nach. (IW Köln, 15.06.2026)

Die zweite Zahl heißt: Beschäftigte nutzen private KI-Zugänge für die Arbeit, und was sie dort eingeben, liegt außerhalb der Systeme, die das Unternehmen freigegeben hat. Die dritte heißt: Ein Teil des Wissens steht in keinem Dokument und geht mit den Menschen, die es haben.

Wie ChatGPT, aber mit Ihrem Firmenwissen: so funktioniert es

Die Technik dahinter heißt RAG, Retrieval Augmented Generation. Die KI wird nicht mit Ihren Dokumenten trainiert. Stattdessen sucht das System bei jeder Frage die passenden Abschnitte aus Ihrem Bestand heraus und gibt sie dem Sprachmodell als Grundlage für die Antwort. Die Antwort nennt ihre Quelle.

Das hat einen datenschutzrechtlichen Vorteil, den die Aufsichtsbehörden selbst benennen. Die Datenschutzkonferenz schreibt in ihrer Orientierungshilfe zu RAG-Systemen vom Oktober 2025: Im Sprachmodell selbst lässt sich nicht steuern, wer worauf zugreifen darf, in der Dokumentenbasis eines RAG-Systems dagegen schon, mit den bekannten Mitteln Rechte- und Rollenkonzept. Einträge lassen sich dort gezielt löschen. Und weil das Wissen aus Ihren Dokumenten kommt, genügt oft ein kleineres Modell, das auch auf eigenen Servern im Unternehmen laufen kann. So lässt sich vermeiden, dass personenbezogene Daten an Anbieter großer Online-Modelle gehen.

In fünf Schritten zum eigenen Wissenssystem

  1. Einen Anwendungsfall wählen, nicht alle. Etwa den technischen Innendienst, der Fragen zu Anlagen beantwortet, oder die Angebotsabteilung, die ähnliche Angebote sucht. Ein Fall, den man nach vier Wochen beurteilen kann.
  2. Die Quellen sichten. Welche Laufwerke, welche SharePoint-Bereiche, welches Wiki? Veraltete Preislisten und Dubletten gehören vorher aussortiert. Eine KI, die aus einer Liste von 2018 zitiert, verliert das Vertrauen am ersten Tag. Erfahrungswissen, das bisher nur in Köpfen steckt, wird vorher aufgeschrieben, etwa in kurzen Interviews.
  3. Die Rechte übernehmen. Mehr dazu im nächsten Abschnitt. Dieser Schritt entscheidet, ob das System ein Werkzeug wird oder ein Datenschutzvorfall.
  4. Klein anfangen und messen. Vorher steht fest, wer die Quellen pflegt und wer löscht, was gelöscht werden muss. Dann ein Pilot mit zehn bis fünfzehn Personen, die eine kurze Einweisung bekommen und echte Fragen stellen. Gezählt wird, wie oft die Antwort stimmt und wie oft die Quelle passt, nicht, wie beeindruckend sie klingt.
  5. Betrieb und Schulung auf Dauer festlegen. Wer spielt neue Modelle ein, wer prüft die Quellen regelmäßig? Und alle, die das System nutzen, brauchen eine Einweisung; Maßnahmen zur KI-Kompetenz verlangt der AI Act ohnehin.

Welcher Anwendungsfall sich bei Ihnen zuerst lohnt und welche Quellen dafür taugen, klären wir gern gemeinsam mit Ihnen.

Beratungstermin vereinbaren

Greift die KI auf alle Dateien zu? Nur, wenn man sie lässt

Ein Wissenssystem, das alle Dokumente kennt, kennt auch Gehaltslisten, Personalakten und Vorstandsprotokolle. Ohne Rechtekonzept kann jeder danach fragen.

Die Lösung ist, die vorhandenen Berechtigungen zu übernehmen: Wer eine Datei im Laufwerk oder in SharePoint nicht öffnen darf, bekommt sie, sobald die Rechte abgeglichen sind, auch in keiner Antwort zu sehen. Es gibt Software, die genau das kann. Onyx zum Beispiel gleicht die Rechte mit SharePoint ab, einschließlich verschachtelter Gruppen aus Entra ID, in der kostenpflichtigen Ausgabe. Dieser Punkt ist in der Planung der wichtigste und der, der am häufigsten übersprungen wird.

Zwei Grenzen gehören dazu. Rechte, die im Laufwerk geändert werden, kommen erst beim nächsten Abgleich im Wissenssystem an; wie oft der läuft, legt man fest. Und wer Zugriff auf ein Dokument hat, bekommt auch Zusammenfassungen daraus. Was im Laufwerk zu großzügig freigegeben ist, wird durch KI nicht geschützt, sondern leichter gefunden. Deshalb gehört eine Durchsicht der Freigaben vor den Start.

Lohnt sich ein eigener KI-Server?

Eine lächelnde Frau im grauen Blazer hält einen kleinen Rechner mit goldfarbener Front auf beiden Handflächen, im Hintergrund ein modernes BüroMit KI erzeugt

Lokale KI hieß lange: ein Serverraum voller Grafikkarten. Das hat sich geändert. Ein Beispiel ist NVIDIAs DGX Spark:

  • Speicher: 128 GB, gemeinsam für Prozessor und KI
  • Größe: 15 × 15 × 5 cm, 1,2 kg
  • Stromaufnahme: laut NVIDIA 38 Watt im Leerlauf, höchstens 233 Watt
  • Modellgröße laut NVIDIA: Inferenz bis 200 Milliarden Parameter, zwei gekoppelte Geräte bis 405 Milliarden
  • Beispielmessung: das offene Modell gpt-oss-120b mit rund 60 Token pro Sekunde bei einer einzelnen Anfrage, bei langem Kontext rund 40 (llama.cpp, Februar 2026); mit mehreren Nutzern gleichzeitig weniger je Person
  • Preis: bei deutschen Händlern ab rund 5.000 Euro netto, je nach Hersteller und SSD bis gut 8.000 Euro (Stand Ende September 2026)
Bildschirmfoto der NVIDIA DGX Spark-Spezifikationen: Architektur NVIDIA Grace Blackwell, 20-Core-Arm-CPU, Tensor-Leistung bis zu 1 PFLOP FP4, 128 GB LPDDR5x kohärenter einheitlicher Systemspeicher, 273 GB/s Speicherbandbreite, 4 TB NVMe-Datenspeicher

Bildschirmfoto: NVIDIA, DGX Spark, Spezifikationen, Ausschnitt, abgerufen am 30.09.2026.

Dasselbe Innenleben gibt es von Dell, HP, Lenovo, ASUS, Gigabyte, MSI und Acer.

Zwei Einschränkungen gehören dazu. Erstens ist der Speicher schnell genug für Modelle, die je Wort nur einen Teil ihrer Parameter nutzen, wie gpt-oss-120b. Große Modelle, die immer alle Parameter rechnen, laufen darauf deutlich langsamer; NVIDIA selbst misst für Llama 3.3 mit 70 Milliarden Parametern rund 4 Token pro Sekunde. Zweitens zählt für eine Abteilung nicht die Geschwindigkeit für einen einzelnen Nutzer, sondern die Last vieler gleichzeitiger Fragen. Die gehört vor dem Kauf gemessen, nicht geschätzt.

Alternativen sind Rechner mit AMDs Ryzen AI Max+ 395 (bis 128 GB), der Mac Studio mit M5 Ultra (bis 512 GB, diese Ausstattung ist für Ende Oktober angekündigt) und für größere Lasten klassische Server mit Grafikkarten wie der RTX PRO 6000 (96 GB je Karte). Alle sind 2026 wegen knapper Speicherchips teurer geworden; die DGX Spark etwa stieg im Februar von 4.180 auf 4.800 Euro in der Founders Edition.

Welches Modell darauf läuft, ist auch eine Lizenzfrage. Frei nutzbar unter Apache 2.0 sind unter anderem gpt-oss von OpenAI, Qwen 3.5 von Alibaba und Gemma 4 von Google. Bei Metas Llama 4 sind die Rechte an den multimodalen Modellen für Unternehmen mit Hauptsitz in der EU ausgeschlossen. Und die verbreitete Oberfläche Open WebUI steht seit April 2025 unter einer eigenen Lizenz, die ab mehr als 50 Nutzern Bedingungen an das Branding knüpft.

Copilot und Datenschutz: bleibt dort alles in der EU?

Microsoft 365 Copilot ist für viele der naheliegende Weg, und für Inhalte, die ohnehin in Microsoft 365 liegen, oft der richtige. Zwei Einstellungen sollte man dabei kennen, beide aus Microsofts eigener Dokumentation:

  • Flex Routing: Bei Lastspitzen darf die Verarbeitung der Anfragen außerhalb der EU Data Boundary laufen, in den USA, in Kanada oder in Australien. Gespeichert werden die Daten laut Microsoft weiter in der EU, bis auf begrenzte pseudonymisierte Daten. Für berechtigte Mandanten in der EU, die nach dem 25. März 2026 angelegt wurden, ist Flex Routing standardmäßig eingeschaltet; bei älteren Mandanten bittet Microsoft die Administratoren, die Einstellung zu prüfen.
  • Anthropic-Modelle in Word, Excel und PowerPoint: Diese Verarbeitung findet außerhalb der EU Data Boundary statt. Auch diese Einstellung ist für Mandanten in der EU, die nach dem 25. März 2026 angelegt wurden, standardmäßig an. Sie steht im Microsoft 365 Admin Center unter Copilot, Einstellungen, Alle anzeigen, „KI-Anbieter, die als Microsoft-Unterauftragsverarbeiter tätig sind“. Wer Anthropic dort nicht zulässt, kann diese Modelle in Word, Excel und PowerPoint nicht nutzen.
Bildschirmfoto von Microsoft Learn, Flex routing (EU and EFTA): Flex Routing ist standardmäßig an für berechtigte Mandanten, die nach dem 25. März 2026 angelegt wurden; Administratoren älterer Mandanten sollen die Einstellung im Microsoft 365 Admin Center prüfen

Bildschirmfoto: Microsoft Learn, „Flex routing (EU and EFTA)“, Stand 29.09.2026, Ausschnitt, abgerufen am 30.09.2026.

So schalten Sie Flex Routing ab:

  1. Im Microsoft 365 Admin Center mit einem Konto anmelden, das die Rolle KI-Administrator hat.
  2. Copilot, Einstellungen, Alle anzeigen öffnen und „Flexrouting während Spitzenlastzeiten“ wählen.
  3. „Flexibles Routing nicht erlauben“ auswählen und speichern.
Bildschirmfoto aus dem Microsoft 365 Admin Center: die Einstellung Flexrouting während Spitzenlastzeiten mit den zwei Optionen Flexibles Routing während Spitzenlastzeiten erlauben und Flexibles Routing nicht erlauben

Bildschirmfoto aus dem Microsoft 365 Admin Center, 30.09.2026: Copilot, Einstellungen, Alle anzeigen, „Flexrouting während Spitzenlastzeiten“. Die zweite Option schaltet Flex Routing ab; die Sprachmodelle von Copilot rechnen dann laut Microsoft auch bei Lastspitzen in der EU Data Boundary. Die Anthropic-Modelle regelt eine eigene Einstellung.

Wer Copilot einsetzt, prüft beide Schalter. Wer Daten hat, die das Unternehmen gar nicht verlassen dürfen, braucht für diese Daten ein System im eigenen Unternehmen. In der Praxis ist es oft beides: Copilot für die Breite, ein lokales System für den vertraulichen Kern.

Wir prüfen die Copilot-Einstellungen Ihres Mandanten und stellen sie auf Wunsch für Sie um: Kontakt aufnehmen.

Was der AI Act dazu sagt

Die Regeln für Hochrisiko-KI nach Anhang III, etwa in Personalauswahl oder Kreditprüfung, gelten durch den sogenannten Digital Omnibus erst ab dem 2. Dezember 2027, für Hochrisiko-KI in Produkten nach Anhang I ab dem 2. August 2028. Zwei Pflichten gelten aber schon:

  • KI-Kompetenz nach Artikel 4, seit dem 2. Februar 2025. Seit dem Omnibus lautet sie: Anbieter und Betreiber von KI-Systemen ergreifen Maßnahmen, um die Entwicklung der KI-Kompetenz ihres Personals zu unterstützen. Betreiber ist jedes Unternehmen, das KI in eigener Verantwortung einsetzt. Die Pflicht ist geblieben, auch wenn sie weicher formuliert ist.
  • Transparenz nach Artikel 50, seit dem 2. August 2026, etwa die Kennzeichnung, dass man mit einer KI spricht.
Bildschirmfoto aus EUR-Lex, Verordnung (EU) 2026/1744: Artikel 4 KI-Kompetenz in der neuen Fassung. Die Anbieter und Betreiber von KI-Systemen ergreifen Maßnahmen, um die Entwicklung der KI-Kompetenz ihres Personals zu unterstützen

Bildschirmfoto: Verordnung (EU) 2026/1744, Artikel 1 Nummer 5, auf EUR-Lex, Ausschnitt, abgerufen am 30.09.2026.

Ein internes Wissenssystem, das Fragen zu Handbüchern beantwortet, ist in aller Regel kein Hochrisikosystem. Maßnahmen zur KI-Kompetenz bleiben trotzdem Pflicht, etwa eine Einweisung, und sie gehören in Schritt 5. Wir schulen dafür Anwender und Administratoren.

NMS-Trainer bei einem Vortrag zu intelligenter Technologie für Unternehmen

Was der laufende Betrieb kostet, eine Beispielrechnung

Das ist eine Rechnung mit Annahmen, keine Messung. Sie zeigt nur die laufenden Kosten eines einzelnen Geräts. Einrichtung, Rechteabgleich und Lizenzen kommen dazu und hängen am Projekt.

  • Gerät der DGX-Spark-Klasse: 5.000 Euro netto über 36 Monate, rund 140 Euro im Monat
  • Strom: 150 Watt im Mittel (zwischen 38 und 233 Watt laut NVIDIA), 0,30 Euro je kWh, rund 33 Euro im Monat
  • Betrieb und Pflege: 4 Stunden zu 100 Euro, eher die Untergrenze, 400 Euro im Monat
  • Einrichtung, Rechteabgleich: je nach Quellen und Anwendungsfall, nicht beziffert
  • Lizenzen Wissenssoftware: je nach Produkt, teils frei, nicht beziffert
  • Zusammen, ohne die zwei offenen Posten: rund 570 Euro im Monat

Der größte Posten ist nicht das Gerät, sondern der Betrieb. Nicht enthalten sind die Einrichtung, Lizenzen für die Wissenssoftware, ein zweites Gerät für den Ausfall und die Frage, ob ein Gerät die Last Ihrer Nutzer trägt. Die Rechnung vergleicht Kosten, nicht Leistung.

Was wir tun

Zwei NMS-Kollegen besprechen gemeinsam Inhalte auf einem Tablet

Wir richten hochwertige KI-Lösungen in Ihrem Auftrag ein, auf Wunsch als KI-Hosting in Deutschland in unserem Rechenzentrum, bei Ihnen vor Ort oder in Ihrer Azure-Umgebung, mit Anmeldung über Ihr Microsoft-365-Konto. Sie bestimmen, wer das System wofür nutzt, und sind damit Betreiber im Sinne der KI-Verordnung; wir kümmern uns um Technik, Updates und Wartung. Wir beginnen mit dem Anwendungsfall und den Quellen, nicht mit der Hardware. Und wenn sich herausstellt, dass Copilot für Ihre Daten genügt, sagen wir Ihnen das auch.

Sprechen Sie uns an, telefonisch unter +49 7731 969390 oder per E-Mail an info@nms.de.

Kontakt aufnehmen

Mehr dazu auf unserer Seite zu Self-Hosted KI und im Beitrag Lokale KI-Systeme im Unternehmen.

Quellen

Alle Quellen abgerufen am 30.09.2026.