Private KI

KI nutzen, ohne die Kontrolle über Ihre Daten abzugeben.

Wir implementieren und betreiben private KI-Umgebungen für Unternehmen und Organisationen mit erhöhten Anforderungen an Vertraulichkeit, Leistungsfähigkeit und regulatorische Nachweisbarkeit.

  • keine Nutzung von Kundendaten für allgemeines oder fremdes Modelltraining
  • eigene Kundenumgebung
  • verschlüsselte Datenhaltung
  • Betrieb in Deutschland oder beim Kunden
Beratung und Betriebsmodelle

Private KI wird aus den Anforderungen entwickelt

Private KI beginnt mit dem konkreten Anwendungsfall. Wir analysieren, welche Modelle, Leistungen, Integrationen und Betriebsbedingungen benötigt werden, und entwickeln daraus eine kundenspezifische KI-Umgebung.

Jeder Kunde erhält eine eigene konfigurierte Weboberfläche. GPU-Ressourcen, Datenbanken, Terminalumgebungen und weitere Komponenten werden entsprechend dem tatsächlichen Bedarf ergänzt.

01 · Skalierbar

Skalierbare Private KI

Der Kunde erhält eine eigene Weboberfläche, eigene Benutzer- und Berechtigungsstrukturen sowie eine logisch getrennte Kundenumgebung. Die Inferenzleistung kann bedarfsgerecht aus einer gemeinsam betriebenen GPU-Infrastruktur bereitgestellt werden.

Geeignet, wenn leistungsfähige Sprachmodelle benötigt werden, dauerhaft exklusiv reservierte GPU-Ressourcen aber technisch oder wirtschaftlich nicht erforderlich sind.

02 · Dediziert

Dedizierte Private KI

Exklusiv zugewiesene GPU-Ressourcen und eine vollständig auf den Kunden ausgerichtete technische Umgebung. Dieses Betriebsmodell eignet sich für besonders sensible Daten, kontinuierlich hohe Auslastung, spezielle Modelle, individuelle Integrationen oder Anforderungen an eine weitgehende technische Isolation.

Umfang, Hardware, Datenhaltung, Netzwerkarchitektur und ergänzende Systeme werden projektspezifisch festgelegt.

Die Architektur folgt dem Bedarf

Nicht jeder Anwendungsfall benötigt eigene GPU-Hardware, eine separate Datenbank oder eine Terminalumgebung. Ebenso ist eine gemeinsam bereitgestellte Inferenzleistung nicht für jeden Einsatzbereich geeignet. Wir prüfen die Anforderungen und empfehlen das Betriebsmodell, das technisch, organisatorisch und wirtschaftlich zum Kunden passt.

GPU-Leistung

Rechenleistung passend zum Anwendungsfall

Die benötigte GPU-Leistung ergibt sich aus Modellgröße, Quantisierung, Kontextlänge, gleichzeitigen Nutzern, Antwortgeschwindigkeit und vorgesehenen Werkzeugen. Die folgenden Kapazitäten zeigen verfügbare Ausbaustufen und sind keine vorgegebenen Standardpakete.

Bis zu 192 GB VRAM
Für leistungsfähige skalierbare oder projektspezifische KI-Umgebungen. Die konkrete Auslegung erfolgt nach technischer Bedarfsanalyse.
Bis zu 384 GB VRAM
Für größere Modelle, höhere Parallelität und anspruchsvollere Einsatzszenarien. Die konkrete Auslegung erfolgt nach technischer Bedarfsanalyse.
Bis zu 576 GB VRAM
Für dedizierte Umgebungen, besonders große Modelle oder hohe kontinuierliche Auslastung. Die konkrete Auslegung erfolgt nach technischer Bedarfsanalyse.
Kundeneigene Umgebung

Ihre eigene KI-Arbeitsumgebung

Jeder Kunde erhält eine eigene, kundenspezifisch konfigurierte Weboberfläche mit eigener Benutzer- und Berechtigungsstruktur. Branding, verfügbare Modelle, Funktionen, Werkzeuge und Integrationen werden entsprechend dem vereinbarten Einsatzbereich eingerichtet.

Eine eigene Datenbank, isolierte Terminal- oder Containerumgebungen und weitere technische Komponenten werden ergänzt, wenn der Anwendungsfall dies erfordert.

Optionale Erweiterung

Automatisierte Arbeitsabläufe mit selbst gehosteten Agenten

Optionale Agentensysteme können in einer getrennten VM oder Containerumgebung auf ausdrücklich freigegebene Werkzeuge, Datenquellen und Anwendungen zugreifen.

  • isolierte Ausführung in einer eigenen Umgebung
  • Zugriff nur auf ausdrücklich freigegebene Systeme
  • Technische Aufgaben innerhalb definierter Grenzen unterstützen
  • Der Kunde legt Rechte, Umfang und zulässige Aktionen fest.
Modelloffenheit

Modellwahl ohne erzwungenen Plattformwechsel

Bei geschlossenen KI-Plattformen bestimmt der jeweilige Anbieter, welche Modelle und Versionen verfügbar bleiben, wann sie ersetzt werden und zu welchen Konditionen sie genutzt werden können. Ein Modellwechsel kann dadurch notwendig werden, obwohl das bisherige Modell den eigenen Anforderungen weiterhin entspricht.

In unserer offenen Architektur wählen wir Modellfamilie, Modellversion, Größe und Quantisierung anhand des tatsächlichen Anwendungsfalls. Ein eingeführtes Modell wird nicht automatisch durch eine neue Version ersetzt. Der Kunde entscheidet gemeinsam mit uns, ob und wann ein Wechsel sinnvoll ist.

Auf Wunsch kann eine bewährte Modellversion langfristig weiterbetrieben werden, sofern Lizenzbedingungen, Sicherheitslage, technische Kompatibilität und verfügbare Hardware dies weiterhin zulassen.

Datenhoheit

Ihre Daten bleiben Ihre Daten.

Kundendaten werden nicht für allgemeine Modelle oder für Modelle anderer Kunden verwendet. Eine kundenspezifische Modellanpassung oder ein Training erfolgt ausschließlich im ausdrücklichen Auftrag, für den vereinbarten Zweck und die Umgebung des jeweiligen Kunden. Daten und daraus entstehende Anpassungen werden nicht für Modelle anderer Kunden genutzt.

  • keine Nutzung für allgemeines oder fremdes Modelltraining
  • Andere Kunden haben keinen Zugriff auf Daten, Dokumente, Gesprächsverläufe oder Prompts.
  • Administratoren haben keinen routinemäßigen Zugriff auf Prompts, Dokumente oder Gesprächsinhalte.
  • verschlüsselte Datenhaltung und Backups

Getrennte Kundenumgebungen auch bei skalierbarer Inferenz

Auch wenn die zugrunde liegende GPU-Infrastruktur von mehreren Kunden genutzt wird, arbeiten die Kunden nicht in einer gemeinsamen Weboberfläche oder Datenumgebung. Jeder Kunde verfügt über eine eigene Instanz beziehungsweise einen eigenen logisch getrennten Zugang mit eigener Benutzer-, Daten- und Berechtigungsstruktur.

Für eine Anfrage werden die erforderlichen Eingaben an die Inferenzumgebung übergeben und dort temporär im Arbeitsspeicher beziehungsweise GPU-Speicher verarbeitet. Eine normale Inferenz verändert die Modellgewichte nicht automatisch. Das Ergebnis wird an die Kundenumgebung zurückgegeben.

Gesprächsverläufe, Dokumente oder Ergebnisse werden dauerhaft nur in den vorgesehenen Kundenkomponenten und entsprechend der vereinbarten Konfiguration gespeichert.

Ein technischer Zugriff erfolgt nur, wenn er für einen ausdrücklich beauftragten Support- oder Wiederherstellungsfall erforderlich ist, und wird auf den notwendigen Zweck, Zeitraum und Berechtigungsumfang begrenzt.

Implementierung und Dokumentation

Von der Anforderung zum dokumentierten Betrieb

  • Auftragsverarbeitungsvereinbarung
  • technische und organisatorische Maßnahmen
  • Rollen und Berechtigungen
  • Lösch- und Aufbewahrungskonzept
  • Backup- und Wiederherstellungskonzept
  • Notfall- und Wiederanlaufplanung
  • administrative Zugriffe
  • Architektur- und Betriebsdokumentation
  • Service-Level und Betriebsvereinbarungen

Der konkrete Dokumentationsumfang richtet sich nach Betriebsmodell, Schutzbedarf, regulatorischem Kontext und vertraglicher Vereinbarung. Je nach vereinbartem Leistungs- und Betriebsumfang können die Umgebungen entsprechend den anwendbaren technischen und organisatorischen Anforderungen ausgestaltet, betrieben und dokumentiert werden. Sie eignen sich insbesondere zur Unterstützung von Anforderungen aus DSGVO, DORA, NIS2 und Informationssicherheit.

Welche Anforderungen im konkreten Fall einschlägig sind und welche Verantwortlichkeiten bei Kunde und Betreiber liegen, wird im Rahmen des jeweiligen Projekts und der vertraglichen Vereinbarungen festgelegt.

FAQ

Häufige Fragen zu Private KI

Werden Kundendaten für das Training von Modellen verwendet?

Nicht für allgemeine Modelle und nicht für Modelle anderer Kunden. Kundendaten können ausschließlich dann für eine kundenspezifische Modellanpassung oder ein Training verwendet werden, wenn der jeweilige Kunde dies ausdrücklich beauftragt. Die Verarbeitung erfolgt ausschließlich für den vereinbarten Zweck und die Umgebung dieses Kunden. Ohne einen solchen Auftrag werden Kundendaten nicht zum Nachtrainieren von Modellen verwendet.

Benötigen wir eine dedizierte GPU-Umgebung?

Nicht zwingend. Ob gemeinsam bereitgestellte Inferenzleistung oder exklusiv zugewiesene GPU-Ressourcen sinnvoll sind, hängt unter anderem von Auslastung, Modellen, Datenarten, Integrationen, Verfügbarkeit und wirtschaftlichem Rahmen ab. Wir ermitteln den Bedarf und entwickeln daraus das passende Betriebsmodell.

Können wir eine bestimmte Modellversion langfristig weiterverwenden?

Grundsätzlich ja. Eine eingeführte Modellversion wird nicht automatisch durch ein neueres Modell ersetzt. Ein langfristiger Weiterbetrieb ist möglich, solange Lizenzbedingungen, Sicherheitslage, technische Kompatibilität und verfügbare Hardware dies zulassen. Einen Wechsel stimmen wir mit dem Kunden ab.

Wie bleiben Kundendaten bei skalierbarer Inferenz getrennt?

Jeder Kunde arbeitet in einer eigenen logisch getrennten Kundeninstanz mit eigener Weboberfläche, Benutzer-, Daten- und Berechtigungsstruktur. Gemeinsam bereitgestellt werden kann die technische Inferenzleistung, nicht die Kundenumgebung. Andere Kunden erhalten keinen Zugriff auf Daten, Dokumente, Gesprächsverläufe oder Prompts.

Projektgespräch

Welche Private-KI-Umgebung passt zu Ihren Anforderungen?

Auf Wunsch schließen wir bereits vor der Übermittlung sensibler Projektinformationen eine Vertraulichkeitsvereinbarung ab.