DIE MASCHINE IM DETAIL

Eine Appliance. Drei Schichten. Ein Vertragspartner.

Die zenpAI-Appliance verbindet Hardware, lokales Modell und Agenten-Orchestrierung zu einem kontrollierbaren KI-System auf Ihrer eigenen Infrastruktur. Auf dieser Seite zeigen wir die Bestandteile im Detail: Sicherheitsarchitektur, Stack, Hardware-Klassen und Betrieb.

§01

Sicherheit als Architektur.

KEIN ENDPUNKT · KEINE FREMDE JURISDIKTION

Sicherheit ist bei uns keine Zusatzfunktion, sondern Teil der Architektur: keine geteilte Cloud-Hardware, keine externe Inferenz, keine fremden Administratoren auf Ihren Daten. Ihre Daten bleiben dort, wo sie hingehören — bei Ihnen.

GDPR DSGVO Erfüllt die strengen DSGVO- & EU-AI-Act-Anforderungen — kein US CLOUD Act, kein Drittland.
01

0 % Cloud-Exposition

Alle Inferenz, alle Modell-Gewichte, alle Trainings-Pipelines verbleiben auf Ihrer Hardware. Kein Sub-Prozessor, kein Drittland.

02

Lokales Audit-Log

Jede Anmeldung, jeder Tool-Aufruf und jede relevante Antwort wird lokal protokolliert. Das schafft Nachvollziehbarkeit für interne Kontrollen, Compliance-Prozesse und AI-Act-Dokumentation.

§02

Der Stack.

VON DER ANWENDUNG BIS ZUR HARDWARE

Sieben Schichten, eine Verantwortung. Bewährte Rechenzentrums-Software statt Bastellösung: ein gehärtetes Linux mit optimierten Treibern, darüber Kubernetes nach GitOps-Prinzip — versioniert und auditierbar — und an der Spitze die Agenten-Schicht, die orchestriert — Aufgaben delegiert, Zustand hält, Abläufe steuert — und dabei die Governance setzt.

§02 · B — ARCHITEKTUR

Was im Rack tatsächlich läuft — von der Anwendung bis zur Hardware.

ANWENDUNGEN Nutzeroberflächen, mit denen gearbeitet wird
OpenWebUIStreamlitJetBrains JunieMCP-Clients
AGENTEN-SCHICHT Orchestriert Prozesse und hält den Kontext
LangGraphModel Context ProtocolOAuth / LDAP / SSOlokales Audit-Log
INFERENZ- UND MODELLSCHICHT Führt lokale KI-Modelle effizient auf der GPU aus
vLLMllama.cppTensorRT-LLMSGLangLlamaQwenDeepSeekGLMKimiMistralLoRA-Pipeline
PLATTFORM Deployment, Updates und Betrieb
KubernetesArgoCDHelmGitOpsGehärtetes LinuxNVIDIA-Treiber / CUDAcontainerd
HARDWARE GPU-Server in Ihrem Rack
NVIDIA Enterprise-GPUDELL PowerEdgeAMD EPYCredundante PSU
§03

Hardware-Klassen.

EIN SIZING-MODELL · VRAM · TOPS · NUTZER · kW

Drei Baugrößen, an Ihrer Last ausgerichtet. Standardkonfiguration auf Basis der aktuellen Blackwell-Generation; finale GPU, VRAM und Netzteil-Redundanz legen wir nach Last- und Latenz-Profil gemeinsam fest.

SFOUNDATION / PILOT
GPU
1× NVIDIA RTX PRO 6000 · Blackwell
VRAM
96 GB
AI-Leistung
~4.000 TOPS
Leistung max
~1 kW
Nutzer
1–10
MPROFESSIONAL TEAM
GPU
4× NVIDIA RTX PRO 6000 · Blackwell
VRAM
384 GB
AI-Leistung
~16.000 TOPS
Leistung max
~3 kW
Nutzer
10–60
LCUSTOM ENTERPRISE
GPU
8× NVIDIA RTX PRO 6000 · Blackwell
VRAM
768 GB
AI-Leistung
~32.000 TOPS
Leistung max
~5,5 kW
Nutzer
60–200
IndividualMAXIMALE AUSBAUSTUFE
GPU
Individuell ausgelegt
VRAM
nach Bedarf
AI-Leistung
nach Bedarf
Leistung max
individuell
Nutzer
200+

Nutzerzahlen je nach Modell und Last. Die Appliance wächst mit: Sie lässt sich jederzeit nach oben skalieren — zusätzliche GPU-Leistung rüsten wir bei Bedarf nach. Auf Anfrage.

§04

Wie wir liefern.

VOM ERSTGESPRÄCH BIS PRODUKTIV · IN PHASEN

Hardware kaufen kann jeder — die eigentliche Arbeit ist die Umsetzung: Integration, Datenbereinigung, agentische Workflows. Wir nehmen sie Ihnen ab, von der Prozessaufnahme bis zum laufenden Betrieb — in klar abgegrenzten Phasen, abgerechnet pro Phase — der Zeitrahmen variiert je nach Kunde und Umfang. Zeigt die erste Phase, dass es noch zu früh ist, sagen wir das, bevor Hardware bestellt wird.

VOR PROJEKTSTART

Beratung & Pilot

Bestandsaufnahme: wo drückt der Schuh, welche Daten, welche Tools? Wir wählen den ersten Use-Case und zeigen schnell ein konkretes Ergebnis — mit der ehrlichen Option, danach abzubrechen.

PHASE 1

Analyse & Daten

Datenpfade aufnehmen, Ziele definieren. Der größte Teil ist Datenbereinigung — verstreute Bestände produktionsreif machen.

PHASE 2

Bau & Feintuning

Die Appliance wird ins Rack eingebaut und ans Netz gebracht. Das Modell wird auf Ihrer Domäne feinjustiert und für Ihre GPU quantisiert.

PHASE 3

Orchestrierung & Übergabe

Agenten-Schicht auf Ihren Prozess gesetzt, Pilotbetrieb, Schulung Ihrer IT, vollständige Übergabe. Sie übernehmen, wir bleiben auf Abruf — kein Lock-in.

Klingt nach Ihrem Vorhaben? Erstgespräch vereinbaren

§05

Betrieb nach Go-Live.

BETRIEB · OPTIONAL BUCHBAR

Eine On-Premise-KI muss betrieben werden — überwacht, aktualisiert, gepflegt. Standardmäßig übergeben wir Ihnen alles vollständig, sodass Ihre IT selbst betreiben kann. Auf Wunsch übernehmen wir den Betrieb aber komplett — aus der Ferne, zu einem festen Monatspreis. Keine Token-Gebühren, keine Nutzungsabrechnung, keine Überraschungen.

IM SERVICE ENTHALTEN
  • Kontinuierliche Überwachung rund um die Uhr — GPU, Speicher, Latenzen, Systemstatus
  • Sicherheits- und System-Updates des gehärteten Linux-Stacks
  • Aktuelle, kuratierte Modelle — neue Generationen werden laufend evaluiert und bereitgestellt
  • Remote-Support und Fehleranalyse
  • Hardware-Frühwarnung und Upgrade-Empfehlungen
ZUSATZBUCHUNGEN · PROJEKTBASIERT
  • Re-Training und RAG-Optimierung auf Ihren eigenen Daten
  • Individuelle Entwicklung und Integration
  • Vor-Ort-Einsätze nach Vereinbarung

Nicht im Monatspreis: die Hardware als einmaliger Kauf (siehe §04 Wirtschaftlichkeit) sowie — bei größeren Konfigurationen — die Kühlung. Monatspreis auf Anfrage — abhängig von Hardware-Klasse und gewünschter Reaktionszeit.

Eine Appliance, ein Vertragspartner — sprechen wir.

Konkrete Hardware-Klasse, Modellfamilie und Integrationstiefe legen wir nicht per Konfigurator fest, sondern gemeinsam mit Ihnen — sobald wir Ihre Datenlage, Systeme und Ihren ersten Use-Case verstanden haben.

Erstgespräch vereinbaren →
Erstgespräch vereinbaren →