DSGVO by Design
Art. 6 & 9 DSGVO · keine Auftragsverarbeitung
Firmendaten und Prompts werden ausschließlich im eigenen Netz verarbeitet. Kein Datentransfer in US-Clouds, kein Schrems-II-Risiko, kein AV-Vertrag mit einem Hyperscaler nötig.
Ein Large Language Model beantwortet Fragen, durchsucht Ihre Dokumente und automatisiert Fachaufgaben – wie ChatGPT, nur lokal in Ihrem Haus. Wir betreiben es mit quelloffenen Modellen: kein Cloud-Zwang, keine Abrechnung pro Anfrage, kein Firmendatum verlässt Ihr Netz. Sie lernen, es selbst zu betreiben – oder wir richten Ihren KI-Assistenten ein und schulen Ihr Team.
On-Premise
auf Ihrer eigenen Hardware
0 € / Anfrage
keine Cloud-Abrechnung
100 % Open Source
kein Vendor-Lock-in
WAS SIE IM WORKSHOP AUFBAUEN
Wir setzen einen kompletten, quelloffenen LLM-Stack auf Ihrer Hardware auf und machen Ihr Team damit produktiv. Zwei Wege: Sie lernen, alles selbst zu betreiben – oder wir übernehmen Einrichtung und Wartung und schulen die Anwender.
Eine vertraute Chat-Oberfläche (Open WebUI) für Ihr Team – mit Benutzerkonten, Rollen und Verlauf. Fühlt sich an wie die bekannten Cloud-Dienste, läuft aber vollständig in Ihrem Netz.
Wir arbeiten mit den führenden freien Modellen – Llama 3.x, Qwen 2.5/3, Mistral & Mixtral, Gemma. Auswählbar nach Sprache, Fachlichkeit, Antwortqualität und dem VRAM Ihrer Hardware.
Stabiler, schneller Betrieb über Ollama, vLLM oder llama.cpp – vom Einzelplatz bis zum Team-Server mit mehreren gleichzeitigen Nutzern. Als API im Haus für Ihre eigenen Anwendungen nutzbar.
Der Assistent antwortet aus Ihren Handbüchern, Verträgen und Wikis – mit Quellenangabe. Über Embeddings und eine Vektor-Datenbank (pgvector oder Qdrant) findet er die richtige Stelle, statt zu raten.
Auf Wunsch spezialisieren wir ein Modell per LoRA auf Ihren Fachjargon, Ihren Ton und Ihre Formate – reproduzierbar und ohne dass Trainingsdaten das Haus verlassen.
Function-Calling verbindet den Assistenten mit Ihren Systemen – er ruft Funktionen auf, statt nur zu texten. Dazu dimensionieren wir die Hardware von einer GPU bis zum Multi-GPU-Server und rechnen den Break-even gegen Cloud-Kosten vor.
WARUM ON-PREMISE, LOKAL & OFF-GRID
Ein LLM aus der Cloud ist bequem – bis zur ersten Rechnung, zur DSGVO-Frage oder zum geänderten Preismodell. Lokal betrieben gehört der Assistent Ihnen, und Ihre Daten bleiben, wo sie hingehören. Das sind die Gründe, warum wir on-premise aufbauen.
Art. 6 & 9 DSGVO · keine Auftragsverarbeitung
Firmendaten und Prompts werden ausschließlich im eigenen Netz verarbeitet. Kein Datentransfer in US-Clouds, kein Schrems-II-Risiko, kein AV-Vertrag mit einem Hyperscaler nötig.
einmal Hardware statt pro Token/Anfrage
Cloud-LLMs rechnen pro Token und Anfrage ab. Lokal zahlen Sie Strom und einmal die Hardware – ab dem Break-even chatten und verarbeiten Sie faktisch zum Nulltarif, in beliebiger Menge.
offene Modelle & Gewichte
Quelloffene Modelle und Gewichte, die Sie behalten. Kein Anbieter kann Preise erhöhen, Modelle abschalten, Endpunkte abkündigen oder Ihren Zugang sperren.
off-grid, ohne Internet
Der komplette Assistent funktioniert ohne Internetverbindung – im abgeschotteten Netz, an Standorten ohne stabile Leitung, im Sicherheitsbereich.
keine Content-Filter, kein Rate-Limit
Keine fremden Inhaltsfilter, die legitime Fach- oder Geschäftsfragen blockieren. Keine Warteschlangen, keine Tageskontingente, kein künstlich gedrosseltes Kontextfenster.
reproduzierbar & nachvollziehbar
Modellversion, Systemprompt und Parameter sind fixiert und dokumentiert. Jede Antwort ist nachvollziehbar – wichtig für Freigaben, Compliance und Revision.
volle GPU-Leistung
Keine geteilten Cloud-Ressourcen. Die volle Leistung Ihrer GPU steht Ihrem Team jederzeit zur Verfügung – planbar und ohne Nachbarn auf der Karte.
Ihr Team betreibt es selbst
Nach dem Workshop können Ihre Leute den Assistenten selbst bedienen, aktualisieren und erweitern – mit vollständiger Dokumentation. Wartung optional durch uns.
Eingesetzte Open-Source-Bausteine je nach Anwendungsfall und Hardware, u. a.: Llama 3.x, Qwen 2.5/3, Mistral & Mixtral und Gemma als Modelle; Ollama, vLLM und llama.cpp für den Betrieb; Open WebUI als Chat-Oberfläche; pgvector und Qdrant für RAG; LoRA für Feintuning. Modelle und Lizenzen prüfen wir gemeinsam auf Eignung für Ihren kommerziellen Einsatz.
On-premise und Open Source heißt: Fragen, Dokumente und Kundendaten werden lokal verarbeitet – nicht auf fremde Server geladen, nicht zum Modelltraining verwendet, nicht in ein Drittland übertragen. Volle Kontrolle, technisch und rechtlich.
WORKSHOP-ABLAUF
Wir klären Anwendungsfälle, Datenquellen, Sprachen und Nutzerzahl und prüfen Ihre vorhandene Hardware – oder empfehlen die passende GPU. Ergebnis: ein realistischer Fahrplan inkl. Break-even gegenüber Cloud-Kosten.
Installation des kompletten Open-Source-Stacks (Ollama bzw. vLLM, Modelle, Open WebUI) lokal in Ihrem Netz – als Einzelplatz oder zentraler Assistenz-Server für das ganze Team.
Praxis mit Ihren echten Aufgaben: Prompting, Rollen und Systemprompts, Modellvergleich und die ersten produktiven Dialoge – am Material, das Sie wirklich bearbeiten.
Wir binden Ihre Dokumente per RAG an, richten – auf Wunsch – LoRA-Feintuning ein und verbinden den Assistenten über Function-Calling und API mit Ihren Systemen und Automatisierungen.
Übergabe mit Betriebsdokumentation, Update-Strategie und Team-Schulung. Ihr Team betreibt den Assistenten selbst – die Wartung übernehmen Sie oder wir.
TYPISCHE EINSATZFELDER
Überall dort, wo viel Fachwissen und Text im Haus steckt, sensible Daten das Netz nicht verlassen dürfen oder Cloud-Kosten aus dem Ruder laufen.
Der Assistent beantwortet Fragen aus Firmen-Wiki, Handbüchern und Richtlinien – mit Quellenangabe. Neue Mitarbeitende finden Antworten in Sekunden, statt zu suchen oder nachzufragen.
Outcome
Firmenwissen sofort abrufbar – ohne Datenabfluss.
Der Assistent schlägt Antworten vor, fasst Vorgänge zusammen und formuliert Entwürfe – auf Basis Ihrer Wissensdatenbank. Der Mensch entscheidet, die Kundendaten bleiben im Haus.
Outcome
Schnellere Fälle, konsistente Qualität, volle Vertraulichkeit.
Fragen an Verträge, Akten und Berichte in natürlicher Sprache – der Assistent zitiert die relevante Passage. Ideal für Recht, Verwaltung und Fachprüfung mit vertraulichen Unterlagen.
Outcome
Antworten aus Akten – ohne dass eine Seite das Haus verlässt.
Ein Assistent für Entwicklung und Fachabteilungen: Code erklären und schreiben, Fachtexte prüfen, Vorlagen erzeugen – mit Ihrem internen Kontext, ohne Quellcode oder Fachdaten in eine fremde Cloud zu geben.
Outcome
Produktiver arbeiten – interne Daten bleiben intern.
HÄUFIGE FRAGEN
Ein Large Language Model (LLM) versteht und erzeugt Sprache: Es beantwortet Fragen, fasst zusammen, schreibt Texte und kann Ihre Dokumente durchsuchen. Der Unterschied zu Cloud-Diensten wie ChatGPT liegt nicht in der Bedienung – die Chat-Oberfläche fühlt sich vertraut an – sondern im Ort: Modell und Daten laufen auf Ihrer Hardware, nicht auf fremden Servern. Ihre Prompts und Firmendaten verlassen Ihr Netz nie.
Ja. Modell, Chat-Oberfläche und – bei RAG – Ihre Dokumente laufen auf Ihrer Hardware. Nach der Einrichtung braucht der Betrieb keine Internetverbindung – ideal für abgeschottete Netze, Standorte ohne stabile Leitung oder besonders schützenswerte Daten.
Für kleinere Modelle und einzelne Nutzer genügt oft eine aktuelle GPU mit 24 GB VRAM (z. B. RTX 4090). Für größere Modelle, viele gleichzeitige Nutzer oder hohen Durchsatz empfehlen sich Karten wie RTX 6000 Ada oder A100 – auch als Multi-GPU-Server. Im Assessment dimensionieren wir die Hardware exakt auf Ihre Anwendungsfälle und rechnen vor, ab wann sie sich gegenüber der Cloud rechnet.
Der lokale Betrieb ist der direkteste Weg zur DSGVO-Konformität: Es gibt keinen Transfer personenbezogener oder vertraulicher Daten an einen Cloud-Anbieter, keine Auftragsverarbeitung durch Dritte und keine Übermittlung in Drittländer. Ihre Prompts und Daten werden ausschließlich in Ihrem Netz verarbeitet und nicht zum Training fremder Modelle genutzt.
Ja – das ist der große Vorteil. Über RAG (Retrieval-Augmented Generation) binden wir Ihre Handbücher, Verträge und Wikis an: Der Assistent findet die passende Stelle per Embeddings in einer lokalen Vektor-Datenbank (pgvector oder Qdrant) und antwortet mit Quellenangabe – statt zu raten. Auf Wunsch spezialisieren wir das Modell zusätzlich per LoRA auf Ihren Fachjargon.
Beides ist möglich – genau das ist der Kern des Workshops. Wir richten den Stack ein und befähigen Ihr Team, ihn eigenständig zu bedienen, zu aktualisieren und zu erweitern. Ob Sie die Wartung danach selbst übernehmen oder an uns geben, entscheiden Sie.
Je nach Bedarf Llama 3.x, Qwen 2.5/3, Mistral bzw. Mixtral oder Gemma, betrieben über Ollama, vLLM oder llama.cpp. Die Lizenzbedingungen jedes Modells prüfen wir gemeinsam auf Eignung für Ihren konkreten kommerziellen Einsatz, damit Sie den Assistenten und seine Ausgaben rechtssicher verwenden können.
Beides: als Inhouse-Termin bei Ihnen, remote oder in Karlsruhe. Der Einstieg für Anwenderteams braucht keine Programmierkenntnisse; für RAG-Anbindung, Feintuning und API-Integration binden wir Ihre technischen Kolleg:innen mit ein.
In einem kostenlosen Erstgespräch klären wir Anwendungsfälle, Datenquellen und Hardware – und zeigen, wie schnell Sie ein LLM DSGVO-konform auf Ihrer eigenen Hardware produktiv einsetzen. Selbst betreiben oder von uns betreiben lassen: Sie entscheiden.