GENERATIVE KI · VOICE & TTS · ON-PREMISE

Aus Text wird natürliche Sprache – auf Ihrer eigenen Hardware.

Text-to-Speech und Voice-Cloning verwandeln geschriebenen Text in natürlich klingende, mehrsprachige Sprache – für E-Learning, Podcasts, Barrierefreiheit und Telefonie. Wir betreiben es mit quelloffenen Modellen lokal in Ihrem Haus: kein Cloud-Zwang, keine Abrechnung pro Minute, keine Stimme verlässt Ihr Netz. Sie lernen, es selbst zu bedienen – oder wir richten Ihr Sprach-Studio ein und schulen Ihr Team.

On-Premise

auf Ihrer eigenen Hardware

0 € / Minute

keine Cloud-Abrechnung

100 % Open Source

kein Vendor-Lock-in

Generative KI-Sprachsynthese – Wellenform einer synthetischen Stimme
Läuft auf Ihrer Hardware – auch offline

WAS SIE IM WORKSHOP AUFBAUEN

Ein eigenes Sprach-Studio – ganz ohne Cloud

Wir setzen einen kompletten, quelloffenen TTS- und Voice-Stack auf Ihrer Hardware auf und machen Ihr Team damit produktiv. Zwei Wege: Sie lernen, alles selbst zu betreiben – oder wir übernehmen Einrichtung und Wartung und schulen die Anwender.

Text → Sprache (TTS)

Aus geschriebenem Text entsteht natürlich klingende, betonte Sprache – mit steuerbarem Tempo, Pausen und Aussprache. Von der Einzelansage bis zum kompletten Hörbuch, jederzeit reproduzierbar.

Voice-Cloning (mit Einwilligung)

Aus wenigen Minuten Referenzaufnahme entsteht eine konsistente Marken- oder Produktstimme. Voice-Cloning setzen wir ausschließlich mit dokumentierter Einwilligung der Sprecherin oder des Sprechers ein.

Mehrsprachig & Open Source

Wir arbeiten mit den führenden freien Modellen – XTTS-v2, F5-TTS, Piper, Kokoro, Chatterbox und Bark. Viele Sprachen, auswählbar nach Qualität, Tempo und VRAM Ihrer Karte.

Konsistente Marken-Stimme

Eine feste Stimme über alle Kanäle – Ansagen, Tutorials, IVR und Produktvideos klingen immer gleich. Aussprache-Lexika sorgen für korrekte Namen, Produkte und Fachbegriffe.

Die passende Hardware

Von der RTX 4090 im Kreativ-Rechner bis zur RTX 6000 Ada / A100 im Server: Wir dimensionieren die Hardware auf Ihr Sprach-Volumen, Latenz und Durchsatz – und rechnen den Break-even gegen Cloud-Kosten vor.

Batch & Automatisierung

Ganze Kurskataloge oder Produkttexte über Nacht per Warteschlange oder API vertonen – aus einer Textliste, angebunden an Ihr CMS, LMS oder Redaktionssystem. Kein Klicken, kein Warten am Cloud-Kontingent.

WARUM ON-PREMISE, LOKAL & OFF-GRID

Ihr Vorteil gegenüber jeder KI-Cloud

Generative KI aus der Cloud ist bequem – bis zur ersten Rechnung, zur DSGVO-Frage oder zum geänderten Preismodell. Lokal betrieben gehört der Stack Ihnen. Das sind die Gründe, warum wir on-premise aufbauen.

DSGVO by Design

Art. 6 & 9 DSGVO · keine Auftragsverarbeitung

Verarbeitung ausschließlich im eigenen Netz. Kein Datentransfer in US-Clouds, kein Schrems-II-Risiko, kein AV-Vertrag mit einem Hyperscaler nötig – wichtig gerade bei biometrischen Sprachdaten.

Keine laufenden Kosten

einmal Hardware statt pro Minute

Cloud-Dienste rechnen pro synthetisierter Minute ab. Lokal zahlen Sie Strom und einmal die GPU – ab dem Break-even vertonen Sie faktisch zum Nulltarif, in beliebiger Menge.

Kein Vendor-Lock-in

offene Modelle & Gewichte

Quelloffene Modelle und Gewichte, die Sie behalten. Kein Anbieter kann Preise erhöhen, Modelle abschalten oder Ihren Zugang kündigen.

Läuft offline & air-gapped

off-grid, ohne Internet

Der komplette Stack funktioniert ohne Internetverbindung – im abgeschotteten Netz, an Standorten ohne stabile Leitung, im Sicherheitsbereich.

Keine Zensur, keine Limits

keine Content-Filter, kein Rate-Limit

Keine fremden Inhaltsfilter, die legitime Vertonungs- oder Produktarbeit blockieren. Keine Warteschlangen, keine Tageskontingente, keine gedrosselte Nachfrage.

Volle Kontrolle & Auditierbarkeit

reproduzierbar & nachvollziehbar

Modellversion, Stimme und Einstellungen sind fixiert und dokumentiert. Jede Ausgabe ist reproduzierbar – wichtig für Freigaben, Compliance und Marke.

Ihre Hardware, Ihr Tempo

volle GPU-Leistung

Keine geteilten Cloud-Ressourcen. Die volle Leistung Ihrer Karte steht Ihnen jederzeit zur Verfügung – planbar und ohne Nachbarn auf der GPU.

Wissenstransfer statt Abhängigkeit

Ihr Team betreibt es selbst

Nach dem Workshop können Ihre Leute den Stack selbst bedienen, aktualisieren und erweitern – mit vollständiger Dokumentation. Wartung optional durch uns.

Das nehmen Sie aus dem Workshop mit

  • Lauffähiges Sprach-Studio
  • Datensouveränität
  • Consent-Prozess für Voice-Cloning
  • Konsistente Marken-Stimme
  • Batch-Vertonung
  • Kostentransparenz
  • Offline-Fähigkeit
  • Update-Strategie
  • Betriebsdokumentation
  • Team-Enablement

Eingesetzte Open-Source-Bausteine je nach Anwendungsfall und Hardware, u. a.: XTTS-v2 (Coqui), F5-TTS, Piper, Kokoro, Chatterbox und Bark für mehrsprachige Sprachsynthese und Voice-Cloning. Modelle und Lizenzen prüfen wir gemeinsam auf Eignung für Ihren kommerziellen Einsatz.

On-Premise-Serverraum – KI-Rechenleistung im eigenen Haus
DATENSOUVERÄNITÄT

Ihre Stimme verlässt Ihr Haus nie.

Eine Stimme ist ein biometrisches Merkmal nach Art. 9 DSGVO – besonders schützenswert. On-premise und Open Source heißt: Referenzaufnahmen und Sprachdaten werden lokal verarbeitet – nicht auf fremde Server geladen, nicht zum Modelltraining verwendet, nicht in ein Drittland übertragen. Volle Kontrolle, technisch und rechtlich.

WORKSHOP-ABLAUF

Vom leeren Rechner zum eigenen Sprach-Studio

01

Assessment & Hardware-Check

Wir klären Anwendungsfall, Sprachen, Latenzbedarf und Volumen und prüfen Ihre vorhandene GPU – oder empfehlen die passende Karte. Ergebnis: ein realistischer Fahrplan inkl. Break-even gegenüber Cloud-Kosten.

02

Setup auf Ihrer Hardware

Installation des kompletten Open-Source-Stacks (Modelle, Treiber, Aussprache-Lexika und API) lokal in Ihrem Netz – als Kreativ-Arbeitsplatz oder zentraler Sprach-Server im Team.

03

Hands-on: Ihre erste Vertonung

Praxis am eigenen Material: vom Text zur fertigen Audiodatei. Stimmenauswahl, Betonung, Aussprache, Tempo – und, mit dokumentierter Einwilligung, Ihre erste geklonte Marken-Stimme.

04

Automatisierung & Marken-Stimme

Wir bauen wiederholbare Vorlagen für Ihre Formate, richten Batch-Vertonung und – auf Wunsch – die Anbindung an CMS, LMS oder Telefonie per API ein.

05

Enablement & Betrieb

Übergabe mit Betriebsdokumentation, Consent-Prozess, Update-Strategie und Team-Schulung. Ihr Team betreibt das Studio selbst – die Wartung übernehmen Sie oder wir.

TYPISCHE EINSATZFELDER

Wer mit lokalem Voice & TTS am meisten gewinnt

Überall dort, wo viel Sprache produziert wird, sensible Stimmdaten im Haus bleiben müssen oder Cloud-Kosten aus dem Ruder laufen.

E-LEARNING

E-Learning & Vertonung

Kurse, Tutorials und Schulungsunterlagen in konsistenter Stimme vertonen – Updates jederzeit ohne neue Aufnahme-Session, in beliebiger Menge und ohne pro Minute zu zahlen.

Outcome

Ganze Kurskataloge vertont – ohne Studio-Termin.

MEDIA

Podcast & Media-Produktion

Beiträge, Nachrichten und Trailer schnell vertonen oder Rohfassungen sprechen lassen – kreatives Material bleibt im Haus, kein Kontingent-Limit, keine Cloud-Rechnung pro Minute.

Outcome

Mehr Output, volle Vertraulichkeit.

ACCESSIBILITY

Barrierefreiheit & Screenreader

Websites, Dokumente und Apps mit natürlicher Sprachausgabe barrierefrei machen – schnell, offline und DSGVO-konform, ohne Nutzertexte in eine fremde Cloud zu geben.

Outcome

Inklusive Angebote ohne Datenschutz-Konflikt.

TELEFONIE

IVR & Telefonie

Ansagen, Menüs und dynamische Antworten für Ihre Telefonanlage lokal erzeugen – konsistente Stimme, jederzeit anpassbar, ohne Kundendaten oder Ansagetexte aus dem Haus zu geben.

Outcome

Professionelle Ansagen, komplett im eigenen Netz.

FAQ zum Voice-&-TTS-Workshop

HÄUFIGE FRAGEN

Text-to-Speech (TTS) erzeugt aus geschriebenem Text natürlich klingende, betonte Sprache – mehrsprachig, mit steuerbarem Tempo und Aussprache. Voice-Cloning erstellt darüber hinaus aus wenigen Minuten Referenzaufnahme eine konsistente, wiedererkennbare Stimme, etwa für Ihre Marke oder Ihr Produkt. Beides läuft bei uns vollständig auf Ihrer eigenen Hardware.

Voice-Cloning setzen wir ausschließlich mit ausdrücklicher, dokumentierter Einwilligung der betroffenen Person ein. Eine Stimme ist ein biometrisches Merkmal nach Art. 9 DSGVO und besonders schützenswert. Wir richten mit Ihnen einen klaren Consent-Prozess ein, klonen keine Stimmen ohne Erlaubnis und unterstützen keine Nutzung zur Täuschung oder Imitation Dritter. Der lokale Betrieb sorgt zusätzlich dafür, dass Stimmdaten Ihr Haus nie verlassen.

Ja. Modelle, Stimmen und Synthese laufen auf Ihrer Hardware. Nach der Einrichtung braucht der Betrieb keine Internetverbindung – ideal für abgeschottete Netze, Standorte ohne stabile Leitung oder besonders schützenswerte Sprachdaten.

Für den Einstieg genügt oft eine aktuelle Consumer-GPU wie die RTX 4090 (24 GB VRAM); viele Modelle wie Piper laufen sogar auf CPU. Für niedrige Latenz, viele Stimmen oder Team-Durchsatz empfehlen sich Karten wie RTX 6000 Ada oder A100. Im Assessment dimensionieren wir die Hardware exakt auf Ihre Anforderungen – und rechnen vor, ab wann sie sich gegenüber der Cloud rechnet.

Der lokale Betrieb ist der direkteste Weg zur DSGVO-Konformität: Es gibt keinen Transfer von Sprach- oder biometrischen Daten an einen Cloud-Anbieter, keine Auftragsverarbeitung durch Dritte und keine Übermittlung in Drittländer. Ihre Stimmdaten werden ausschließlich in Ihrem Netz verarbeitet und nicht zum Training fremder Modelle genutzt.

Beides ist möglich – genau das ist der Kern des Workshops. Wir richten den Stack ein und befähigen Ihr Team, ihn eigenständig zu bedienen, zu aktualisieren und zu erweitern. Ob Sie die Wartung danach selbst übernehmen oder an uns geben, entscheiden Sie.

Je nach Bedarf XTTS-v2 (Coqui), F5-TTS, Piper, Kokoro, Chatterbox oder Bark. Die Lizenzbedingungen jedes Modells prüfen wir gemeinsam auf Eignung für Ihren konkreten kommerziellen Einsatz, damit Sie die erzeugten Sprachaufnahmen rechtssicher verwenden können.

Beides: als Inhouse-Termin bei Ihnen, remote oder in Karlsruhe. Er richtet sich an Content-, Marketing-, E-Learning- und Support-Teams; Programmierkenntnisse sind nicht nötig. Wo eine tiefere Automatisierung oder Telefonie-Anbindung gewünscht ist, binden wir Ihre technischen Kolleg:innen mit ein.

Bereit für Ihr eigenes Sprach-Studio?

In einem kostenlosen Erstgespräch klären wir Anwendungsfall, Sprachen und Hardware – und zeigen, wie schnell Sie Sprachsynthese und Voice-Cloning DSGVO-konform auf Ihrer eigenen Hardware produktiv einsetzen. Selbst betreiben oder von uns betreiben lassen: Sie entscheiden.