GENERATIVE KI · SPEECH-TO-TEXT · ON-PREMISE

Aus Audio wird durchsuchbarer Text – auf Ihrer eigenen Hardware.

Speech-to-Text verwandelt Aufnahmen in präzise, durchsuchbare Transkripte – mit Sprecher-Erkennung und Zeitstempeln, für Meetings, Interviews, Untertitel und Archivierung. Wir betreiben es mit quelloffenem Whisper lokal in Ihrem Haus: kein Cloud-Zwang, keine Abrechnung pro Stunde, kein Audio verlässt Ihr Netz. Sie lernen, es selbst zu bedienen – oder wir richten Ihre Transkriptions-Pipeline ein und schulen Ihr Team.

On-Premise

auf Ihrer eigenen Hardware

0 € / Stunde Audio

keine Cloud-Abrechnung

100 % Open Source

kein Vendor-Lock-in

Generative KI-Transkription – Audio-Wellenform wird zu Text
Läuft auf Ihrer Hardware – auch offline

WAS SIE IM WORKSHOP AUFBAUEN

Eine eigene Transkriptions-Pipeline – ganz ohne Cloud

Wir setzen einen kompletten, quelloffenen Speech-to-Text-Stack auf Ihrer Hardware auf und machen Ihr Team damit produktiv. Zwei Wege: Sie lernen, alles selbst zu betreiben – oder wir übernehmen Einrichtung und Wartung und schulen die Anwender.

Audio → Text (Transkription)

Meetings, Interviews, Diktate und Telefonate werden zu präzisem, durchsuchbarem Text – in vielen Sprachen und Dialekten. Aus Stunden Audio wird in Minuten ein nutzbares Protokoll.

Sprecher-Diarisierung

Mit WhisperX erkennt der Stack, wer wann spricht, und ordnet jede Aussage der richtigen Person zu. Aus einem Gespräch wird ein sauber strukturiertes, lesbares Protokoll.

Open-Source-Modelle

Wir arbeiten mit den führenden freien Varianten – Whisper, whisper.cpp, faster-whisper und WhisperX. Auswählbar nach Genauigkeit, Tempo und der Hardware, die Sie einsetzen.

Wort-Zeitstempel & Untertitel

Exakte Zeitstempel bis auf Wortebene – Grundlage für synchrone Untertitel (SRT/VTT), klickbare Transkripte und die punktgenaue Suche in langen Aufnahmen.

Die passende Hardware

Von der CPU für kleine Mengen über die RTX 4090 bis zur RTX 6000 Ada / A100 im Server: Wir dimensionieren die Hardware auf Ihr Audio-Volumen und Ihren Durchsatz – und rechnen den Break-even gegen Cloud-Kosten vor.

Batch & Automatisierung

Ganze Audio-Archive über Nacht per Warteschlange oder API transkribieren – aus einem Ordner oder Aufnahmesystem, angebunden an Ihr DMS oder Ihre Ablage. Kein Klicken, kein Warten am Cloud-Kontingent.

WARUM ON-PREMISE, LOKAL & OFF-GRID

Ihr Vorteil gegenüber jeder KI-Cloud

Generative KI aus der Cloud ist bequem – bis zur ersten Rechnung, zur DSGVO-Frage oder zum geänderten Preismodell. Lokal betrieben gehört der Stack Ihnen. Das sind die Gründe, warum wir on-premise aufbauen.

DSGVO by Design

Art. 6 & 9 DSGVO · keine Auftragsverarbeitung

Verarbeitung ausschließlich im eigenen Netz. Kein Datentransfer in US-Clouds, kein Schrems-II-Risiko, kein AV-Vertrag mit einem Hyperscaler nötig – wichtig gerade bei sensiblen Gesprächsinhalten.

Keine laufenden Kosten

einmal Hardware statt pro Stunde

Cloud-Dienste rechnen pro Stunde Audio ab. Lokal zahlen Sie Strom und einmal die Hardware – ab dem Break-even transkribieren Sie faktisch zum Nulltarif, in beliebiger Menge.

Kein Vendor-Lock-in

offene Modelle & Gewichte

Quelloffene Modelle und Gewichte, die Sie behalten. Kein Anbieter kann Preise erhöhen, Modelle abschalten oder Ihren Zugang kündigen.

Läuft offline & air-gapped

off-grid, ohne Internet

Der komplette Stack funktioniert ohne Internetverbindung – im abgeschotteten Netz, an Standorten ohne stabile Leitung, im Sicherheitsbereich.

Keine Zensur, keine Limits

keine Content-Filter, kein Rate-Limit

Keine fremden Inhaltsfilter, die legitime Inhalte blockieren. Keine Warteschlangen, keine Tageskontingente, keine gedrosselte Nachfrage – auch bei großen Audio-Mengen.

Volle Kontrolle & Auditierbarkeit

reproduzierbar & nachvollziehbar

Modellversion und Einstellungen sind fixiert und dokumentiert. Jedes Transkript ist reproduzierbar – wichtig für Freigaben, Compliance und revisionssichere Archivierung.

Ihre Hardware, Ihr Tempo

volle GPU-Leistung

Keine geteilten Cloud-Ressourcen. Die volle Leistung Ihrer Karte steht Ihnen jederzeit zur Verfügung – planbar und ohne Nachbarn auf der GPU.

Wissenstransfer statt Abhängigkeit

Ihr Team betreibt es selbst

Nach dem Workshop können Ihre Leute den Stack selbst bedienen, aktualisieren und erweitern – mit vollständiger Dokumentation. Wartung optional durch uns.

Das nehmen Sie aus dem Workshop mit

  • Lauffähige Transkriptions-Pipeline
  • Datensouveränität
  • Sprecher-Diarisierung
  • Untertitel & Zeitstempel
  • Batch-Transkription
  • Kostentransparenz
  • Offline-Fähigkeit
  • Update-Strategie
  • Betriebsdokumentation
  • Team-Enablement

Eingesetzte Open-Source-Bausteine je nach Anwendungsfall und Hardware, u. a.: Whisper, whisper.cpp und faster-whisper für die Transkription sowie WhisperX für Sprecher-Diarisierung und Wort-Zeitstempel. Modelle und Lizenzen prüfen wir gemeinsam auf Eignung für Ihren kommerziellen Einsatz.

On-Premise-Serverraum – KI-Rechenleistung im eigenen Haus
DATENSOUVERÄNITÄT

Ihre Aufnahmen verlassen Ihr Haus nie.

On-premise und Open Source heißt: Gespräche, Patienten-Diktate, Interviews und vertrauliche Meetings werden lokal verarbeitet – nicht auf fremde Server geladen, nicht zum Modelltraining verwendet, nicht in ein Drittland übertragen. Volle Kontrolle, technisch und rechtlich.

WORKSHOP-ABLAUF

Vom leeren Rechner zur eigenen Transkriptions-Pipeline

01

Assessment & Hardware-Check

Wir klären Anwendungsfall, Sprachen, Audio-Volumen und Genauigkeitsbedarf und prüfen Ihre vorhandene Hardware – oder empfehlen die passende. Ergebnis: ein realistischer Fahrplan inkl. Break-even gegenüber Cloud-Kosten.

02

Setup auf Ihrer Hardware

Installation des kompletten Open-Source-Stacks (Whisper-Variante, Diarisierung, Treiber und API) lokal in Ihrem Netz – als Arbeitsplatz-Werkzeug oder zentraler Transkriptions-Server im Team.

03

Hands-on: Ihr erstes Transkript

Praxis am eigenen Material: von der Aufnahme zum fertigen Transkript. Sprachwahl, Genauigkeitsstufen, Sprecher-Diarisierung, Wort-Zeitstempel und Export als Text, SRT oder VTT.

04

Automatisierung & Archiv-Anbindung

Wir bauen wiederholbare Abläufe für Ihre Formate, richten Batch-Transkription ganzer Archive und – auf Wunsch – die Anbindung an DMS, Ablage oder Aufnahmesystem per API ein.

05

Enablement & Betrieb

Übergabe mit Betriebsdokumentation, Update-Strategie und Team-Schulung. Ihr Team betreibt die Pipeline selbst – die Wartung übernehmen Sie oder wir.

TYPISCHE EINSATZFELDER

Wer mit lokaler Transkription am meisten gewinnt

Überall dort, wo viel gesprochen wird, sensible Audios im Haus bleiben müssen oder Cloud-Kosten aus dem Ruder laufen.

BÜRO & RESEARCH

Meeting- & Interview-Transkription

Besprechungen, Interviews und Research-Sessions automatisch in durchsuchbare, sprechergetrennte Protokolle verwandeln – vertrauliche Inhalte bleiben im Haus, ohne pro Stunde zu zahlen.

Outcome

Jedes Meeting wird zum durchsuchbaren Protokoll.

MEDIA & COMPLIANCE

Untertitel & Compliance-Archiv

Videos untertiteln und Audio-Archive revisionssicher verschriftlichen – mit Wort-Zeitstempeln, offline und DSGVO-konform, ohne Aufnahmen in eine fremde Cloud zu geben.

Outcome

Barrierefreie Untertitel und auditierbare Archive.

CUSTOMER SERVICE

Call-Center-Analyse

Kundengespräche automatisiert transkribieren und für Qualität, Schulung und Auswertung nutzbar machen – Sprecher getrennt, komplett im eigenen Netz, ohne Kundendaten aus dem Haus zu geben.

Outcome

Gesprächsanalyse ohne Datenschutz-Konflikt.

REGULIERT

Klinik, Justiz & Behörde

Arzt-Diktate, Verhandlungen und Vernehmungen verschriftlichen – besonders sensible Audios bleiben nachweislich im Haus, auch im abgeschotteten Netz, auditierbar und DSGVO-konform.

Outcome

Sensible Aufnahmen verschriftlicht, ohne das Haus zu verlassen.

FAQ zum Speech-to-Text-Workshop

HÄUFIGE FRAGEN

Speech-to-Text verwandelt Audioaufnahmen in geschriebenen, durchsuchbaren Text. Whisper ist das führende quelloffene Modell dafür: Es transkribiert viele Sprachen und Dialekte präzise, liefert Wort-Zeitstempel und lässt sich mit WhisperX um Sprecher-Diarisierung erweitern – also die Erkennung, wer wann spricht. Bei uns läuft das vollständig auf Ihrer eigenen Hardware.

Whisper erreicht bei guter Aufnahmequalität eine sehr hohe Genauigkeit, auch bei Akzenten und vielen Sprachen. Für Fachbegriffe, Eigennamen und branchenspezifisches Vokabular optimieren wir im Workshop die Einstellungen und, wo nötig, die Nachbearbeitung – damit Ihre typischen Inhalte zuverlässig korrekt erfasst werden.

Ja. Modell, Diarisierung und Verarbeitung laufen auf Ihrer Hardware. Nach der Einrichtung braucht der Betrieb keine Internetverbindung – ideal für abgeschottete Netze, Standorte ohne stabile Leitung oder besonders schützenswerte Aufnahmen.

Kleine Mengen laufen bereits auf einer CPU – mit whisper.cpp erstaunlich flott. Für große Audio-Mengen, niedrige Wartezeit oder Team-Durchsatz beschleunigt eine GPU wie die RTX 4090 oder RTX 6000 Ada die Verarbeitung erheblich. Im Assessment dimensionieren wir die Hardware exakt auf Ihr Volumen – und rechnen vor, ab wann sie sich gegenüber der Cloud rechnet.

Der lokale Betrieb ist der direkteste Weg zur DSGVO-Konformität: Es gibt keinen Transfer von Audio- oder personenbezogenen Daten an einen Cloud-Anbieter, keine Auftragsverarbeitung durch Dritte und keine Übermittlung in Drittländer. Ihre Aufnahmen werden ausschließlich in Ihrem Netz verarbeitet und nicht zum Training fremder Modelle genutzt – entscheidend für Klinik, Justiz und Behörden.

Beides ist möglich – genau das ist der Kern des Workshops. Wir richten den Stack ein und befähigen Ihr Team, ihn eigenständig zu bedienen, zu aktualisieren und zu erweitern. Ob Sie die Wartung danach selbst übernehmen oder an uns geben, entscheiden Sie.

Ja. Mit WhisperX ordnet der Stack jede Aussage der richtigen Person zu (Sprecher-Diarisierung) und liefert Wort-genaue Zeitstempel. Daraus erzeugen wir synchrone Untertitel im SRT- oder VTT-Format sowie sauber strukturierte, sprechergetrennte Protokolle.

Beides: als Inhouse-Termin bei Ihnen, remote oder in Karlsruhe. Er richtet sich an Office-, Redaktions-, Support- und Fachteams; Programmierkenntnisse sind nicht nötig. Wo eine tiefere Automatisierung oder Archiv-Anbindung gewünscht ist, binden wir Ihre technischen Kolleg:innen mit ein.

Bereit für Ihre eigene Transkriptions-Pipeline?

In einem kostenlosen Erstgespräch klären wir Anwendungsfall, Sprachen und Hardware – und zeigen, wie schnell Sie Speech-to-Text DSGVO-konform auf Ihrer eigenen Hardware produktiv einsetzen. Selbst betreiben oder von uns betreiben lassen: Sie entscheiden.