Verifiziert 15. August 2026
Whisper Transkription — OpenAI Whisper auf Deutsch, kostenlos verwenden (2026)
Whisper ist ein Open-Source-Modell für automatische Spracherkennung von OpenAI, veröffentlicht 2022 unter MIT-Lizenz. Es unterstützt 96+ Sprachen inklusive Deutsch und kann kostenlos selbst gehostet oder über OpenAIs Whisper-API zum Preis von $0,006 pro Audiominute genutzt werden. Auf deutscher Audio erreicht das Large-v3-Modell etwa 4,5 % Word Error Rate (WER) auf dem FLEURS-Benchmark — praktisch vergleichbar mit englischer Genauigkeit.
Auf einen Blick
- ●Whisper = OpenAIs Open-Source-ASR-Modell — veröffentlicht September 2022 unter MIT-Lizenz, kommerziell frei nutzbar.
- ●Deutsch ist Tier-1-Sprache mit ~4,5 % Word Error Rate auf dem FLEURS-Benchmark (Large-v3) — praktisch englisches Niveau.
- ●Aktuelle Modelle: Large-v3 (November 2023, beste Genauigkeit) und Turbo (Oktober 2024, 8× schneller mit minimalem Genauigkeitsverlust).
- ●Drei Nutzungswege: lokal installiert (kostenlos, GPU empfohlen), OpenAI-API ($0,006/min), hosted-Dienst wie VexaScribe (ab $2/Monat, EU-Hosting).
- ●Installation lokal: Python + FFmpeg +
pip install openai-whisper— GPU empfohlen für Echtzeit-Verarbeitung. - ●Schwach bei: ausgeprägten Dialekten (Bayerisch, Schwäbisch), Fachvokabular (medizinisch/juristisch), starkem Hintergrundlärm.
- ●DSGVO: Selbst-Hosten → optimal (kein Datentransfer). API → USA-Hosting → Schrems-II-Risiko. Hosted-EU-Dienst → DSGVO-konform mit AV-Vertrag.
- ●Ernste Alternativen: Faster-Whisper (4× schneller), WhisperX (mit Diarization), Deepgram Nova-3, AssemblyAI, Speechmatics.
Was ist Whisper?
Whisper ist ein Open-Source-Modell für automatische Spracherkennung (ASR — Automatic Speech Recognition), das OpenAI im September 2022 unter MIT-Lizenz veröffentlichte. Es wandelt gesprochene Sprache in geschriebenen Text um (Speech-to-Text) und kann fremdsprachiges Audio zusätzlich direkt ins Englische übersetzen.
Das Besondere an Whisper: Es wurde mit 680.000 Stunden mehrsprachiger Audiodaten trainiert und funktioniert deshalb robust auf schlechter Audio, Akzenten und Fachvokabular — Bereiche, in denen frühere ASR-Systeme abstürzten. Whisper unterstützt 96+ Sprachen; die meisten europäischen Sprachen (inklusive Deutsch) laufen als Tier-1 mit nahezu englischer Genauigkeit.
Der Source-Code liegt auf github.com/openai/whisper. Zwei Wege zur Nutzung: lokal installieren (kostenlos, benötigt Python + FFmpeg, ideal für Datenschutz) oder OpenAI-API (bezahlt, $0,006 pro Audiominute laut openai.com/pricing, keine Setup-Arbeit).
Was ist ASR (Automatic Speech Recognition)?
Automatic Speech Recognition (ASR) ist die Technik, gesprochene Sprache automatisch in geschriebenen Text umzuwandeln. Die Grundaufgabe klingt einfach, ist technisch aber schwer: Sprache variiert in Tonhöhe, Sprechgeschwindigkeit, Akzent, Lautstärke, Hintergrundgeräuschen. ASR-Systeme müssen aus diesem hochvariablen Signal die einzelnen Phoneme identifizieren, zu Wörtern zusammensetzen und in Sätze mit korrekter Grammatik einordnen.
Frühe ASR-Systeme (1990er-2010er) arbeiteten mit statistischen Modellen (Hidden Markov Models) plus akustischen und sprachlichen Modellen als getrennte Komponenten. Sie waren fest kodiert, sprachspezifisch und fehleranfällig bei Akzenten oder Fachjargon. Dragon NaturallySpeaking (1997) war das erste bekannte kommerzielle ASR-System für Verbraucher.
End-to-End Deep Learning (2015-heute): Ab 2015 dominierten neuronale Netze das Feld. Anstatt separate Komponenten für Akustik und Sprache zu haben, wird ein einzelnes großes Modell trainiert, das direkt Audio in Text umwandelt. Google's Speech-to-Text-API, Amazon Transcribe, DeepSpeech (Mozilla, 2016), und Whisper (OpenAI, 2022) folgen diesem Ansatz.
Warum Whisper besonders ist: OpenAI trainierte Whisper auf 680.000 Stunden mehrsprachigem Audio aus dem offenen Web — deutlich mehr Daten als frühere Modelle. Das Ergebnis ist ein Modell, das erstaunlich robust auf schlechte Audio-Qualität, Akzente, Fachvokabular und Code-Switching zwischen Sprachen reagiert. Whisper ist außerdem multilingual in einem einzigen Modell (96 Sprachen), während vorherige Systeme meist sprachspezifische Modelle brauchten.
Whisper auf Deutsch — Genauigkeit und Grenzen
Deutsch ist eine der bestunterstützten Sprachen in Whisper. Auf dem FLEURS-Benchmark (Facebook's Cross-Lingual Speech Recognition Benchmark) erreicht Whisper Large-v3 auf Deutsch etwa 4,5 % Word Error Rate — praktisch auf einem Niveau mit Englisch (4,2 % WER).
Quelle: OpenAI Whisper Large-v3 Model Card. WER-Werte auf sauberem Studio-Audio; reale Aufnahmen liegen typisch 2–5 Prozentpunkte darüber.
Wo Whisper auf Deutsch stark ist
- Standarddeutsch, Nachrichtensprache, Podcasts mit klarer Diktion: 94–96 % Genauigkeit
- Interviews mit zwei Sprechern, Konferenzraum-Aufnahmen: 90–94 %
- YouTube-Videos, Vorträge in Studio-Qualität: 93–96 %
- Nachrichten-Interviews, Radio-Aufnahmen: 92–95 %
- Sprachnachrichten (WhatsApp, Telegram) mit gutem Mikro: 91–94 %
Wo Whisper auf Deutsch schwächer wird
- Ausgeprägte Dialekte (Bayerisch, Schwäbisch, Sächsisch, Wienerisch): 85–90 %
- Medizinische, juristische, technische Fachbegriffe: 20–30 % Fehlerrate auf Fachwörtern (nicht auf gesamtem Text)
- Aufnahmen mit starkem Hintergrundlärm (Café, Baustelle): 75–85 %
- Mehrere überlappende Sprecher ohne getrennte Mikrofone: 78–85 %
- Fremdsprachige Einschübe innerhalb deutscher Sätze (Code-Switching): teils fehlerhaft
- Eigennamen (unbekannte Namen, Marken, Produkt-Codes): oft fehlerhaft — Whisper hat kein Kontext-Wissen zur Erkennung
Praktische Empfehlung: Für die meisten geschäftlichen Anwendungen (Meetings, Interviews, Podcast-Produktion, Content-Erstellung) ist Whisper Large-v3 auf Deutsch produktionsreif — nach einer 5–15-minütigen manuellen Nachkorrektur pro Audiostunde. Für broadcast-taugliche oder rechtssichere Transkripte (Gerichts-Protokolle, medizinische Dokumentation) bleibt menschliche Nachbearbeitung oder Vier-Augen-Prinzip nötig.
Whisper-Modelle & Größen — welches ist das richtige?
OpenAI bietet mehrere Modellgrößen — Tradeoff zwischen Geschwindigkeit, RAM-Bedarf und Genauigkeit. Die aktuellste Version ist Large-v3 (November 2023) plus die schnellere Turbo-Variante (Oktober 2024).
| Modell | Parameter | RAM | Geschwindigkeit | Genauigkeit | Empfohlener Einsatz |
|---|---|---|---|---|---|
| Tiny | 39 M | ~1 GB | ~32× Echtzeit | Basis | Prototypen, sehr schnelle Grob-Transkription |
| Base | 74 M | ~1 GB | ~16× Echtzeit | Solide für Englisch | Schnelle Entwurfs-Transkription |
| Small | 244 M | ~2 GB | ~6× Echtzeit | Gut auf klarem Audio | Balancierter Alltagseinsatz |
| Medium | 769 M | ~5 GB | ~2× Echtzeit | Sehr gut | Podcast-Produktion, saubere Aufnahmen |
| Large-v2 | 1550 M | ~10 GB | ~1× Echtzeit | Hervorragend | Vorgänger von Large-v3, weiter nutzbar |
| Large-v3 | 1550 M | ~10 GB | ~1× Echtzeit | Bestwerte auf allen Sprachen | Professionelle Endergebnisse, Multi-Sprache |
| Turbo (Large-v3 destilled) | 809 M | ~6 GB | ~8× Echtzeit | 1–2 % unter Large-v3 | Schnelle Bulk-Verarbeitung, Podcast-Batch |
Empfehlung für Deutsch: Turbo für schnelle Bulk-Verarbeitung von Podcasts und Meetings (achtfache Geschwindigkeit, minimal geringere Genauigkeit). Large-v3 für professionelle Endergebnisse, wo jeder Prozentpunkt Genauigkeit zählt (rechtliche Transkripte, akademische Interviews). Small oder Medium nur, wenn die GPU-Ressourcen für Large-v3 nicht reichen.
Sprachen im Detail — Tier-Breakdown
Whisper unterstützt 96+ Sprachen, aber die Genauigkeit variiert erheblich. Grob drei Tiers:
- Tier 1 (WER 3-6 %): Englisch, Deutsch, Spanisch, Französisch, Italienisch, Portugiesisch, Niederländisch — massiv trainiert, praktisch produktionsreif
- Tier 2 (WER 5-10 %): Japanisch, Mandarin, Russisch, Arabisch, Türkisch, Koreanisch — solide, Fach-Nutzung möglich mit Review
- Tier 3 (WER 10-20 %+): Hindi, Vietnamesisch, Thailändisch, Swahili, viele Minderheitssprachen — ausbaufähig, aber für einfache Transkription nutzbar
| Sprache | Tier | WER (Large-v3) | Anmerkung |
|---|---|---|---|
| Englisch | 1 | 4,2 % | Referenz-Basis |
| Deutsch | 1 | 4,5 % | Nahezu englisches Niveau |
| Spanisch | 1 | 3,0 % | Besser als Englisch — großer Trainings-Datenpool |
| Französisch | 1 | 5,3 % | Solide |
| Italienisch | 1 | 4,8 % | Sehr gut |
| Portugiesisch | 1 | 4,7 % | Sehr gut |
| Niederländisch | 1 | 6,0 % | Gut, deutsches Vokabular teilweise besser als englisches |
| Japanisch | 2 | 5,6 % | Gut trotz komplexem Schriftsystem |
| Mandarin (vereinfacht) | 2 | 6,1 % | Solide |
| Russisch | 2 | 5,9 % | Gut |
| Arabisch | 2 | 8,5 % | Dialekt-Variation drückt Wert |
| Türkisch | 2 | 7,3 % | Solide |
| Koreanisch | 2 | 6,8 % | Solide |
| Hindi | 3 | 12,3 % | Ausbaufähig — Code-Switching-Herausforderung |
| Vietnamesisch | 3 | 10,1 % | Ausbaufähig |
WER-Werte laut OpenAI Whisper Large-v3 Model Card (Common Voice und FLEURS Benchmarks). Bei realen Aufnahmen (nicht Studio-Bedingungen) liegen Werte 2–5 Prozentpunkte darüber.
Whisper installieren — lokale Nutzung
Whisper läuft auf macOS, Linux und Windows. Vier Schritte:
- Python 3.9 oder neuer installieren. Download von python.org. Prüfen im Terminal:
python3 --version. - FFmpeg installieren. Whisper braucht FFmpeg zur Audio-Verarbeitung.
- macOS:
brew install ffmpeg - Ubuntu/Debian:
sudo apt install ffmpeg - Windows: über Chocolatey
choco install ffmpegoder direkter Download von ffmpeg.org
- macOS:
- Whisper via pip installieren.
pip install openai-whisper
- Audio transkribieren.
whisper meine_audio.mp3 --language German --model large-v3 # Ergebnis-Dateien: meine_audio.txt, .srt, .vtt, .json # Weitere Optionen: --output_format srt, --task transcribe|translate
GPU vs CPU — realistische Verarbeitungszeiten
Für Large-v3 auf einer NVIDIA RTX 4090 (24 GB VRAM): etwa 10-Minuten-Audio in 1 Minute Verarbeitungszeit. Auf einer RTX 4060 (8 GB VRAM): etwa 10-Minuten-Audio in 3–5 Minuten. Auf CPU (Intel/AMD, 16 GB RAM): etwa 10-Minuten-Audio in 30–50 Minuten — für gelegentliche Nutzung akzeptabel, für Bulk nicht.
Apple Silicon (M1/M2/M3): über MLX-Whisper-Optimierung etwa doppelt so schnell wie CPU auf x86 — für gelegentliche Nutzung praktikabel ohne dedizierte GPU.
Docker-Alternative
Wenn Sie Python-Konflikte auf Ihrem System vermeiden möchten, ist Docker die saubere Alternative:
docker run --gpus all -v $PWD:/data \ onerahmet/openai-whisper-asr-webservice:latest-gpu \ whisper /data/meine_audio.mp3 --language German --model large-v3
Community-Container: onerahmet/openai-whisper-asr-webservice, ahmetoner/whisper-asr-webservice und weitere. Für Produktion empfohlen: eigenes Dockerfile mit Whisper-Fork Faster-Whisper (4× schneller).
Google Colab (browserbasiert, kein Setup)
Für gelegentliche Nutzung ohne lokales Setup: Google Colab mit kostenlosem GPU-Zugang (T4). Whisper-Colab-Notebooks im Umlauf, Suche „openai whisper colab“ → in Sekunden ein lauffähiges Notebook. Grenzen: begrenzte GPU-Sessions (typisch 12h), keine Persistenz zwischen Sessions.
WebUI-Alternativen (grafische Oberfläche)
Für Nutzer ohne Kommandozeilen-Affinität gibt es mehrere Whisper-WebUIs mit ähnlicher Funktionalität:
- Buzz — kostenlos, macOS/Windows/Linux, grafische Oberfläche, Whisper Large-v3 direkt integriert
- MacWhisper — macOS-spezifisch, sehr benutzerfreundlich, Pro-Version mit Zusatzfunktionen
- WhisperUI / whisper-webui — browserbasierte lokale WebUI, mehrere Community-Versionen
- Whisper Desktop — Windows-spezifisch, kostenlos, mit GUI-Konfiguration der Modelle
Hosted vs API vs Selbst-Hosten — drei Wege im Vergleich
Historisch war die Wahl binär: OpenAI-API oder eigene GPU. 2026 ist es dreifach: klassische Selbst-Hosting, OpenAI-API und dritte-Partei-Hosted-Dienste (VexaScribe, HuggingFace Inference, Replicate). Jede Option hat einen anderen Sweet Spot:
Selbst-Hosten (lokal auf eigener Hardware)
Vorteile: permanent kostenlos (nur Hardware + Strom), keine Datenübertragung, DSGVO-optimal, volle Kontrolle über Modell-Version und Parameter.
Nachteile: Einmal-Investment in GPU (350-1700 €), Setup-Aufwand (Python, FFmpeg, CUDA), Wartungsarbeit, keine Skalierung bei Peaks.
OpenAI-API (offizielle Cloud-API)
Vorteile: keine Setup-Arbeit, automatische Skalierung, immer aktuellste Modell-Version, pay-per-use.
Nachteile: $0,006 pro Audiominute (skaliert bei Hochvolumen), Server in USA (Schrems-II-Problem für DSGVO), keine Feature-Extras wie Diarisierung, programmatischer Zugriff nötig (HTTP-API).
Hosted-Drittanbieter (VexaScribe, HuggingFace, Replicate)
Vorteile: Web-Oberfläche für Nicht-Entwickler, oft günstiger als OpenAI-API bei mittlerer Nutzung, EU-Hosting-Optionen (VexaScribe: AWS eu-west-2 London), Zusatzfeatures (Diarization, SRT-Export, Übersetzung integriert).
Nachteile: monatliches Abo statt pay-per-use, keine volle Kontrolle über Modell-Details, Anbieter-Abhängigkeit.
VexaScribe-Pipeline — wie hosted Whisper konkret funktioniert
Für Interessierte: was VexaScribe im Hintergrund tut, wenn Sie eine Audio-Datei hochladen. Fünf-Schritt-Pipeline:
- Upload und Preprocessing: Audio via HTTPS zu AWS eu-west-2 (London). Automatische Format-Konvertierung wenn nötig (z. B. .m4a zu 16kHz-WAV für Whisper-Input). Loudness-Normalisierung reduziert Extreme.
- Sprach-Erkennung: Auto-Detect wählt die Sprache (oder Sie wählen manuell). Deutsch wird als Tier-1 mit Whisper Large-v3 verarbeitet.
- Whisper Large-v3 Inferenz: das eigentliche Transkriptions-Modell läuft auf GPU-Instanzen (NVIDIA A10G) — typisch 5-15 Minuten Verarbeitungszeit pro Audiostunde.
- Post-Processing: Wort-Level-Zeitstempel, optionale Sprecher-Diarisierung (WhisperX-basiert), Formatierung nach Wunsch (Absätze, Kapitel, Zeitmarken-Granularität).
- Export: Fertige Datei als TXT, DOCX, SRT, VTT oder JSON. Alle Formate aus einer Transkription — Sie wählen beim Download.
Alle Zwischenergebnisse werden in AWS eu-west-2 (London, EU) gespeichert. Auf Anfrage AV-Vertrag (Auftragsverarbeitungsvertrag) für DSGVO-konforme Nutzung. Audio-Daten werden nicht zum Whisper-Training verwendet — der offizielle Whisper-Codebase auf github.com/openai/whisper ist eingefroren, keine Rückflüsse an OpenAI.
Whisper-Grenzen und wo es scheitert
Whisper ist stark, aber nicht magisch. Sechs typische Grenzfälle, in denen Sie Nachbearbeitung einplanen sollten oder Whisper gar nicht die richtige Wahl ist:
1. Ausgeprägte Dialekte
Bayerisch, Schwäbisch, Sächsisch, Wienerisch werden systematisch schlechter transkribiert (85-90 % WER vs 96 % Standarddeutsch). Bei stark dialektaler Aufnahme: mehr Zeit für manuelle Nachkorrektur einplanen oder auf einen menschlichen Transkribenten mit lokalem Sprachkontext zurückgreifen.
2. Fachvokabular ohne Kontext
Medizinische, juristische, technische Begriffe erreichen 20-30 % Fehlerrate auf den Fachwörtern selbst (nicht auf dem Gesamttext). Whisper kennt nicht Ihre spezifische Domäne. Lösung: Wörter mit Custom-Prompt vorgeben (Whisper unterstützt bis 224 Tokens im Prompt-Feld), oder manuelle Nachkorrektur.
3. Code-Switching zwischen Sprachen
„Ich habe today ein wichtiges Meeting“ mit englischen Einschüben in deutschem Satz — Whisper wechselt manchmal fälschlicherweise die Sprache oder transkribiert englische Wörter als deutsch-klingende Näherungen. Bilingual-Sprecher (viele Berliner, Schweizer, Migrations-Kontexte) sollten mit Nachkorrektur rechnen.
4. Mehrere überlappende Sprecher
Standard-Whisper hat keine Sprecher-Diarisierung — bei überlappender Sprache wird ein Sprecher „gewinnen“, der andere fehlt. Lösung: WhisperX mit Diarization einsetzen oder Hosted-Dienst mit integrierter Sprecher-Erkennung.
5. Sehr kurze Aufnahmen (unter 30 Sekunden)
Whisper braucht etwas Kontext für gute Ergebnisse. Bei extrem kurzen Clips (unter 30s) kann die Genauigkeit unerwartet fallen — insbesondere bei einzelnen Wörtern oder kurzen Ausrufen. Für kurze Clips ggf. mehrere zusammenfügen und dann trennen.
6. Halluzinationen bei Stille
Wenn eine Aufnahme längere stille Abschnitte enthält (10+ Sekunden), erfindet Whisper manchmal Text (etwa „Untertitel des ZDF, 2024“ oder ähnliches Trainingsdaten-Rauschen). Lösung: --no_speech_threshold anheben oder Voice-Activity-Detection vor Whisper-Verarbeitung (Silero-VAD).
Wie du Whisper nutzt — Workflows pro Anwendungsfall
Whisper ist ein Werkzeug, kein Endprodukt. Der Wert entsteht durch die Einbettung in einen Workflow. Vier häufige Anwendungsfälle mit konkreten Schritten:
Podcast-Produktion
- Audio nach der Aufnahme als WAV oder FLAC exportieren (verlustfrei für beste Whisper-Genauigkeit)
- Whisper Large-v3 mit --output_format srt --output_format json ausführen — SRT für Video-Untertitel-Version, JSON für Wort-Level-Zeitstempel
- In Descript oder Adobe Audition Transkript-Editor öffnen, KI-Ausgabe mit Play-Referenz überprüfen
- Nach Korrektur: SRT für YouTube-Version, JSON für Show-Notes-Timestamps, TXT für Blog-Version
Meeting-Aufzeichnung
- Zoom/Teams/Meet-Aufnahme als MP4 mit Audio-Track exportieren
- Whisper Large-v3 mit --language German --task transcribe ausführen
- Wenn mehrere Sprecher: WhisperX statt Standard-Whisper für Sprecher-Diarisierung
- Transkript in einer der drei Formen ablegen: TXT (schneller Überblick), DOCX (mit Sprecher-Labels und Zeitmarken), Notion/Confluence (mit Speaker-Bookmarks)
Qualitatives Interview (Sozialforschung)
- Aufnahme als MP3 (128kbps reicht) — Whisper akzeptiert direkt
- Whisper Large-v3 auf voller Genauigkeit — nicht Turbo, weil Namen und Fachbegriffe kritisch sind
- Ausgabe als TXT plus JSON (JSON für Zeitmarken-Bezüge in der Analyse)
- Manuelle Nachbearbeitung nach gewähltem Regel-System (Kuckartz, Dresing-Pehl) — Whisper liefert Rohtext, die Regel-Anpassung erfolgt in Subtitle Edit oder MAXQDA
Untertitel-Erstellung für Video
- Video als MP4 oder direkt Audio-Track (Whisper extrahiert Audio automatisch bei Video-Input)
- Whisper Large-v3 mit --output_format srt — direkte SRT-Ausgabe mit synchronisierten Zeitstempeln
- Optional: --word_timestamps True für Wort-Level-Zeitstempel (nützlich bei Kapwing/CapCut Karaoke-Style-Untertiteln)
- SRT in Video-Editor importieren (Premiere, DaVinci, CapCut) oder direkt in Video einbrennen (HandBrake, FFmpeg)
Whisper-Alternativen
Whisper ist stark, aber nicht das einzige gute ASR-Modell. Sieben ernsthafte Alternativen:
Faster-Whisper
Whisper-Fork mit CTranslate2
Stärke: 4× schneller als Original-Whisper bei identischer Genauigkeit; VRAM-Bedarf halbiert
Schwäche: Nur Selbst-Hosten, kein Hosted-Angebot
Passt für: Produktions-Selbst-Hosting mit hoher Durchsatz-Anforderung
WhisperX
Whisper + Forced Alignment + Diarization
Stärke: Wort-Level-Zeitstempel und Sprechererkennung
Schwäche: Komplexer Setup, mehrere Modelle nötig
Passt für: Interview-Transkription, Untertitel mit präzisen Zeitstempeln
whisper.cpp
C++-Portierung von Whisper
Stärke: Läuft auf Apple Silicon nativ, sehr effizient, mobile-tauglich (iOS-Apps)
Schwäche: Command-line-only, Setup für Nicht-Entwickler schwierig
Passt für: macOS-Nutzer mit Apple-Silicon; mobile Whisper-Integrationen
Deepgram Nova-3
Kommerzielle API
Stärke: Sehr schnell, gute Speaker-Diarization, günstig ab $0,0036/min
Schwäche: Proprietär, USA-Hosting
Passt für: Hochvolumen-API-Nutzung, Live-Streaming-Transkription
AssemblyAI Universal-2
Kommerzielle API
Stärke: Zusatzfunktionen (Sentiment, Themen, Chapters, PII-Redaktion)
Schwäche: Preis (~$0,015/min), USA-Hosting
Passt für: Media-Intelligence-Anwendungen mit Zusatz-Analysen
Speechmatics
Kommerzielle API, UK-basiert
Stärke: Sehr gute Genauigkeit auf britischen und irischen Akzenten, EU-Hosting-Option
Schwäche: Preis auf Anfrage, weniger Community-Support als Whisper-basierte
Passt für: Britische Marktanwendungen, wenn EU-Hosting Pflicht ist
VexaScribe (hosted Whisper)
Hosted Whisper Large-v3 mit EU-Hosting
Stärke: DSGVO-konform (AWS eu-west-2 London), keine Setup-Komplexität, deutsche Weboberfläche
Schwäche: Monatliche Kosten (ab $2 für 200 Min), keine Selbst-Kontrolle über Modell-Details
Passt für: Berufliche Nutzung ohne eigenes DevOps oder GPU-Setup
Ist Whisper kostenlos? — Die klare Antwort
Ja, das Open-Source-Modell ist unter MIT-Lizenz permanent kostenlos. Sie können Whisper lokal installieren, beliebig viel Audio verarbeiten, kommerziell einsetzen, in eigene Produkte integrieren. Der einzige „Kostenfaktor“ ist Ihre Hardware und Strom.
Nein, die OpenAI-API ist bezahlt — $0,006 pro Audiominute, abgerechnet nach tatsächlicher Nutzung. Für gelegentliche private Nutzung (paar Stunden im Monat) liegen die Kosten unter $1/Monat. Für professionellen Einsatz mit hoher Zuverlässigkeit ist die API meist die pragmatischere Wahl als eigenes GPU-Setup.
Wenn Sie keine Kreditkarte hinterlegen möchten und ohne Setup Whisper Large-v3 testen wollen: VexaScribe bietet 30 Minuten kostenlos bei Anmeldung — nutzt dieselbe Whisper-Large-v3-Engine mit EU-Hosting.
Datenschutz und DSGVO — welcher Weg für welchen Anwendungsfall
Der Datenschutz-Aspekt ist bei Whisper-Einsatz oft die entscheidende Wahl-Frage. Für Anwaltskanzleien, Arztpraxen, HR-Abteilungen und andere Berufsgeheimnisträger unterliegt die Verarbeitung von Sprachaufnahmen strengen Regeln.
Selbst-Hosten — die kompromissloseste Wahl
Audio verlässt Ihr Netzwerk nie. Whisper läuft auf Ihrer Hardware, verarbeitet lokal, gibt lokal aus. Keine Third-Party-Cloud, kein AV-Vertrag nötig, kein Schrems-II-Problem. Für Berufsgeheimnisträger und DSGVO-strengste Nutzung die naheliegende Wahl. Setup-Aufwand einmal, danach unbegrenzt nutzbar.
OpenAI-API — DSGVO-kritisch
Audio geht an OpenAI-Server in den USA. OpenAI erklärt zwar, API-Daten nicht zum Training zu verwenden (im Gegensatz zur ChatGPT-Weboberfläche), aber das Schrems-II-Urteil des EuGH macht Datentransfers in die USA generell DSGVO-riskant. Für private, nicht-berufliche Nutzung akzeptabel; für Berufsgeheimnisträger meist nicht empfehlenswert.
EU-gehostete Dienste — pragmatische Wahl
VexaScribe hostet in AWS eu-west-2 (London) mit AV-Vertrag auf Anfrage. Kompromiss aus Cloud-Bequemlichkeit und DSGVO-Konformität. Audio geht zwar in die Cloud, aber innerhalb der EU. Für die meisten geschäftlichen Anwendungen (Meeting-Transkription, Podcast-Produktion, Content-Erstellung) die richtige Balance zwischen Aufwand und Datenschutz.
Preisvergleich — Detailtabelle
| Szenario | API-Kosten | Selbst-Hosten | Hosted (VexaScribe) | Empfehlung |
|---|---|---|---|---|
| 10 Stunden/Monat (gelegentliche Nutzung) | $3,60 pro Monat ($43/Jahr) | GPU (RTX 4060 ~350 €) + Strom | VexaScribe Starter $2/Monat (deckt 200 Min ab, also 3,3h/Mo) | API oder hosted — Break-even bei GPU nach 6+ Jahren |
| 100 Stunden/Monat (regelmäßig) | $36 pro Monat ($432/Jahr) | GPU (RTX 4060) + Strom (~5€/Monat), Amortisierung ~9 Mo | VexaScribe Basic $5/Mo (1000 Min) oder Pro $10/Mo (2500 Min) | Hosted günstiger; Selbst-Hosten sinnvoll ab GPU-Amortisierung |
| 500 Stunden/Monat (Hochvolumen) | $180 pro Monat ($2.160/Jahr) | GPU (RTX 4090 ~1700 €) + Strom (~15€/Monat), Amortisierung ~10 Mo | VexaScribe Studio $20/Mo (6000 Min = 100h) oder Enterprise | Selbst-Hosten sinnvoll — Amortisierung nach ~10 Monaten |
| DSGVO-sensible Daten | OpenAI-Server (USA) — Schrems-II-Risiko | Lokal, kein Datentransfer — beste DSGVO-Wahl | VexaScribe AWS eu-west-2 London — DSGVO-konform mit AV-Vertrag | Selbst-Hosten oder EU-Hosted-Dienst (VexaScribe) |
| Wechselnde Nutzung + kein DevOps | Skaliert automatisch, aber Abrechnung schwer prognostizierbar | Feste Hardware, wenig flexibel bei Peaks | VexaScribe skaliert nahtlos, klare monatliche Kosten | Hosted-Dienst — beste Balance aus Flexibilität und Kostentransparenz |
API-Preise laut openai.com/pricing, verifiziert 15. August 2026. GPU-Preise sind Retail-Richtwerte; Stromkosten kalkuliert bei 0,30 €/kWh und 200 W durchschnittlicher GPU-Auslastung.
GitHub, Open Source und Lizenz
Whisper-Quellcode liegt auf github.com/openai/whisper unter MIT-Lizenz. Das bedeutet: freie kommerzielle Nutzung, Modifikation und Weiterverbreitung sind erlaubt, ein Copyright-Hinweis muss enthalten bleiben. Die Modellgewichte werden über Hugging Face bereitgestellt und beim ersten Ausführen automatisch heruntergeladen.
Die Community um Whisper ist groß: über 70.000 Sterne auf GitHub, unzählige Forks (Faster-Whisper, WhisperX, whisper.cpp für C++-Portierung), zahlreiche WebUIs. Für aktuelle Modellversionen ist immer das offizielle OpenAI-Repository die Referenz.
Häufige Fragen zu Whisper Transkription
Was ist Whisper?
Whisper ist ein Open-Source-Modell für automatische Spracherkennung (ASR) von OpenAI, veröffentlicht im September 2022 unter MIT-Lizenz. Es unterstützt 96+ Sprachen inklusive Deutsch und kann Audio in Text umwandeln (Speech-to-Text) sowie fremdsprachiges Audio direkt ins Englische übersetzen. Whisper ist entweder kostenlos zum Selbst-Hosten (Code auf GitHub verfügbar) oder als bezahlte API bei OpenAI ($0,006 pro Audiominute, Stand 2026-08). Aktuellste Modellversion ist Large-v3 (November 2023) plus die schnellere Turbo-Variante (Oktober 2024).
Wie gut funktioniert Whisper auf Deutsch?
Sehr gut. Deutsch ist eine Whisper-Tier-1-Sprache und erreicht mit dem Large-v3-Modell etwa 4,5 % Word Error Rate (WER) auf dem FLEURS-Benchmark — praktisch identisch mit Englisch (4,2 % WER). Auf sauberer Audio (Studio-Mikrofon, Standarddeutsch) liegen Sie bei 94–96 % Genauigkeit. Ausgeprägte Dialekte (Bayerisch, Schwäbisch, Sächsisch) fallen auf 85–90 %; medizinische, juristische oder technische Fachbegriffe haben 20–30 % Fehlerrate unabhängig vom Modell. Für die meisten geschäftlichen und journalistischen Anwendungen ist Whisper Large-v3 auf Deutsch produktionsreif.
Ist Whisper kostenlos?
Zwei Antworten. (1) Als Open-Source-Software: Ja, permanent kostenlos unter MIT-Lizenz. Sie können Whisper lokal auf Ihrem Rechner installieren und beliebig viel Audio verarbeiten — der einzige Kostenfaktor ist Ihr Strom und (für schnelle Verarbeitung) eine GPU. (2) Als OpenAI-API: Nein, die API kostet $0,006 pro Audiominute (Stand August 2026, siehe openai.com/pricing). Für 100 Stunden Audio pro Monat sind das $36 — meist günstiger als eine eigene GPU-Anschaffung, aber Daten verlassen Ihre Infrastruktur. Für gelegentliche private Nutzung reicht das Self-Hosting; für professionelle Produktion mit hoher Zuverlässigkeit ist die API oder ein Hosted-Dienst (VexaScribe, OpenAI direkt, Deepgram) meistens die praktischere Wahl.
Wie installiere ich Whisper lokal?
Vier Schritte auf einem beliebigen macOS-, Linux- oder Windows-Rechner. (1) Python 3.9 oder neuer installieren (python.org). (2) FFmpeg installieren — auf macOS mit Homebrew (brew install ffmpeg), auf Ubuntu mit apt (sudo apt install ffmpeg), auf Windows über die offizielle Download-Seite oder Chocolatey. (3) In einem Terminal: pip install openai-whisper. (4) Ein Modell laden und Audio transkribieren: whisper meine_audio.mp3 --language German --model large-v3. Die erste Ausführung lädt das Large-v3-Modell (~3 GB). Für schnelle Verarbeitung ist eine NVIDIA-GPU mit CUDA empfohlen; auf CPU dauert Large-v3 etwa Realtime × 3–5 (10-Minuten-Audio in 30–50 Minuten). Alternative mit grafischer Oberfläche: WhisperUI (whisper.tiiny.site), Buzz oder MacWhisper (macOS).
Was ist der Unterschied zwischen Whisper Large-v3 und Turbo?
Zwei Modellvarianten mit unterschiedlichem Tradeoff. Large-v3 (November 2023) ist das genaueste Modell — 1,55 Milliarden Parameter, beste WER-Werte auf allen Sprachen, aber langsam ohne GPU. Turbo (Oktober 2024) ist eine Destillation von Large-v3 — 809 Millionen Parameter, etwa achtmal schneller bei nur 1–2 Prozentpunkten Genauigkeitsverlust auf den meisten Sprachen. Für Deutsch: Large-v3 bei 4,5 % WER, Turbo bei etwa 5,5 % WER auf FLEURS — praktisch kaum spürbar. Empfehlung: Turbo für schnelle Bulk-Verarbeitung, Large-v3 für professionelle Endergebnisse.
Whisper API oder Selbst-Hosten — welches ist günstiger?
Rechnen Sie mit konkreten Zahlen. Selbst-Hosten: Anschaffung einer NVIDIA-GPU (RTX 4060 ~350 €, RTX 4090 ~1700 €) plus Strom. RTX 4060 verarbeitet ~1 Stunde Audio in 5–10 Minuten. API: $0,006 pro Audiominute, keine Anschaffung, keine Wartung, Daten gehen zu OpenAI. Beispiel: 500 Stunden Audio pro Monat = 30.000 Minuten × $0,006 = $180/Monat. Break-even zur RTX 4090 nach ~10 Monaten. Für gelegentliche Nutzung (unter 50h/Monat): API günstiger. Für Dauerbetrieb bei DSGVO-sensiblen Daten: Selbst-Hosten strategisch besser. Für professionelle Nutzung ohne eigene Infrastruktur: Hosted-Dienst wie VexaScribe (Whisper Large-v3 mit EU-Hosting, ab $2/Monat für 200 Minuten).
Was sind gute Alternativen zu Whisper?
Fünf ernsthafte Optionen. (1) Deepgram Nova-3: kommerzielle API, ähnliche Genauigkeit wie Whisper, oft schneller, mit Speaker-Diarization. (2) AssemblyAI Universal-2: kommerzielle API mit starken Zusatzfunktionen (Sentiment, Themen). (3) Faster-Whisper: Whisper-Fork mit CTranslate2, 4× schneller bei identischer Genauigkeit — die häufigste Wahl für Selbst-Hosting im Produktivbetrieb. (4) WhisperX: Whisper mit Forced Alignment und Speaker-Diarization — nützlich für Untertitel und Interview-Transkription. (5) NVIDIA Parakeet: neuer als Whisper, sehr schnell auf NVIDIA-Hardware, aber nur englischzentriert. Für Deutsch bleiben Whisper Large-v3 und Faster-Whisper die produktivsten Wahl.
Wie sicher sind meine Audiodaten mit Whisper?
Hängt vom Deployment ab. Selbst-Hosten (lokale Installation): Audio verlässt Ihren Rechner nie — höchste Datenschutzkontrolle, DSGVO-neutral, für sensible Nutzung (Anwaltskanzleien, Arztpraxen, Psychotherapie) die konsequente Wahl. OpenAI Whisper API: Audio wird an OpenAI-Server (USA) gesendet; laut OpenAI-Nutzungsbedingungen wird API-Daten nicht zum Training verwendet, aber DSGVO-Risiko besteht durch Datenübertragung in die USA (Schrems II). Hosted-Dienste wie VexaScribe: EU-Hosting in AWS eu-west-2 (London), AV-Vertrag auf Anfrage — DSGVO-konform, ohne die Komplexität des Selbst-Hostens. ChatGPT nutzt Whisper im Hintergrund für Voice Mode — die Datenschutz-Bedingungen von ChatGPT gelten dann.
Verwandte Seiten
Audio in Text umwandeln
Whisper Large-v3 hosted mit EU-Hosting — 30 Minuten kostenlos, DSGVO-konform.
ChatGPT Audio transkribieren
ChatGPT nutzt Whisper im Backend — Voice Mode, Datei-Upload, Grenzen.
WhatsApp Sprachnachricht transkribieren
Native und KI-basierte Transkription für WhatsApp-Voice-Messages auf Deutsch.
Was ist Transkription?
Bedeutung, Arten, Regeln — vom lateinischen Ursprung bis zu modernen KI-Verfahren.
Whisper Large-v3 testen — ohne Installation
VexaScribe nutzt Whisper Large-v3 mit EU-Hosting (AWS eu-west-2 London), DSGVO-konform. 30 Minuten kostenlos, ohne Kreditkarte. Deutsch als Tier-1-Sprache.