Verifiziert 15. August 2026

Whisper Transkription — OpenAI Whisper auf Deutsch, kostenlos verwenden (2026)

Whisper ist ein Open-Source-Modell für automatische Spracherkennung von OpenAI, veröffentlicht 2022 unter MIT-Lizenz. Es unterstützt 96+ Sprachen inklusive Deutsch und kann kostenlos selbst gehostet oder über OpenAIs Whisper-API zum Preis von $0,006 pro Audiominute genutzt werden. Auf deutscher Audio erreicht das Large-v3-Modell etwa 4,5 % Word Error Rate (WER) auf dem FLEURS-Benchmark — praktisch vergleichbar mit englischer Genauigkeit.

Auf einen Blick

  • Whisper = OpenAIs Open-Source-ASR-Modell — veröffentlicht September 2022 unter MIT-Lizenz, kommerziell frei nutzbar.
  • Deutsch ist Tier-1-Sprache mit ~4,5 % Word Error Rate auf dem FLEURS-Benchmark (Large-v3) — praktisch englisches Niveau.
  • Aktuelle Modelle: Large-v3 (November 2023, beste Genauigkeit) und Turbo (Oktober 2024, 8× schneller mit minimalem Genauigkeitsverlust).
  • Drei Nutzungswege: lokal installiert (kostenlos, GPU empfohlen), OpenAI-API ($0,006/min), hosted-Dienst wie VexaScribe (ab $2/Monat, EU-Hosting).
  • Installation lokal: Python + FFmpeg + pip install openai-whisper — GPU empfohlen für Echtzeit-Verarbeitung.
  • Schwach bei: ausgeprägten Dialekten (Bayerisch, Schwäbisch), Fachvokabular (medizinisch/juristisch), starkem Hintergrundlärm.
  • DSGVO: Selbst-Hosten → optimal (kein Datentransfer). API → USA-Hosting → Schrems-II-Risiko. Hosted-EU-Dienst → DSGVO-konform mit AV-Vertrag.
  • Ernste Alternativen: Faster-Whisper (4× schneller), WhisperX (mit Diarization), Deepgram Nova-3, AssemblyAI, Speechmatics.

Was ist Whisper?

Whisper ist ein Open-Source-Modell für automatische Spracherkennung (ASR — Automatic Speech Recognition), das OpenAI im September 2022 unter MIT-Lizenz veröffentlichte. Es wandelt gesprochene Sprache in geschriebenen Text um (Speech-to-Text) und kann fremdsprachiges Audio zusätzlich direkt ins Englische übersetzen.

Das Besondere an Whisper: Es wurde mit 680.000 Stunden mehrsprachiger Audiodaten trainiert und funktioniert deshalb robust auf schlechter Audio, Akzenten und Fachvokabular — Bereiche, in denen frühere ASR-Systeme abstürzten. Whisper unterstützt 96+ Sprachen; die meisten europäischen Sprachen (inklusive Deutsch) laufen als Tier-1 mit nahezu englischer Genauigkeit.

Der Source-Code liegt auf github.com/openai/whisper. Zwei Wege zur Nutzung: lokal installieren (kostenlos, benötigt Python + FFmpeg, ideal für Datenschutz) oder OpenAI-API (bezahlt, $0,006 pro Audiominute laut openai.com/pricing, keine Setup-Arbeit).

Was ist ASR (Automatic Speech Recognition)?

Automatic Speech Recognition (ASR) ist die Technik, gesprochene Sprache automatisch in geschriebenen Text umzuwandeln. Die Grundaufgabe klingt einfach, ist technisch aber schwer: Sprache variiert in Tonhöhe, Sprechgeschwindigkeit, Akzent, Lautstärke, Hintergrundgeräuschen. ASR-Systeme müssen aus diesem hochvariablen Signal die einzelnen Phoneme identifizieren, zu Wörtern zusammensetzen und in Sätze mit korrekter Grammatik einordnen.

Frühe ASR-Systeme (1990er-2010er) arbeiteten mit statistischen Modellen (Hidden Markov Models) plus akustischen und sprachlichen Modellen als getrennte Komponenten. Sie waren fest kodiert, sprachspezifisch und fehleranfällig bei Akzenten oder Fachjargon. Dragon NaturallySpeaking (1997) war das erste bekannte kommerzielle ASR-System für Verbraucher.

End-to-End Deep Learning (2015-heute): Ab 2015 dominierten neuronale Netze das Feld. Anstatt separate Komponenten für Akustik und Sprache zu haben, wird ein einzelnes großes Modell trainiert, das direkt Audio in Text umwandelt. Google's Speech-to-Text-API, Amazon Transcribe, DeepSpeech (Mozilla, 2016), und Whisper (OpenAI, 2022) folgen diesem Ansatz.

Warum Whisper besonders ist: OpenAI trainierte Whisper auf 680.000 Stunden mehrsprachigem Audio aus dem offenen Web — deutlich mehr Daten als frühere Modelle. Das Ergebnis ist ein Modell, das erstaunlich robust auf schlechte Audio-Qualität, Akzente, Fachvokabular und Code-Switching zwischen Sprachen reagiert. Whisper ist außerdem multilingual in einem einzigen Modell (96 Sprachen), während vorherige Systeme meist sprachspezifische Modelle brauchten.

Whisper auf Deutsch — Genauigkeit und Grenzen

Deutsch ist eine der bestunterstützten Sprachen in Whisper. Auf dem FLEURS-Benchmark (Facebook's Cross-Lingual Speech Recognition Benchmark) erreicht Whisper Large-v3 auf Deutsch etwa 4,5 % Word Error Rate — praktisch auf einem Niveau mit Englisch (4,2 % WER).

Quelle: OpenAI Whisper Large-v3 Model Card. WER-Werte auf sauberem Studio-Audio; reale Aufnahmen liegen typisch 2–5 Prozentpunkte darüber.

Wo Whisper auf Deutsch stark ist

  • Standarddeutsch, Nachrichtensprache, Podcasts mit klarer Diktion: 94–96 % Genauigkeit
  • Interviews mit zwei Sprechern, Konferenzraum-Aufnahmen: 90–94 %
  • YouTube-Videos, Vorträge in Studio-Qualität: 93–96 %
  • Nachrichten-Interviews, Radio-Aufnahmen: 92–95 %
  • Sprachnachrichten (WhatsApp, Telegram) mit gutem Mikro: 91–94 %

Wo Whisper auf Deutsch schwächer wird

  • Ausgeprägte Dialekte (Bayerisch, Schwäbisch, Sächsisch, Wienerisch): 85–90 %
  • Medizinische, juristische, technische Fachbegriffe: 20–30 % Fehlerrate auf Fachwörtern (nicht auf gesamtem Text)
  • Aufnahmen mit starkem Hintergrundlärm (Café, Baustelle): 75–85 %
  • Mehrere überlappende Sprecher ohne getrennte Mikrofone: 78–85 %
  • Fremdsprachige Einschübe innerhalb deutscher Sätze (Code-Switching): teils fehlerhaft
  • Eigennamen (unbekannte Namen, Marken, Produkt-Codes): oft fehlerhaft — Whisper hat kein Kontext-Wissen zur Erkennung

Praktische Empfehlung: Für die meisten geschäftlichen Anwendungen (Meetings, Interviews, Podcast-Produktion, Content-Erstellung) ist Whisper Large-v3 auf Deutsch produktionsreif — nach einer 5–15-minütigen manuellen Nachkorrektur pro Audiostunde. Für broadcast-taugliche oder rechtssichere Transkripte (Gerichts-Protokolle, medizinische Dokumentation) bleibt menschliche Nachbearbeitung oder Vier-Augen-Prinzip nötig.

Whisper-Modelle & Größen — welches ist das richtige?

OpenAI bietet mehrere Modellgrößen — Tradeoff zwischen Geschwindigkeit, RAM-Bedarf und Genauigkeit. Die aktuellste Version ist Large-v3 (November 2023) plus die schnellere Turbo-Variante (Oktober 2024).

ModellParameterRAMGeschwindigkeitGenauigkeitEmpfohlener Einsatz
Tiny39 M~1 GB~32× EchtzeitBasisPrototypen, sehr schnelle Grob-Transkription
Base74 M~1 GB~16× EchtzeitSolide für EnglischSchnelle Entwurfs-Transkription
Small244 M~2 GB~6× EchtzeitGut auf klarem AudioBalancierter Alltagseinsatz
Medium769 M~5 GB~2× EchtzeitSehr gutPodcast-Produktion, saubere Aufnahmen
Large-v21550 M~10 GB~1× EchtzeitHervorragendVorgänger von Large-v3, weiter nutzbar
Large-v31550 M~10 GB~1× EchtzeitBestwerte auf allen SprachenProfessionelle Endergebnisse, Multi-Sprache
Turbo (Large-v3 destilled)809 M~6 GB~8× Echtzeit1–2 % unter Large-v3Schnelle Bulk-Verarbeitung, Podcast-Batch

Empfehlung für Deutsch: Turbo für schnelle Bulk-Verarbeitung von Podcasts und Meetings (achtfache Geschwindigkeit, minimal geringere Genauigkeit). Large-v3 für professionelle Endergebnisse, wo jeder Prozentpunkt Genauigkeit zählt (rechtliche Transkripte, akademische Interviews). Small oder Medium nur, wenn die GPU-Ressourcen für Large-v3 nicht reichen.

Sprachen im Detail — Tier-Breakdown

Whisper unterstützt 96+ Sprachen, aber die Genauigkeit variiert erheblich. Grob drei Tiers:

  • Tier 1 (WER 3-6 %): Englisch, Deutsch, Spanisch, Französisch, Italienisch, Portugiesisch, Niederländisch — massiv trainiert, praktisch produktionsreif
  • Tier 2 (WER 5-10 %): Japanisch, Mandarin, Russisch, Arabisch, Türkisch, Koreanisch — solide, Fach-Nutzung möglich mit Review
  • Tier 3 (WER 10-20 %+): Hindi, Vietnamesisch, Thailändisch, Swahili, viele Minderheitssprachen — ausbaufähig, aber für einfache Transkription nutzbar
SpracheTierWER (Large-v3)Anmerkung
Englisch14,2 %Referenz-Basis
Deutsch14,5 %Nahezu englisches Niveau
Spanisch13,0 %Besser als Englisch — großer Trainings-Datenpool
Französisch15,3 %Solide
Italienisch14,8 %Sehr gut
Portugiesisch14,7 %Sehr gut
Niederländisch16,0 %Gut, deutsches Vokabular teilweise besser als englisches
Japanisch25,6 %Gut trotz komplexem Schriftsystem
Mandarin (vereinfacht)26,1 %Solide
Russisch25,9 %Gut
Arabisch28,5 %Dialekt-Variation drückt Wert
Türkisch27,3 %Solide
Koreanisch26,8 %Solide
Hindi312,3 %Ausbaufähig — Code-Switching-Herausforderung
Vietnamesisch310,1 %Ausbaufähig

WER-Werte laut OpenAI Whisper Large-v3 Model Card (Common Voice und FLEURS Benchmarks). Bei realen Aufnahmen (nicht Studio-Bedingungen) liegen Werte 2–5 Prozentpunkte darüber.

Whisper installieren — lokale Nutzung

Whisper läuft auf macOS, Linux und Windows. Vier Schritte:

  1. Python 3.9 oder neuer installieren. Download von python.org. Prüfen im Terminal: python3 --version.
  2. FFmpeg installieren. Whisper braucht FFmpeg zur Audio-Verarbeitung.
    • macOS: brew install ffmpeg
    • Ubuntu/Debian: sudo apt install ffmpeg
    • Windows: über Chocolatey choco install ffmpeg oder direkter Download von ffmpeg.org
  3. Whisper via pip installieren.
    pip install openai-whisper
  4. Audio transkribieren.
    whisper meine_audio.mp3 --language German --model large-v3
    
    # Ergebnis-Dateien: meine_audio.txt, .srt, .vtt, .json
    # Weitere Optionen: --output_format srt, --task transcribe|translate

GPU vs CPU — realistische Verarbeitungszeiten

Für Large-v3 auf einer NVIDIA RTX 4090 (24 GB VRAM): etwa 10-Minuten-Audio in 1 Minute Verarbeitungszeit. Auf einer RTX 4060 (8 GB VRAM): etwa 10-Minuten-Audio in 3–5 Minuten. Auf CPU (Intel/AMD, 16 GB RAM): etwa 10-Minuten-Audio in 30–50 Minuten — für gelegentliche Nutzung akzeptabel, für Bulk nicht.

Apple Silicon (M1/M2/M3): über MLX-Whisper-Optimierung etwa doppelt so schnell wie CPU auf x86 — für gelegentliche Nutzung praktikabel ohne dedizierte GPU.

Docker-Alternative

Wenn Sie Python-Konflikte auf Ihrem System vermeiden möchten, ist Docker die saubere Alternative:

docker run --gpus all -v $PWD:/data \
  onerahmet/openai-whisper-asr-webservice:latest-gpu \
  whisper /data/meine_audio.mp3 --language German --model large-v3

Community-Container: onerahmet/openai-whisper-asr-webservice, ahmetoner/whisper-asr-webservice und weitere. Für Produktion empfohlen: eigenes Dockerfile mit Whisper-Fork Faster-Whisper (4× schneller).

Google Colab (browserbasiert, kein Setup)

Für gelegentliche Nutzung ohne lokales Setup: Google Colab mit kostenlosem GPU-Zugang (T4). Whisper-Colab-Notebooks im Umlauf, Suche „openai whisper colab“ → in Sekunden ein lauffähiges Notebook. Grenzen: begrenzte GPU-Sessions (typisch 12h), keine Persistenz zwischen Sessions.

WebUI-Alternativen (grafische Oberfläche)

Für Nutzer ohne Kommandozeilen-Affinität gibt es mehrere Whisper-WebUIs mit ähnlicher Funktionalität:

  • Buzz — kostenlos, macOS/Windows/Linux, grafische Oberfläche, Whisper Large-v3 direkt integriert
  • MacWhisper — macOS-spezifisch, sehr benutzerfreundlich, Pro-Version mit Zusatzfunktionen
  • WhisperUI / whisper-webui — browserbasierte lokale WebUI, mehrere Community-Versionen
  • Whisper Desktop — Windows-spezifisch, kostenlos, mit GUI-Konfiguration der Modelle

Hosted vs API vs Selbst-Hosten — drei Wege im Vergleich

Historisch war die Wahl binär: OpenAI-API oder eigene GPU. 2026 ist es dreifach: klassische Selbst-Hosting, OpenAI-API und dritte-Partei-Hosted-Dienste (VexaScribe, HuggingFace Inference, Replicate). Jede Option hat einen anderen Sweet Spot:

Selbst-Hosten (lokal auf eigener Hardware)

Vorteile: permanent kostenlos (nur Hardware + Strom), keine Datenübertragung, DSGVO-optimal, volle Kontrolle über Modell-Version und Parameter.

Nachteile: Einmal-Investment in GPU (350-1700 €), Setup-Aufwand (Python, FFmpeg, CUDA), Wartungsarbeit, keine Skalierung bei Peaks.

OpenAI-API (offizielle Cloud-API)

Vorteile: keine Setup-Arbeit, automatische Skalierung, immer aktuellste Modell-Version, pay-per-use.

Nachteile: $0,006 pro Audiominute (skaliert bei Hochvolumen), Server in USA (Schrems-II-Problem für DSGVO), keine Feature-Extras wie Diarisierung, programmatischer Zugriff nötig (HTTP-API).

Hosted-Drittanbieter (VexaScribe, HuggingFace, Replicate)

Vorteile: Web-Oberfläche für Nicht-Entwickler, oft günstiger als OpenAI-API bei mittlerer Nutzung, EU-Hosting-Optionen (VexaScribe: AWS eu-west-2 London), Zusatzfeatures (Diarization, SRT-Export, Übersetzung integriert).

Nachteile: monatliches Abo statt pay-per-use, keine volle Kontrolle über Modell-Details, Anbieter-Abhängigkeit.

VexaScribe-Pipeline — wie hosted Whisper konkret funktioniert

Für Interessierte: was VexaScribe im Hintergrund tut, wenn Sie eine Audio-Datei hochladen. Fünf-Schritt-Pipeline:

  1. Upload und Preprocessing: Audio via HTTPS zu AWS eu-west-2 (London). Automatische Format-Konvertierung wenn nötig (z. B. .m4a zu 16kHz-WAV für Whisper-Input). Loudness-Normalisierung reduziert Extreme.
  2. Sprach-Erkennung: Auto-Detect wählt die Sprache (oder Sie wählen manuell). Deutsch wird als Tier-1 mit Whisper Large-v3 verarbeitet.
  3. Whisper Large-v3 Inferenz: das eigentliche Transkriptions-Modell läuft auf GPU-Instanzen (NVIDIA A10G) — typisch 5-15 Minuten Verarbeitungszeit pro Audiostunde.
  4. Post-Processing: Wort-Level-Zeitstempel, optionale Sprecher-Diarisierung (WhisperX-basiert), Formatierung nach Wunsch (Absätze, Kapitel, Zeitmarken-Granularität).
  5. Export: Fertige Datei als TXT, DOCX, SRT, VTT oder JSON. Alle Formate aus einer Transkription — Sie wählen beim Download.

Alle Zwischenergebnisse werden in AWS eu-west-2 (London, EU) gespeichert. Auf Anfrage AV-Vertrag (Auftragsverarbeitungsvertrag) für DSGVO-konforme Nutzung. Audio-Daten werden nicht zum Whisper-Training verwendet — der offizielle Whisper-Codebase auf github.com/openai/whisper ist eingefroren, keine Rückflüsse an OpenAI.

Whisper-Grenzen und wo es scheitert

Whisper ist stark, aber nicht magisch. Sechs typische Grenzfälle, in denen Sie Nachbearbeitung einplanen sollten oder Whisper gar nicht die richtige Wahl ist:

1. Ausgeprägte Dialekte

Bayerisch, Schwäbisch, Sächsisch, Wienerisch werden systematisch schlechter transkribiert (85-90 % WER vs 96 % Standarddeutsch). Bei stark dialektaler Aufnahme: mehr Zeit für manuelle Nachkorrektur einplanen oder auf einen menschlichen Transkribenten mit lokalem Sprachkontext zurückgreifen.

2. Fachvokabular ohne Kontext

Medizinische, juristische, technische Begriffe erreichen 20-30 % Fehlerrate auf den Fachwörtern selbst (nicht auf dem Gesamttext). Whisper kennt nicht Ihre spezifische Domäne. Lösung: Wörter mit Custom-Prompt vorgeben (Whisper unterstützt bis 224 Tokens im Prompt-Feld), oder manuelle Nachkorrektur.

3. Code-Switching zwischen Sprachen

„Ich habe today ein wichtiges Meeting“ mit englischen Einschüben in deutschem Satz — Whisper wechselt manchmal fälschlicherweise die Sprache oder transkribiert englische Wörter als deutsch-klingende Näherungen. Bilingual-Sprecher (viele Berliner, Schweizer, Migrations-Kontexte) sollten mit Nachkorrektur rechnen.

4. Mehrere überlappende Sprecher

Standard-Whisper hat keine Sprecher-Diarisierung — bei überlappender Sprache wird ein Sprecher „gewinnen“, der andere fehlt. Lösung: WhisperX mit Diarization einsetzen oder Hosted-Dienst mit integrierter Sprecher-Erkennung.

5. Sehr kurze Aufnahmen (unter 30 Sekunden)

Whisper braucht etwas Kontext für gute Ergebnisse. Bei extrem kurzen Clips (unter 30s) kann die Genauigkeit unerwartet fallen — insbesondere bei einzelnen Wörtern oder kurzen Ausrufen. Für kurze Clips ggf. mehrere zusammenfügen und dann trennen.

6. Halluzinationen bei Stille

Wenn eine Aufnahme längere stille Abschnitte enthält (10+ Sekunden), erfindet Whisper manchmal Text (etwa „Untertitel des ZDF, 2024“ oder ähnliches Trainingsdaten-Rauschen). Lösung: --no_speech_threshold anheben oder Voice-Activity-Detection vor Whisper-Verarbeitung (Silero-VAD).

Wie du Whisper nutzt — Workflows pro Anwendungsfall

Whisper ist ein Werkzeug, kein Endprodukt. Der Wert entsteht durch die Einbettung in einen Workflow. Vier häufige Anwendungsfälle mit konkreten Schritten:

Podcast-Produktion

  1. Audio nach der Aufnahme als WAV oder FLAC exportieren (verlustfrei für beste Whisper-Genauigkeit)
  2. Whisper Large-v3 mit --output_format srt --output_format json ausführen — SRT für Video-Untertitel-Version, JSON für Wort-Level-Zeitstempel
  3. In Descript oder Adobe Audition Transkript-Editor öffnen, KI-Ausgabe mit Play-Referenz überprüfen
  4. Nach Korrektur: SRT für YouTube-Version, JSON für Show-Notes-Timestamps, TXT für Blog-Version

Meeting-Aufzeichnung

  1. Zoom/Teams/Meet-Aufnahme als MP4 mit Audio-Track exportieren
  2. Whisper Large-v3 mit --language German --task transcribe ausführen
  3. Wenn mehrere Sprecher: WhisperX statt Standard-Whisper für Sprecher-Diarisierung
  4. Transkript in einer der drei Formen ablegen: TXT (schneller Überblick), DOCX (mit Sprecher-Labels und Zeitmarken), Notion/Confluence (mit Speaker-Bookmarks)

Qualitatives Interview (Sozialforschung)

  1. Aufnahme als MP3 (128kbps reicht) — Whisper akzeptiert direkt
  2. Whisper Large-v3 auf voller Genauigkeit — nicht Turbo, weil Namen und Fachbegriffe kritisch sind
  3. Ausgabe als TXT plus JSON (JSON für Zeitmarken-Bezüge in der Analyse)
  4. Manuelle Nachbearbeitung nach gewähltem Regel-System (Kuckartz, Dresing-Pehl) — Whisper liefert Rohtext, die Regel-Anpassung erfolgt in Subtitle Edit oder MAXQDA

Untertitel-Erstellung für Video

  1. Video als MP4 oder direkt Audio-Track (Whisper extrahiert Audio automatisch bei Video-Input)
  2. Whisper Large-v3 mit --output_format srt — direkte SRT-Ausgabe mit synchronisierten Zeitstempeln
  3. Optional: --word_timestamps True für Wort-Level-Zeitstempel (nützlich bei Kapwing/CapCut Karaoke-Style-Untertiteln)
  4. SRT in Video-Editor importieren (Premiere, DaVinci, CapCut) oder direkt in Video einbrennen (HandBrake, FFmpeg)

Whisper-Alternativen

Whisper ist stark, aber nicht das einzige gute ASR-Modell. Sieben ernsthafte Alternativen:

Faster-Whisper

Whisper-Fork mit CTranslate2

Stärke: 4× schneller als Original-Whisper bei identischer Genauigkeit; VRAM-Bedarf halbiert

Schwäche: Nur Selbst-Hosten, kein Hosted-Angebot

Passt für: Produktions-Selbst-Hosting mit hoher Durchsatz-Anforderung

WhisperX

Whisper + Forced Alignment + Diarization

Stärke: Wort-Level-Zeitstempel und Sprechererkennung

Schwäche: Komplexer Setup, mehrere Modelle nötig

Passt für: Interview-Transkription, Untertitel mit präzisen Zeitstempeln

whisper.cpp

C++-Portierung von Whisper

Stärke: Läuft auf Apple Silicon nativ, sehr effizient, mobile-tauglich (iOS-Apps)

Schwäche: Command-line-only, Setup für Nicht-Entwickler schwierig

Passt für: macOS-Nutzer mit Apple-Silicon; mobile Whisper-Integrationen

Deepgram Nova-3

Kommerzielle API

Stärke: Sehr schnell, gute Speaker-Diarization, günstig ab $0,0036/min

Schwäche: Proprietär, USA-Hosting

Passt für: Hochvolumen-API-Nutzung, Live-Streaming-Transkription

AssemblyAI Universal-2

Kommerzielle API

Stärke: Zusatzfunktionen (Sentiment, Themen, Chapters, PII-Redaktion)

Schwäche: Preis (~$0,015/min), USA-Hosting

Passt für: Media-Intelligence-Anwendungen mit Zusatz-Analysen

Speechmatics

Kommerzielle API, UK-basiert

Stärke: Sehr gute Genauigkeit auf britischen und irischen Akzenten, EU-Hosting-Option

Schwäche: Preis auf Anfrage, weniger Community-Support als Whisper-basierte

Passt für: Britische Marktanwendungen, wenn EU-Hosting Pflicht ist

VexaScribe (hosted Whisper)

Hosted Whisper Large-v3 mit EU-Hosting

Stärke: DSGVO-konform (AWS eu-west-2 London), keine Setup-Komplexität, deutsche Weboberfläche

Schwäche: Monatliche Kosten (ab $2 für 200 Min), keine Selbst-Kontrolle über Modell-Details

Passt für: Berufliche Nutzung ohne eigenes DevOps oder GPU-Setup

Ist Whisper kostenlos? — Die klare Antwort

Ja, das Open-Source-Modell ist unter MIT-Lizenz permanent kostenlos. Sie können Whisper lokal installieren, beliebig viel Audio verarbeiten, kommerziell einsetzen, in eigene Produkte integrieren. Der einzige „Kostenfaktor“ ist Ihre Hardware und Strom.

Nein, die OpenAI-API ist bezahlt — $0,006 pro Audiominute, abgerechnet nach tatsächlicher Nutzung. Für gelegentliche private Nutzung (paar Stunden im Monat) liegen die Kosten unter $1/Monat. Für professionellen Einsatz mit hoher Zuverlässigkeit ist die API meist die pragmatischere Wahl als eigenes GPU-Setup.

Wenn Sie keine Kreditkarte hinterlegen möchten und ohne Setup Whisper Large-v3 testen wollen: VexaScribe bietet 30 Minuten kostenlos bei Anmeldung — nutzt dieselbe Whisper-Large-v3-Engine mit EU-Hosting.

Datenschutz und DSGVO — welcher Weg für welchen Anwendungsfall

Der Datenschutz-Aspekt ist bei Whisper-Einsatz oft die entscheidende Wahl-Frage. Für Anwaltskanzleien, Arztpraxen, HR-Abteilungen und andere Berufsgeheimnisträger unterliegt die Verarbeitung von Sprachaufnahmen strengen Regeln.

Selbst-Hosten — die kompromissloseste Wahl

Audio verlässt Ihr Netzwerk nie. Whisper läuft auf Ihrer Hardware, verarbeitet lokal, gibt lokal aus. Keine Third-Party-Cloud, kein AV-Vertrag nötig, kein Schrems-II-Problem. Für Berufsgeheimnisträger und DSGVO-strengste Nutzung die naheliegende Wahl. Setup-Aufwand einmal, danach unbegrenzt nutzbar.

OpenAI-API — DSGVO-kritisch

Audio geht an OpenAI-Server in den USA. OpenAI erklärt zwar, API-Daten nicht zum Training zu verwenden (im Gegensatz zur ChatGPT-Weboberfläche), aber das Schrems-II-Urteil des EuGH macht Datentransfers in die USA generell DSGVO-riskant. Für private, nicht-berufliche Nutzung akzeptabel; für Berufsgeheimnisträger meist nicht empfehlenswert.

EU-gehostete Dienste — pragmatische Wahl

VexaScribe hostet in AWS eu-west-2 (London) mit AV-Vertrag auf Anfrage. Kompromiss aus Cloud-Bequemlichkeit und DSGVO-Konformität. Audio geht zwar in die Cloud, aber innerhalb der EU. Für die meisten geschäftlichen Anwendungen (Meeting-Transkription, Podcast-Produktion, Content-Erstellung) die richtige Balance zwischen Aufwand und Datenschutz.

Preisvergleich — Detailtabelle

SzenarioAPI-KostenSelbst-HostenHosted (VexaScribe)Empfehlung
10 Stunden/Monat (gelegentliche Nutzung)$3,60 pro Monat ($43/Jahr)GPU (RTX 4060 ~350 €) + StromVexaScribe Starter $2/Monat (deckt 200 Min ab, also 3,3h/Mo)API oder hosted — Break-even bei GPU nach 6+ Jahren
100 Stunden/Monat (regelmäßig)$36 pro Monat ($432/Jahr)GPU (RTX 4060) + Strom (~5€/Monat), Amortisierung ~9 MoVexaScribe Basic $5/Mo (1000 Min) oder Pro $10/Mo (2500 Min)Hosted günstiger; Selbst-Hosten sinnvoll ab GPU-Amortisierung
500 Stunden/Monat (Hochvolumen)$180 pro Monat ($2.160/Jahr)GPU (RTX 4090 ~1700 €) + Strom (~15€/Monat), Amortisierung ~10 MoVexaScribe Studio $20/Mo (6000 Min = 100h) oder EnterpriseSelbst-Hosten sinnvoll — Amortisierung nach ~10 Monaten
DSGVO-sensible DatenOpenAI-Server (USA) — Schrems-II-RisikoLokal, kein Datentransfer — beste DSGVO-WahlVexaScribe AWS eu-west-2 London — DSGVO-konform mit AV-VertragSelbst-Hosten oder EU-Hosted-Dienst (VexaScribe)
Wechselnde Nutzung + kein DevOpsSkaliert automatisch, aber Abrechnung schwer prognostizierbarFeste Hardware, wenig flexibel bei PeaksVexaScribe skaliert nahtlos, klare monatliche KostenHosted-Dienst — beste Balance aus Flexibilität und Kostentransparenz

API-Preise laut openai.com/pricing, verifiziert 15. August 2026. GPU-Preise sind Retail-Richtwerte; Stromkosten kalkuliert bei 0,30 €/kWh und 200 W durchschnittlicher GPU-Auslastung.

GitHub, Open Source und Lizenz

Whisper-Quellcode liegt auf github.com/openai/whisper unter MIT-Lizenz. Das bedeutet: freie kommerzielle Nutzung, Modifikation und Weiterverbreitung sind erlaubt, ein Copyright-Hinweis muss enthalten bleiben. Die Modellgewichte werden über Hugging Face bereitgestellt und beim ersten Ausführen automatisch heruntergeladen.

Die Community um Whisper ist groß: über 70.000 Sterne auf GitHub, unzählige Forks (Faster-Whisper, WhisperX, whisper.cpp für C++-Portierung), zahlreiche WebUIs. Für aktuelle Modellversionen ist immer das offizielle OpenAI-Repository die Referenz.

Häufige Fragen zu Whisper Transkription

Was ist Whisper?

Whisper ist ein Open-Source-Modell für automatische Spracherkennung (ASR) von OpenAI, veröffentlicht im September 2022 unter MIT-Lizenz. Es unterstützt 96+ Sprachen inklusive Deutsch und kann Audio in Text umwandeln (Speech-to-Text) sowie fremdsprachiges Audio direkt ins Englische übersetzen. Whisper ist entweder kostenlos zum Selbst-Hosten (Code auf GitHub verfügbar) oder als bezahlte API bei OpenAI ($0,006 pro Audiominute, Stand 2026-08). Aktuellste Modellversion ist Large-v3 (November 2023) plus die schnellere Turbo-Variante (Oktober 2024).

Wie gut funktioniert Whisper auf Deutsch?

Sehr gut. Deutsch ist eine Whisper-Tier-1-Sprache und erreicht mit dem Large-v3-Modell etwa 4,5 % Word Error Rate (WER) auf dem FLEURS-Benchmark — praktisch identisch mit Englisch (4,2 % WER). Auf sauberer Audio (Studio-Mikrofon, Standarddeutsch) liegen Sie bei 94–96 % Genauigkeit. Ausgeprägte Dialekte (Bayerisch, Schwäbisch, Sächsisch) fallen auf 85–90 %; medizinische, juristische oder technische Fachbegriffe haben 20–30 % Fehlerrate unabhängig vom Modell. Für die meisten geschäftlichen und journalistischen Anwendungen ist Whisper Large-v3 auf Deutsch produktionsreif.

Ist Whisper kostenlos?

Zwei Antworten. (1) Als Open-Source-Software: Ja, permanent kostenlos unter MIT-Lizenz. Sie können Whisper lokal auf Ihrem Rechner installieren und beliebig viel Audio verarbeiten — der einzige Kostenfaktor ist Ihr Strom und (für schnelle Verarbeitung) eine GPU. (2) Als OpenAI-API: Nein, die API kostet $0,006 pro Audiominute (Stand August 2026, siehe openai.com/pricing). Für 100 Stunden Audio pro Monat sind das $36 — meist günstiger als eine eigene GPU-Anschaffung, aber Daten verlassen Ihre Infrastruktur. Für gelegentliche private Nutzung reicht das Self-Hosting; für professionelle Produktion mit hoher Zuverlässigkeit ist die API oder ein Hosted-Dienst (VexaScribe, OpenAI direkt, Deepgram) meistens die praktischere Wahl.

Wie installiere ich Whisper lokal?

Vier Schritte auf einem beliebigen macOS-, Linux- oder Windows-Rechner. (1) Python 3.9 oder neuer installieren (python.org). (2) FFmpeg installieren — auf macOS mit Homebrew (brew install ffmpeg), auf Ubuntu mit apt (sudo apt install ffmpeg), auf Windows über die offizielle Download-Seite oder Chocolatey. (3) In einem Terminal: pip install openai-whisper. (4) Ein Modell laden und Audio transkribieren: whisper meine_audio.mp3 --language German --model large-v3. Die erste Ausführung lädt das Large-v3-Modell (~3 GB). Für schnelle Verarbeitung ist eine NVIDIA-GPU mit CUDA empfohlen; auf CPU dauert Large-v3 etwa Realtime × 3–5 (10-Minuten-Audio in 30–50 Minuten). Alternative mit grafischer Oberfläche: WhisperUI (whisper.tiiny.site), Buzz oder MacWhisper (macOS).

Was ist der Unterschied zwischen Whisper Large-v3 und Turbo?

Zwei Modellvarianten mit unterschiedlichem Tradeoff. Large-v3 (November 2023) ist das genaueste Modell — 1,55 Milliarden Parameter, beste WER-Werte auf allen Sprachen, aber langsam ohne GPU. Turbo (Oktober 2024) ist eine Destillation von Large-v3 — 809 Millionen Parameter, etwa achtmal schneller bei nur 1–2 Prozentpunkten Genauigkeitsverlust auf den meisten Sprachen. Für Deutsch: Large-v3 bei 4,5 % WER, Turbo bei etwa 5,5 % WER auf FLEURS — praktisch kaum spürbar. Empfehlung: Turbo für schnelle Bulk-Verarbeitung, Large-v3 für professionelle Endergebnisse.

Whisper API oder Selbst-Hosten — welches ist günstiger?

Rechnen Sie mit konkreten Zahlen. Selbst-Hosten: Anschaffung einer NVIDIA-GPU (RTX 4060 ~350 €, RTX 4090 ~1700 €) plus Strom. RTX 4060 verarbeitet ~1 Stunde Audio in 5–10 Minuten. API: $0,006 pro Audiominute, keine Anschaffung, keine Wartung, Daten gehen zu OpenAI. Beispiel: 500 Stunden Audio pro Monat = 30.000 Minuten × $0,006 = $180/Monat. Break-even zur RTX 4090 nach ~10 Monaten. Für gelegentliche Nutzung (unter 50h/Monat): API günstiger. Für Dauerbetrieb bei DSGVO-sensiblen Daten: Selbst-Hosten strategisch besser. Für professionelle Nutzung ohne eigene Infrastruktur: Hosted-Dienst wie VexaScribe (Whisper Large-v3 mit EU-Hosting, ab $2/Monat für 200 Minuten).

Was sind gute Alternativen zu Whisper?

Fünf ernsthafte Optionen. (1) Deepgram Nova-3: kommerzielle API, ähnliche Genauigkeit wie Whisper, oft schneller, mit Speaker-Diarization. (2) AssemblyAI Universal-2: kommerzielle API mit starken Zusatzfunktionen (Sentiment, Themen). (3) Faster-Whisper: Whisper-Fork mit CTranslate2, 4× schneller bei identischer Genauigkeit — die häufigste Wahl für Selbst-Hosting im Produktivbetrieb. (4) WhisperX: Whisper mit Forced Alignment und Speaker-Diarization — nützlich für Untertitel und Interview-Transkription. (5) NVIDIA Parakeet: neuer als Whisper, sehr schnell auf NVIDIA-Hardware, aber nur englischzentriert. Für Deutsch bleiben Whisper Large-v3 und Faster-Whisper die produktivsten Wahl.

Wie sicher sind meine Audiodaten mit Whisper?

Hängt vom Deployment ab. Selbst-Hosten (lokale Installation): Audio verlässt Ihren Rechner nie — höchste Datenschutzkontrolle, DSGVO-neutral, für sensible Nutzung (Anwaltskanzleien, Arztpraxen, Psychotherapie) die konsequente Wahl. OpenAI Whisper API: Audio wird an OpenAI-Server (USA) gesendet; laut OpenAI-Nutzungsbedingungen wird API-Daten nicht zum Training verwendet, aber DSGVO-Risiko besteht durch Datenübertragung in die USA (Schrems II). Hosted-Dienste wie VexaScribe: EU-Hosting in AWS eu-west-2 (London), AV-Vertrag auf Anfrage — DSGVO-konform, ohne die Komplexität des Selbst-Hostens. ChatGPT nutzt Whisper im Hintergrund für Voice Mode — die Datenschutz-Bedingungen von ChatGPT gelten dann.

Verwandte Seiten

Whisper Large-v3 testen — ohne Installation

VexaScribe nutzt Whisper Large-v3 mit EU-Hosting (AWS eu-west-2 London), DSGVO-konform. 30 Minuten kostenlos, ohne Kreditkarte. Deutsch als Tier-1-Sprache.