Verifiziert Juli 2026
Audio zu Text — KI-Transkription mit Whisper Large-v3
Audiodatei in Text umwandeln — online, in 99 Sprachen, DSGVO-konform (EU-Hosting). Audio transkribieren, kostenlos starten mit 30 Minuten, danach ab 2 $/Monat.
VexaScribe wandelt Audio- und Videodateien mit dem Whisper-Large-v3-Modell von OpenAI in Text um. 99 Sprachen, ~95 % Genauigkeit bei klarem englischen Audio, 93-95 % bei klarem deutschen Audio. Dateien bis 5 GB / 10 Stunden. Export als TXT, DOCX, SRT, VTT, JSON. DSGVO-konform, gehostet in AWS eu-west-2 (EU). Erste 30 Minuten kostenlos, keine Kreditkarte.
So funktioniert es
Drei Schritte vom Upload bis zum fertigen Transkript. Keine Einrichtung, keine Software-Installation.
- 1
Datei hochladen
Per Drag-and-Drop oder Auswahl eine Audio- oder Videodatei hochladen. Wir akzeptieren MP3, WAV, M4A, MP4, MOV, FLAC, OGG, AAC, AIFF, WMA, AVI, MKV, WebM und 7 weitere Formate. Bis zu 5 GB und 10 Stunden pro Datei.
- 2
KI transkribiert in Minuten
VexaScribe wendet das Whisper-Large-v3-Modell von OpenAI auf dein Audio an. Eine 60-minütige Aufnahme ist in der Regel in 5-10 Minuten fertig. Schließe den Tab und komm später zurück — der Vorgang läuft im Hintergrund weiter.
- 3
Bearbeiten, exportieren, teilen
Überprüfe das Transkript im integrierten Editor. Benenne Sprecher um, korrigiere Fehler und exportiere in TXT, DOCX, SRT, VTT oder JSON. Per Link teilen oder herunterladen.
Unterstützte Audio- und Videoformate
17 Formate, die praktisch jedes Aufnahmegerät und Tool abdecken. Dateien bis zu 5 GB und 10 Stunden pro Upload.
Audioformate
- MP3Am häufigsten
- WAVVerlustfrei
- M4AiPhone-Standard
- FLACVerlustfrei
- OGGOffenes Format
- AACApple/Streaming
- AIFFProfi-Audio
- WMAWindows
- AMRMobil
- OPUSModernes Web
Videoformate
- MP4Am häufigsten
- MOVApple/QuickTime
- AVIWindows (Legacy)
- MKVHohe Qualität
- WebMWeb-Video
- FLVFlash (Legacy)
- WMVWindows
Audio wird automatisch aus Videodateien extrahiert. Das Video selbst wird nach der Transkription nicht aufbewahrt.
Was kannst du transkribieren?
Wenn es Audio enthält, kann VexaScribe es transkribieren. Häufige Anwendungsfälle:
Podcast-Folgen
Shownotes, Blogposts, SEO-Inhalte, durchsuchbare Archive. Solo- und Multi-Host-Shows mit Sprecherkennzeichnungen unterstützt.
Interviews
Journalismus, qualitative Forschung, Personalwesen. Multi-Sprecher-Diarisierung trennt Interviewer und Befragten automatisch.
Vorlesungen und Kurse
Studierende erfassen Vorlesungen zur Wiederholung. Lehrkräfte erstellen schriftliche Kursnotizen aus aufgezeichneten Sitzungen.
Meetings
Zoom-, Google-Meet-, Microsoft-Teams-Anrufe. Lade die Aufnahme hoch oder lass den VexaScribe-Meeting-Bot teilnehmen.
Telefonate
Vertriebsanrufe, Kundeninterviews, Support-Aufzeichnungen. Auf jedem Gerät aufnehmen, hochladen und ein Transkript mit Sprechern erhalten.
Video-Inhalte
YouTube-Videos, Schulungsvideos, Kursinhalte. SRT/VTT-Untertitel mit wortgenauen Zeitstempeln generieren.
Sprache in Text umwandeln — oder Text in Sprache?
Kurze Klärung, weil beide Richtungen mit demselben Wort gesucht werden. „Sprache in Text umwandeln" heißt: aus einer Audioaufnahme (Sprache) wird geschriebener Text. Das ist Speech-to-Text (STT), auch automatische Transkription oder KI-Transkription genannt. Genau das macht VexaScribe.
Das Gegenteil — Text zu Sprache, also aus geschriebenem Text eine Audiodatei generieren — ist Text-to-Speech (TTS). Dafür sind Dienste wie ElevenLabs oder Amazon Polly gedacht. Wenn du eine Audiodatei hast und Text willst: hier bist du richtig. Wenn du einen Text hast und Audio erzeugen willst: falscher Ort.
Audiodatei transkribieren — für jede Aufnahmequelle
Egal, womit die Audioaufnahme entstanden ist. VexaScribe akzeptiert die üblichen Quellen ohne Umwandlung.
WhatsApp-Sprachnachricht
WhatsApp speichert Sprachnachrichten im .opus-Format. VexaScribe akzeptiert .opus direkt — keine Umwandlung nötig. Weiterleiten an die eigene Chat oder in Google Drive exportieren, dann hochladen.
iPhone-Sprachmemo
Sprachmemos vom iPhone kommen als .m4a-Datei. Über die Teilen-Funktion auf iCloud, in E-Mail oder direkt im Browser (Safari iOS) hochladen. Kein Konvertieren in MP3 nötig.
Zoom / Teams / Meet-Aufnahme
Cloud- oder lokale Aufnahmen kommen als .mp4 oder .m4a. Direkt hochladen — die Tonspur wird automatisch extrahiert und mit Sprecher-Diarisierung transkribiert.
Diktiergerät
Olympus, Sony, Philips: WAV-, MP3- oder DSS-Aufnahmen (letztere vorher in WAV umwandeln). Journalismus- und Kanzlei-Workflow, ~1-6 Stunden pro Datei — passt problemlos.
Podcast / YouTube-URL
Audio- oder Video-Download als MP3, M4A oder MP4. VexaScribe akzeptiert Podcast-Feeds oder heruntergeladene YouTube-Dateien. Ideal für Show Notes, Blog-Repurposing.
MP3 / M4A / WAV allgemein
Alle gängigen Audio-Container: MP3, M4A, WAV, FLAC, OGG, AAC, AIFF, WMA, AMR, OPUS. Bitrate ≥ 64 kbps genügt für volle Genauigkeit.
Transkription in 99 Sprachen — mit automatischer Erkennung
Du musst die Sprache nicht manuell auswählen. VexaScribe erkennt die gesprochene Sprache automatisch aus dem Audio. Die Genauigkeit variiert je nach Sprachstufe:
~5 % Word Error Rate (höchste Genauigkeit)
~8-12 % Word Error Rate
+ 73 weitere Sprachen
Darunter Walisisch, Swahili, Filipino, Bengali, Punjabi, Tamil, Telugu, Marathi, Urdu, Persisch, Rumänisch, Ungarisch, Bulgarisch, Kroatisch und viele weitere. Die Genauigkeit variiert je nach Sprache und Audioqualität.
Was du mit jedem Transkript bekommst
Jede Transkription enthält diese Funktionen ohne Aufpreis in jedem bezahlten Tarif.
Sprecher-Diarisierung
Automatische Sprechererkennung und -kennzeichnung. Mehrere Sprecher erscheinen als Sprecher 1, Sprecher 2, Sprecher 3 usw. Benenne sie im Editor um (z. B. „Moderator“, „Gast“, echte Namen).
Wortgenaue Zeitstempel
Jedes Wort wird auf die Millisekunde mit einem Zeitstempel versehen. Klicke auf ein beliebiges Wort im Editor, um zu dieser Stelle im Audio zu springen. Unverzichtbar für Videountertitel und die Überprüfung von Zitaten.
Mehrere Exportformate
TXT (Klartext), DOCX (Word-Dokument), SRT (Videountertitel), VTT (Web-Untertitel) und JSON (für Entwickler). Alle Formate sind in jedem bezahlten Tarif ohne Upgrade verfügbar.
KI-Zusammenfassungen
Optionale KI-generierte Zusammenfassung mit den wichtigsten Punkten, Entscheidungen, Aufgaben und Kapitelmarken. In allen bezahlten Tarifen verfügbar. Nützlich für Meeting-Notizen, Podcast-Shownotes und die Nachbereitung von Vorlesungen.
Wie genau ist die Transkription von VexaScribe?
VexaScribe erreicht rund 95 % Genauigkeit (5 % Word Error Rate) bei klarem englischen Audio mit einem einzelnen Sprecher. Bei klarem deutschen Audio liegt die Genauigkeit typischerweise bei 93-95 %.
Die tatsächliche Genauigkeit variiert je nach Audioqualität:
- ●Klares Podcast-Audio: 3-6 % WER (94-97 % genau)
- ●Störungsbehaftete Interviews, Hintergrundmusik: 8-15 % WER (85-92 % genau)
- ●Starke Akzente, Fachjargon, mehrere überlappende Sprecher: 10-20 % WER (80-90 % genau)
Wir empfehlen, Transkripte vor der Veröffentlichung kritischer Inhalte zu überprüfen — kein KI-Tool erreicht die 99 %+ Genauigkeit menschlicher Transkription, aber VexaScribe ist 20-100× günstiger als menschliche Dienste wie Rev (1,99 $/Min.).
DSGVO-konform, EU-Hosting
Für deutsche Nutzer ist der Ort der Datenspeicherung eine echte Frage — nicht nur ein Compliance-Häkchen. VexaScribe hostet ausschließlich in AWS eu-west-2 (Frankfurt / London). Audiodateien werden per TLS 1.2+ übertragen und mit AES-256 im Ruhezustand verschlüsselt. Die Verarbeitung findet vollständig in der EU statt.
Wir nutzen deine Aufnahmen nicht für KI-Training — das ist ein vertraglich zugesicherter Punkt, kein Marketing-Slogan. Für sensible Inhalte (journalistische Quellen, medizinisches Diktat, Personalgespräche, Anwaltsgespräche) ist die vertragliche Nicht-Wiederverwendung die relevante Zusicherung.
Löschung: du kannst Dateien jederzeit über das Dashboard entfernen. Kontolöschung ist selbstbedient in den Einstellungen. Für HIPAA-abgedeckte klinische Inhalte in den USA sind wir nicht HIPAA-zertifiziert — dann bitte einen HIPAA-Anbieter wählen. Für alle anderen professionellen Anwendungsfälle in Deutschland und der EU deckt unsere Vereinbarung DSGVO-Anforderungen ab.
Einfache, transparente Preise
Zahle nur, was du nutzt. Keine Gebühren pro Platz, keine versteckten Kosten. Jederzeit kündbar.
Starter
200 Min./Monat
Solo-Creator
Basic
1.000 Min./Monat
Regelmäßige Podcaster
Pro
2.500 Min./Monat
Intensive Nutzung
Format-spezifische Anleitungen auf Deutsch
Neben dieser allgemeinen Übersicht haben wir dedizierte Seiten für die häufigsten Ausgangsformate. Jede Seite deckt formatspezifische Details ab (iPhone-Transfer, Bulk-Workflows, typische Genauigkeit für die Quelle).
MP3 zu Text
Podcast, Konferenzaufnahmen und beliebige .mp3-Dateien — Bulk bis zu 50 Dateien parallel.
MP4 zu Text
Videos — Zoom/Teams/Meet-Aufzeichnungen, YouTube-Downloads, automatische Audioextraktion.
Interview transkribieren
Forschung und Journalismus — Sprecher-Labels, wörtlich oder geglättet, DSGVO-konform.
YouTube-Transkript
Video-URL einfügen und das Transkript in Sekunden erhalten — ohne Download.
Diktieren
Live mit der Stimme schreiben statt tippen — die besten Diktier-Apps für iPhone, Windows, Mac und Word.
Sprachmemo transkribieren
iPhone-, iPad- und Mac-Sprachmemos (.m4a) — AirDrop/iCloud-Transfer, iOS-18-Vergleich, DSGVO-konform.
Untertitel-Generator
SRT-/VTT-Untertitel für YouTube, TikTok, Instagram Reels und YouTube Shorts.
WhatsApp Sprachnachricht transkribieren
Native WhatsApp-Transkription (iOS/Android) plus KI-Fallback für lange Nachrichten oder Dialekt.
Whisper Transkription (Deutsch)
Das KI-Modell hinter modernen Transkriptions-Tools — Installation, Modelle, API-Kosten, EU-Alternativen.
ChatGPT Audio transkribieren
Voice Mode, 25-MB-Grenze, Spracheingabe, wann ChatGPT die richtige Wahl ist und wann nicht.
Was ist Transkription?
Bedeutung, Arten, Regeln (Kuckartz, Dresing-Pehl, Mayring) und Beispiele — die Pillar-Seite zum Thema.
Was ist eine SRT-Datei?
Untertitel-Format erklärt: Struktur, UTF-8, Öffnen mit VLC, Vergleich zu VTT und ASS.
SRT-Datei in Video einfügen
Sidecar, MKV-Embed, Hardcode-Burn-in mit HandBrake und FFmpeg — für YouTube, MP4, Social Media.
Vorlesung zusammenfassen mit KI
Studenten-Workflow: Audio → Transkript → Zusammenfassung → Anki-Karteikarten. Der Klausurvorbereitungs-Stack für DE-Studierende.
Audio kostenlos in Text umwandeln — welche Tools sind wirklich gratis?
„Kostenlos“ heißt bei Transkriptions-Tools sehr Unterschiedliches. Manche geben Ihnen unbegrenzte Minuten, aber mit Wasserzeichen. Manche bieten großzügige Free-Tiers, aber halten wichtige Formate (SRT, VTT, Sprecher-Trennung) hinter der Bezahlmauer zurück. Manche sagen „gratis“ und meinen 5-Minuten-Trial. Hier die ehrliche Übersicht — inklusive VexaScribes eigenem Free-Tier und wo andere Tools genauer für kostenlose Nutzung geeignet sind.
Vergleichstabelle — kostenlose Transkription (Stand 2026-08-14)
| Tool | Free-Tier-Umfang | Datei-Grenze | Sprachen | Hosting / Datenschutz | Anmeldung nötig? |
|---|---|---|---|---|---|
| VexaScribe | 30 Min einmalig gratis, dann Bezahlplan ab $2/Mo | 5 GB / 10 h pro Datei | 99 (Whisper Large-v3) | EU (AWS eu-west-2 London) | Ja (keine Karte) |
| Notta | 120 Min/Monat gratis, dann ab $8,25/Mo | 3 h pro Datei (Bezahl) | 104 (eigenes Modell) | USA | Ja |
| Turboscribe | 3 Transkriptionen/Tag (max 30 Min je), dann ab $10/Mo | 30 Min pro Datei (gratis) | 98+ (Whisper) | USA | Ja |
| Vidnoz | Gratis mit Größe/Länge-Limit | 200 MB / 30 Min | 70+ | USA | Ja |
| Scribewave | 2 Transkriptionen/Tag (max 15 MB je), gratis ohne Konto | 15 MB | 100+ | EU | Nein |
| Breev | Gratis, ohne Anmeldung | Datei-Grenze anbieter-abhängig | Whisper-basiert | EU (gemäß Angaben) | Nein |
| Whisper (lokal, selbst gehostet) | Permanent kostenlos (MIT-Lizenz) | Keine Grenze (nur eigene Hardware) | 96+ (Whisper Large-v3) | Lokal (kein Transfer) | Nein |
Verifiziert 14. August 2026 gegen jeweilige Anbieter-Preisseiten. Free-Tiers ändern sich häufig; im Zweifel Preisseite des Anbieters vor der Nutzung prüfen.
Wann „kostenlos“ wirklich ausreicht
Vier Szenarien, in denen ein Free-Tier real ausreicht — kein Upgrade nötig:
- Einzelne Sprachnotizen unter 10 Minuten: Scribewave (2/Tag ohne Konto), Breev (ohne Anmeldung), oder VexaScribes 30-Min-Freikontingent decken einzelne Erinnerungen und Ideen ab.
- Studenten mit gelegentlichen Interviews: Turboscribe (3 Transkriptionen/Tag, je 30 Min) reicht für Vorlesungs-Aufnahmen, Bachelor-Interview-Nachbereitung oder qualitative Studien mit begrenzter Anzahl Interviews.
- Kurze Meeting-Zusammenfassungen: Notta (120 Min/Monat) deckt 5-6 einstündige Team-Meetings pro Monat ab — ausreichend für kleine Teams oder Wochen-Retrospektiven.
- Datenschutz-kritische Einmalprojekte: lokales Whisper permanent kostenlos, kein Upload nötig. Setup dauert 30 Minuten, dann unbegrenzte Nutzung.
DSGVO und lokale Transkription — Whisper für maximale Datenschutzkontrolle
Für DSGVO-sensible Nutzung (Anwaltskanzleien, Ärzte, Psychotherapeuten, Journalismus mit Quellenschutz) ist die Frage nach „kostenlos“ zweitrangig — wichtiger ist, dass Audio das eigene Netzwerk nicht verlässt. Zwei Wege:
- Whisper lokal installieren: permanent kostenlos, keine Cloud, keine Datenübertragung. Voraussetzung: Python + FFmpeg + idealerweise NVIDIA-GPU. Für praktikable Geschwindigkeit auf CPU-only rechnen mit 30-50 Min Verarbeitungszeit pro Audiostunde (Large-v3). Details siehe unsere Whisper-Installations-Anleitung.
- EU-gehostetes Cloud-Tool (wie VexaScribe): Kompromiss aus Cloud-Bequemlichkeit und DSGVO. Audio geht zu einem EU-Rechenzentrum (AWS eu-west-2 London), AV-Vertrag auf Anfrage. Kein Setup, kein DevOps, gleiche Whisper-Large-v3-Qualität wie lokal. Kostet ab $2/Monat für 200 Minuten — die 30 Gratis-Minuten reichen zum Testen.
Kostenlos vs Free-Trial — die ehrliche Unterscheidung
Nicht jedes „kostenlos“ ist wirklich dauerhaft kostenlos. In der SaaS-Welt hat sich ein Dark Pattern etabliert: Tools werben mit „kostenlos“, meinen aber „14-Tage-Trial mit voller Feature-Palette, danach Zwangsabo“. Fünf Muster, die Sie erkennen sollten:
- Echt kostenlos (dauerhaft): Free-Tier ohne Ablaufdatum, mit klaren Nutzungs-Limits. Beispiele: VexaScribe (30 Min/einmalig gratis), Whisper lokal (permanent MIT-Lizenz), Scribewave (2 Transkriptionen/Tag ohne Konto).
- Free-Trial (mit Endzeit): Voller Feature-Zugang für X Tage/Minuten, danach Bezahlpflicht. Tools werben oft mit „kostenlos“ und meinen Trial. Wenn Sie „14 Tage kostenlos testen“ oder „100 Minuten gratis“ ohne Wiederholung sehen: Trial.
- Feature-Gate: Free-Tier existiert, aber wichtige Features (SRT-Export, Sprecher-Erkennung, längere Dateien) sind Paywall. Sie können transkribieren, aber nicht sinnvoll weiterverwenden.
- Watermark-Free-Tier: Transkript ist frei, aber Video-Export enthält Anbieter-Wasserzeichen. Für Business-Nutzung praktisch unbrauchbar.
- Upgrade-Nag: Free-Tier funktional, aber User Interface bombardiert mit Upgrade-Prompts. Kostet keine Nerven, wenn Sie fokussiert arbeiten.
Ehrliche Trial-Angebote sind okay: Wenn ein Tool „14 Tage kostenlos testen“ explizit sagt, ist das transparent — Sie wissen, worauf Sie sich einlassen. Problematisch sind nur Tools, die „kostenlos“ als Header-Slogan verwenden und die Trial-Struktur im Kleingedruckten verstecken.
Free-Tier-Fußnoten — was Sie vor Nutzung prüfen sollten
Checkliste für jedes „kostenlose“ Transkriptions-Tool, bevor Sie sensible Audio hochladen:
- Ist das Free-Tier zeitlich unbegrenzt oder nur Trial? AGB oder Pricing-Seite prüfen. Wenn „X Tage kostenlos“: Trial. Wenn „X Minuten/Monat gratis dauerhaft“: echtes Free-Tier.
- Wo werden Daten gehostet? USA (Notta, Turboscribe, Otter, Rev, Descript) → Schrems-II-Problem für DSGVO-sensible Nutzung. EU (VexaScribe, Scribewave, Breev) → DSGVO-freundlich.
- Wird KI mit Ihren Daten trainiert? Datenschutz-Erklärung nach „training data“ oder „model improvement“ durchsuchen. Manche kostenlose Tools verwenden Ihre Aufnahmen zum Training — für berufliche Nutzung kritisch.
- Bekomme ich SRT/VTT-Export im Free-Tier? Manche Tools geben im Free-Tier nur TXT (Fließtext), sperren SRT/VTT hinter Bezahlung. Für Video-Untertitel-Workflow ohne SRT-Export unbrauchbar.
- Gibt es Datei-Größen-Limits, die meine Aufnahmen ausschließen? Free-Tiers begrenzen oft auf 15-30 MB oder 30 Min pro Datei. Bei 1-stündigen Meeting-Aufnahmen praktisch unbrauchbar.
- Muss ich mich registrieren? Nicht-Registrierung ist datenschutz-freundlicher (keine Konto-Verknüpfung mit den Audios). Tools wie Scribewave und Breev arbeiten ohne Konto.
- Gibt es ein Wasserzeichen auf Exporten? Bei Video-Untertitel-Workflow kritisch — Wasserzeichen auf Untertitel-Video-Export macht kommerzielle Nutzung unmöglich.
Faustregel für Business-Nutzung: Bei regelmäßiger geschäftlicher Nutzung ist ein günstiges Bezahl-Abo (VexaScribe Starter $2/Monat, entspricht 200 Min) fast immer besser als das Rumhopsen zwischen mehreren Free-Tiers. Zeit für Tool-Wechsel und Konto-Verwaltung ist teurer als $2/Monat.
Wann Bezahl-Tools sinnvoller sind
Ab bestimmten Nutzungsmustern lohnen die Bezahl-Pläne — die pro-Minute-Kosten sind bei allen genannten Tools deutlich unter $0,01. Konkret sinnvoll ab:
- 200+ Minuten Audio pro Monat — VexaScribe Starter ($2/Mo) günstiger als Notta ($8,25) oder Turboscribe ($10) bei gleicher Nutzung.
- Sprecher-Trennung nötig — bei Interviews mit 2+ Sprechern ist automatische Diarization Bezahl-Feature bei allen Anbietern.
- SRT- oder VTT-Export für Untertitel — Free-Tiers geben oft nur TXT; für Video-Untertitel-Workflow müssen Sie zum Bezahlplan.
- Dateien über 30 Min oder 200 MB — Vidnoz und Scribewave-Free-Tiers erlauben keine langen Aufnahmen.
- Kein Wasserzeichen im Export — bei manchen Tools ist das Free-Tier-Export mit Wasserzeichen versehen (bei VexaScribe nicht).
Häufig gestellte Fragen
Wie wandelt VexaScribe Audio in Text um?
VexaScribe verwendet das Whisper-Large-v3-Modell von OpenAI, um Sprache in Text umzuwandeln. Lade eine Audio- oder Videodatei hoch, und die KI verarbeitet die gesamte Aufnahme — mit Sprecherkennzeichnungen, wortgenauen Zeitstempeln und optionalen KI-Zusammenfassungen. Eine 60-minütige Datei ist in der Regel in 5-10 Minuten fertig.
Welche Audio- und Videoformate kann ich transkribieren?
VexaScribe akzeptiert MP3, WAV, M4A, FLAC, OGG, AAC, AIFF, WMA, AMR, OPUS für Audio sowie MP4, MOV, AVI, MKV, WebM, FLV, WMV für Video. Dateien können bis zu 5 GB groß und 10 Stunden lang sein. Bei Videodateien extrahieren wir die Tonspur automatisch.
Wie lange dauert die Transkription einer einstündigen Audiodatei?
Die meisten einstündigen Dateien sind in 5-10 Minuten fertig. Die Verarbeitungsgeschwindigkeit hängt von der Audioqualität, der aktuellen Auslastung und dem Dateiformat ab. Du kannst den Browser-Tab schließen und später zurückkehren — das Transkript wartet in deinem Dashboard, sobald es fertig ist.
Ist VexaScribe kostenlos?
Ja, du bekommst 30 Minuten Transkription kostenlos ohne Kreditkarte. Nach dem kostenlosen Kontingent starten bezahlte Tarife bei 2 $/Monat für 200 Minuten (Starter), 5 $/Monat für 1.000 Minuten (Basic), 10 $/Monat für 2.500 Minuten (Pro) und 20 $/Monat für 6.000 Minuten (Studio). Jederzeit kündbar.
Wie genau ist die Transkription von VexaScribe?
VexaScribe erreicht rund 95 % Genauigkeit (5 % Word Error Rate) bei klarem englischen Audio mit einem einzelnen Sprecher; bei klarem deutschen Audio liegt die Genauigkeit typischerweise bei 93-95 %. Die tatsächliche Genauigkeit variiert: klares Podcast-Audio liegt bei 3-6 % WER, geräuschvolle Interviews bei 8-15 % WER und Aufnahmen mit starken Akzenten oder Fachjargon bei 10-20 % WER. Wir empfehlen, Transkripte vor der Veröffentlichung kritischer Inhalte zu überprüfen.
Welche Sprachen werden unterstützt?
99 Sprachen einschließlich Deutsch, Englisch, Spanisch, Französisch, Italienisch, Portugiesisch, Niederländisch, Russisch, Polnisch, Japanisch, Chinesisch, Koreanisch, Arabisch, Türkisch, Hindi, Vietnamesisch, Thailändisch und viele weitere. Die Sprache wird automatisch erkannt — du musst sie vor dem Hochladen nicht manuell auswählen.
Kann ich Videodateien transkribieren?
Ja. Lade MP4-, MOV-, AVI-, MKV-, WebM-, FLV- oder WMV-Dateien hoch, und wir extrahieren die Tonspur automatisch. Das Transkript enthält Zeitstempel, sodass du es mit deinem Videoeditor synchronisieren, Untertitel generieren (SRT/VTT-Export) oder Videoinhalte in Blogposts umwandeln kannst.
Was ist der Unterschied zwischen Sprache-in-Text und Text-in-Sprache?
Beide Richtungen werden mit ähnlichen Wörtern gesucht. Sprache in Text umwandeln (Speech-to-Text, STT) heißt: aus einer Audioaufnahme wird geschriebener Text. Das ist automatische Transkription oder KI-Transkription — genau das macht VexaScribe. Der umgekehrte Fall — aus Text eine Audiodatei erzeugen (Text-to-Speech, TTS) — machen Dienste wie ElevenLabs oder Amazon Polly. Wenn du eine Audiodatei hast und Text willst: hier bist du richtig.
Was ist KI-Transkription und wie unterscheidet sie sich von klassischer Spracherkennung?
KI-Transkription (auch: automatische Transkription) nutzt moderne Sprachmodelle wie Whisper Large-v3 von OpenAI. Klassische Spracherkennung (Diktier-Software älterer Generation) arbeitete mit fest kodierten Wörterbüchern und war fehleranfällig bei Akzenten, Fachjargon und mehreren Sprechern. KI-Modelle sind auf hunderttausenden Stunden mehrsprachigem Audio trainiert und erkennen Sprache, Kontext, Sprecherwechsel und Zeitpunkte automatisch — auf Deutsch mit typischerweise 93-95 % Genauigkeit bei klarem Audio.
Erkennt VexaScribe mehrere Sprecher?
Ja, automatische Sprecher-Diarisierung ist in jedem Transkript enthalten. Mehrere Sprecher werden als Sprecher 1, Sprecher 2, Sprecher 3 usw. gekennzeichnet. Du kannst Sprecher im integrierten Editor umbenennen (z. B. „Moderator“, „Gast“, echte Namen) für mehr Klarheit im finalen Transkript.
Sind meine Audiodaten privat und DSGVO-konform gespeichert?
Ja. VexaScribe hostet ausschließlich in AWS eu-west-2 (Frankfurt / London) — deine Aufnahmen bleiben in der EU. Übertragung per TLS 1.2+, Speicherung mit AES-256 verschlüsselt. Wir nutzen deine Audiodaten nicht für KI-Training (vertraglich zugesichert, nicht nur Marketing), verkaufen keine Nutzerdaten. Löschung ist selbstbedient über das Dashboard und die Kontoeinstellungen jederzeit möglich.
Wie exportiere ich das Transkript?
VexaScribe exportiert in TXT (Klartext), DOCX (Word-Dokument), SRT (Videountertitel), VTT (Web-Untertitel) und JSON (strukturierte Daten für Entwickler). Alle Formate sind in jedem bezahlten Tarif verfügbar. SRT und VTT enthalten wortgenaue Zeitstempel für Videoeditoren.