Generador de Subtítulos — SRT y VTT automáticos desde vídeo o audio (gratis)
Sube tu vídeo o audio y obtén subtítulos precisos en 99 idiomas con marcas de tiempo a nivel de palabra en minutos. Exporta como SRT, VTT o TXT — o incrústalos directamente en el vídeo con tu propio estilo. 30 minutos gratis, sin tarjeta de crédito (subtitle generator en español).
En resumen
El generador de subtítulos de VexaScribe (auto subtitle generator) convierte cualquier archivo de audio o vídeo en SRT, VTT, TXT o subtítulos incrustados — impulsado por OpenAI Whisper Large-v3 en 99 idiomas. En español, el modelo alcanza aproximadamente un 5 % de tasa de error de palabra (WER) según el benchmark FLEURS. 30 minutos gratis, luego desde 2 $/mes por 200 minutos hasta 20 $/mes por 6.000 minutos — equivalente a entre 0,60 $ y 0,20 $ por hora de vídeo.
¿Qué es un generador de subtítulos?
Un generador de subtítulos es una herramienta impulsada por IA que reconoce el habla en archivos de audio o vídeo, la convierte en texto y le asigna marcas de tiempo precisas. El resultado es un archivo de subtítulos (típicamente SRT o VTT) que puede mostrarse sincronizado con la imagen — o incrustarse directamente en el vídeo (burn-in / hardcoded subtitles), pasando a formar parte fija del fotograma.
Para creadores, equipos de marketing, redacciones y universidades, la subtitulación automática sustituye al trabajo manual, a menudo de varias horas. VexaScribe utiliza OpenAI Whisper Large-v3 — un modelo de reconocimiento de voz entrenado con 680.000 horas de audio en 99 idiomas, con una de las mejores precisiones del sector para el español (tanto de España como de Latinoamérica).
Subtítulos vs. subtítulos para sordos (SDH / closed captions)
En el mundo hispanohablante los términos se usan a menudo como sinónimos, pero existe una diferencia importante — sobre todo de cara a la accesibilidad según WCAG 2.1 y la normativa UNE 153010:
| Formato | Contenido | Uso |
|---|---|---|
| Subtítulos (subtitles) | Solo diálogo — para espectadores que pueden oír el audio | Traducción, vídeos sin sonido en redes sociales |
| Subtítulos para sordos (SDH / closed captions) | Diálogo + [música], [aplausos], [timbre], etiquetas de hablante | Accesibilidad WCAG 2.1 SC 1.2.2 / 1.2.4, UNE 153010 |
VexaScribe genera ambos: subtítulos simples o — con unos pocos clics en el editor — versiones accesibles con etiquetas de hablante y eventos no verbales como [aplausos] o [música].
Ejemplo de salida: subtítulos SRT y VTT
Así se ve un subtítulo exportado desde una grabación en español — marcas de tiempo en formato SRT (segundos,milisegundos), UTF-8, directamente compatible con YouTube Studio, Premiere Pro, DaVinci Resolve y VLC.
1 00:00:00,000 --> 00:00:03,500 Hola y bienvenidos al podcast. Hoy hablamos de subtitulado con IA. 2 00:00:03,600 --> 00:00:07,200 Exacto — los subtítulos automáticos han mejorado muchísimo en los últimos años. 3 00:00:07,300 --> 00:00:12,800 Whisper Large-v3 alcanza en español una tasa de error de palabra de alrededor del cinco por ciento. 4 00:00:12,900 --> 00:00:16,400 Está muy cerca de lo que consiguen los transcriptores humanos profesionales. 5 00:00:16,500 --> 00:00:20,100 Para canales de redes sociales suele bastar sin necesidad de retocar nada. 6 00:00:20,200 --> 00:00:24,800 Para noticias o charlas técnicas conviene pasar un rato por el editor.
Formatos de exportación: SRT (universal) · VTT (HTML5/HLS) · DOCX (con marcas de tiempo) · TXT (texto plano) · JSON (timestamps por palabra). Los cinco salen del mismo procesamiento.
Cómo funciona el generador de subtítulos (3 pasos)
De vídeo a subtítulos SRT listos para YouTube, TikTok o Premiere en minutos.
- 1
Sube el vídeo o audio
Arrastra y suelta el archivo: MP3, WAV, M4A, FLAC (audio) o MP4, MOV, MKV, WebM (vídeo) hasta 5 GB. En los vídeos se extrae la pista de audio automáticamente.
- 2
La IA detecta el idioma y sincroniza las cues
Whisper Large-v3 detecta el español (España y todas las variantes de Latinoamérica) automáticamente y produce marcas de tiempo a nivel de palabra. El procesamiento tarda entre un 20 y un 40 % de la duración del archivo.
- 3
Descarga SRT / VTT o incrusta
Exporta como SRT, VTT o TXT — o incrusta los subtítulos con tu propia tipografía, color, posición y efecto karaoke directamente en el vídeo (burn-in).
¿Qué formato de subtítulos para cada plataforma?
Cada plataforma trata los subtítulos de forma diferente. Instagram Reels y YouTube Shorts no aceptan archivos SRT sidecar en la subida nativa — ahí los subtítulos tienen que incrustarse directamente en el vídeo. Los vídeos largos y las plataformas de escritorio prefieren SRT.
| Plataforma | Formato de entrega | Nota |
|---|---|---|
| YouTube (Longform) | SRT | Subir en YouTube Studio → Subtítulos. VTT también es aceptado. |
| YouTube Shorts | Burn-in (incrustado) | Los SRT sidecar son recortados por la UI vertical — incrusta directamente en el vídeo para fiabilidad. |
| Instagram Reels | Burn-in | Instagram no acepta subida de SRT en Reels (help.instagram.com). Solo incrustado. |
| TikTok | Burn-in o base SRT | El editor de TikTok acepta un SRT base; la mayoría de creadores incrustan para controlar el estilo. |
| LinkedIn Video | SRT | Subida de SRT en el compositor de vídeo de LinkedIn. |
| Facebook Video | SRT | Subir vía Creator Studio → Subtítulos. |
| Vimeo | SRT o VTT | El reproductor de Vimeo soporta ambos; SRT es lo más sencillo. |
| Plataformas de podcast | TXT | TXT para notas del programa y transcripciones de episodios (Apple Podcasts, Spotify). |
| LMS corporativos | SRT o VTT | La mayoría de LMS (Cornerstone, Docebo, Canvas) aceptan ambos. VTT si necesitas posicionamiento. |
Verificado en agosto de 2026 con las páginas oficiales de ayuda de YouTube, Instagram, TikTok, LinkedIn y Vimeo.
Estilizar subtítulos incrustados (burn-in)
Cuando incrustas los subtítulos directamente en el vídeo (hardcoded subtitles), tienes control total sobre cada detalle visual. Ajustes típicos para Reels de redes sociales y YouTube Shorts:
- • Tipografía: Inter, Roboto, Montserrat o Impact (estilo broadcast). Fuentes personalizadas mediante subida.
- • Tamaño: 24-48 pt en fotograma vertical 1080×1920; 32-60 pt para estilos agresivos de redes sociales.
- • Color: texto blanco con contorno negro o color de marca con sombra para máxima legibilidad.
- • Posición: tercio inferior (estándar), centrado o tercio superior — para evitar los overlays de UI de TikTok/Reels.
- • Karaoke / palabra resaltada: se resalta la palabra que se está pronunciando — al estilo de los presets de CapCut y VEED.
- • Fondo: transparente, opaco o cápsula semitransparente detrás de cada cue.
Los subtítulos incrustados son especialmente útiles para vídeos verticales cortos (Reels, Shorts, TikTok), ya que más del 85 % de los usuarios ven sin sonido y las plataformas no aceptan subtítulos externos en esos formatos.
Cobertura de idiomas y precisión
VexaScribe usa OpenAI Whisper Large-v3, que cubre 99 idiomas. La precisión varía según el idioma y la calidad del audio. La siguiente tabla muestra la tasa de error de palabra (WER) en el benchmark FLEURS — cuanto más baja, mejor.
| Idioma | Whisper Large-v3 WER |
|---|---|
| Español (FLEURS) | ~4,5-5 % |
| Inglés | ~4,2 % |
| Portugués | ~5 % |
| Francés | ~4 % |
| Italiano | ~5 % |
| Alemán | ~4,5 % |
| Neerlandés | ~6 % |
| Polaco | ~6 % |
| Turco | ~7 % |
| Japonés | ~7 % |
| Chino (mandarín) | ~9 % |
| Árabe | ~8 % |
Fuente: Radford et al., Robust Speech Recognition via Large-Scale Weak Supervision, arXiv:2212.04356, Tabla 5. WER medido en los benchmarks FLEURS / CommonVoice. Las grabaciones reales con ruido de fondo, acentos marcados o terminología técnica muestran valores de WER más altos.
Editar los subtítulos (editor integrado)
Cada proyecto de subtitulado se abre en un editor con previsualización de vídeo sincronizada. Puedes:
- • Corregir palabras mal reconocidas con un clic — las marcas de tiempo se ajustan automáticamente.
- • Dividir o unir cues en los límites de palabra para mejorar la legibilidad.
- • Renombrar hablantes (p. ej., «Moderador», «Invitado 1») — las etiquetas se mantienen en el SRT exportado.
- • Ajustar la duración de cada cue para respetar pausas dramáticas o diálogos rápidos.
- • Insertar notación no verbal como [aplausos] o [música] para accesibilidad.
- • Reexportar como SRT, VTT, TXT o MP4 renderizado — sin recalcular la transcripción.
Subtítulos automáticos gratis vs planes de pago
Comparativa honesta de niveles gratuitos — qué incluye cada herramienta y qué tiene letra pequeña.
| Herramienta | Nivel gratis | Tarjeta | Formatos | Marca de agua | Notas |
|---|---|---|---|---|---|
| VexaScribe | 30 min gratis (una vez) | No | SRT / VTT / DOCX / TXT / JSON | No | Todos los formatos, sin marca de agua |
| Vizard | 60 min/mes | No | SRT / TXT | Sí | Marca de agua en versión free |
| VEED | 10 min/mes | No | SRT / VTT / burn-in | Sí | Editor de vídeo integrado |
| CapCut | Ilimitado (dentro del editor) | No | Burn-in / SRT | Opcional | Requiere usar su editor completo |
| FlexClip | 10 min/mes | No | SRT | Sí | Editor de vídeo básico integrado |
| HappyScribe | 10 min/mes | Sí para Pro | SRT / VTT / STL / DFXP | No | Hosting UE, planes desde 15 €/mes |
SRT vs VTT — cuál necesitas
SRT (SubRip Text)
Formato universal. YouTube, TikTok (via burn-in), Premiere, DaVinci, Final Cut, CapCut, VLC — todos aceptan SRT sin ajustes. Es la elección por defecto para creadores.
¿Qué es un archivo SRT? →VTT (WebVTT)
Estándar W3C para HTML5 web video (elemento <track>) y streaming HLS de Apple. Permite estilo CSS-like, posicionamiento y metadatos. Uso más técnico.
¿Qué es un archivo VTT? →VexaScribe exporta ambos formatos del mismo procesamiento — pagas los minutos una vez, descargas SRT + VTT + DOCX + TXT + JSON.
Idiomas soportados y traducción
99 idiomas source (Whisper Large-v3 soporta español, inglés, portugués, francés, alemán, italiano, japonés, mandarín, coreano, ruso, árabe, hindi, turco, vietnamita, polaco, holandés, entre otros) y traducción a 133 idiomas destino incluida en todos los planes de pago.
Flujo típico: transcribes tu vídeo en español, luego traduces el SRT al idioma destino (inglés para YouTube internacional, portugués para el mercado brasileño, francés para Francia+Canadá). La sincronización temporal se mantiene, listo para subir al mismo vídeo como track adicional.
Casos de uso frecuentes
Seis contextos donde los usuarios hispanohablantes generan subtítulos con VexaScribe.
Creadores de YouTube
SRT en español para vídeos largos + traducción a inglés/portugués para expandir audiencia. Indexación de subtítulos mejora el SEO.
Creadores de contenido social
Burn-in de subtítulos con CapCut para TikTok/Reels/Shorts. 85 % del contenido social se ve con el sonido apagado — los subtítulos multiplican el retention.
Educadores y cursos online
Subtítulos accesibles para vídeos de clases — cumplimiento WCAG básico, transcripción buscable para estudiantes.
Marketing y comunicación corporativa
Vídeos internos, webinars, presentaciones — subtítulos multiplican engagement en LinkedIn y cumplen requisitos de accesibilidad.
Podcasters con vídeo
Subtítulos para clips de podcast en YouTube + traducción para expandir a mercados hispanohablantes distintos.
Accesibilidad y WCAG
Subtítulos son requisito WCAG 2.1 Nivel A para vídeo pregrabado. Los subtítulos automáticos solos no cumplen; el SRT revisado sí.
Precios en euros y pesos mexicanos
Facturación en USD; conversión indicativa 1 $ ≈ 0,92 € (España) y 1 $ ≈ 17 MXN (México) — agosto 2026.
Starter
$2
≈ 1,85 € · 34 MXN
200 min/mes
Basic
$5
≈ 4,60 € · 85 MXN
1.000 min/mes
Pro
$10
≈ 9,20 € · 170 MXN
2.500 min/mes
Studio
$20
≈ 18,40 € · 340 MXN
6.000 min/mes
Cuándo elegir CapCut, Submagic o burn-in manual
CapCut — si necesitas editor de vídeo + subtítulos integrados
Si tu flujo es «editar vídeo + añadir subtítulos + publicar en TikTok/Reels» en una sola app, CapCut (gratis con marca de agua o Pro) integra ambos. VexaScribe es más flexible en exportación (SRT/VTT/DOCX/TXT/JSON) y en volumen, pero no incluye editor de vídeo.
Submagic — si haces Reels/TikTok con subtítulos animados
Si buscas subtítulos animados palabra-por-palabra con emojis, colores y presets estilizados para maximizar engagement en Reels/TikTok/Shorts, Submagic (~10 $/mes) está especializado. VexaScribe genera el SRT bruto; Submagic añade la estética visual sobre él.
Burn-in manual en Premiere/DaVinci — para control total
Si necesitas control fino de tipografía, posición, estilo y timing (documentales, cine, TV), importa el SRT de VexaScribe a Premiere Pro o DaVinci Resolve y trabaja los subtítulos con las herramientas nativas del NLE. VexaScribe reemplaza la fase de transcripción — no la de edición de vídeo.
Preguntas frecuentes
¿Cómo pongo subtítulos automáticos en un vídeo de YouTube?
Dos rutas. (1) Recomendada — sube tu SRT: entra en YouTube Studio → tu vídeo → Subtítulos → Añadir idioma → subir archivo → 'Con tiempos' → selecciona el .srt de VexaScribe → Publica. YouTube indexa el texto del SRT para búsqueda, lo que mejora el SEO frente a los subtítulos automáticos del propio YouTube. (2) Sube el MP4 a YouTube y usa sus subtítulos automáticos (10–30 min de espera, ~85 % de precisión, sin control de estilo). Para calidad publicable en español, la ruta (1) da mejor resultado en el mismo tiempo total.
¿Los subtítulos automáticos son realmente gratis?
Sí, pero cada herramienta tiene letra pequeña distinta. VexaScribe: 30 min gratis única vez, sin tarjeta, todos los formatos (SRT/VTT/DOCX/TXT/JSON) sin marca de agua. Competencia: Vizard 60 min/mes (marca de agua en versión free), VEED 10 min/mes con marca de agua, CapCut ilimitado si aceptas su editor, FlexClip 10 min/mes, HappyScribe 10 min/mes. Para un vídeo puntual corto, cualquiera funciona; para uso continuado, hay que pasar a pago (VexaScribe desde 2 $/mes, competencia desde 12–30 $/mes).
¿Qué precisión tienen los subtítulos en español?
El español es un idioma Tier 1 de Whisper Large-v3 con tasa de error de palabra (WER) del 4-6 % en el benchmark FLEURS de OpenAI — nivel casi comparable al inglés. En la práctica: 94-96 % en audio limpio de estudio o podcast, 90-94 % en Zoom/Teams/Meet, 92-95 % en vídeo móvil con micro cercano, 78-88 % con ruido de fondo. La sincronización temporal es precisa a ~200 ms — suficiente para lectura cómoda. Los nombres propios y términos técnicos tienen 20-30 % de error independiente de la calidad del audio; planifica una revisión de 5-15 min por hora de vídeo para calidad publicable.
¿SRT o VTT: cuál necesito?
SRT para casi todo: YouTube, TikTok (via burn-in), Premiere, DaVinci, Final Cut, CapCut, VLC — SRT es el formato universal. VTT específicamente para HTML5 web video con el elemento <track>, streaming HLS de Apple, o si necesitas control de estilo CSS-like (posición, tamaño, color). VexaScribe exporta ambos formatos del mismo procesamiento — pagas los minutos una vez, descargas SRT + VTT + TXT + DOCX + JSON. Más detalles en /what-is-an-srt-file y /what-is-a-vtt-file.
¿Funciona con vídeos de TikTok, Reels o Shorts?
Sí, con matices por plataforma. TikTok no acepta subida de SRT directamente — necesitas burn-in (subtítulos incrustados en el vídeo) con un editor como CapCut, DaVinci o Premiere. Instagram Reels tiene su propio generador in-app de subtítulos automáticos (calidad decente), o puedes usar SRT externo burn-in. YouTube Shorts acepta SRT via YouTube Studio igual que vídeos normales. Para creadores en varias plataformas, VexaScribe genera un SRT y tú lo usas para burn-in (TikTok/Reels) y upload directo (YouTube/YouTube Shorts).
¿Puedo traducir los subtítulos a otro idioma?
Sí. VexaScribe soporta traducción a 133 idiomas destino incluida en todos los planes de pago. Flujo: transcribe el vídeo en el idioma origen (español), luego traduce el SRT al idioma destino (inglés, portugués, francés, alemán, etc.) manteniendo la sincronización temporal. Ideal para creadores que sirven mercados multi-idioma — un solo procesamiento produce un SRT en español + traducciones listas para subir. La calidad de traducción de SRT es sensiblemente mejor que la de subtítulos automáticos in-platform de YouTube/TikTok.
¿Cuánto tarda en generar subtítulos de un vídeo de 30 minutos?
3–8 minutos de procesamiento — Whisper Large-v3 corre a 4–10× tiempo real dependiendo de la carga. Ejemplos: vídeo de 30 min → 3–8 min; vídeo de 1 hora → 6–15 min; vídeo de 2 horas → 12–30 min. Añade 5–15 min de revisión manual para calidad publicable (nombres propios, términos técnicos, ajustes de segmentación). Alternativa humana (Rev): 12–48 horas de plazo con coste 90–300 $ por hora de vídeo — casi nunca se justifica salvo verbatim legal.
¿Se puede editar el texto de los subtítulos después?
Sí. VexaScribe incluye editor in-browser para corregir el texto, ajustar la segmentación (dividir/unir cues), renombrar hablantes y ajustar timings antes de exportar. Los cambios se guardan y puedes re-exportar SRT/VTT/DOCX/TXT/JSON las veces que quieras sin re-procesar. Para edición avanzada de subtítulos (efectos ASS, karaoke, posicionamiento fino), Subtitle Edit (Windows, gratis) y Aegisub (multiplataforma, gratis) son los estándares — ambos importan y exportan SRT/VTT.
¿Puedo subir directamente un MP4 o necesito extraer el audio?
Sube el MP4 directamente. VexaScribe extrae la pista de audio automáticamente — sin conversión previa. Acepta MP4, MOV, MKV, WebM, AVI, FLV, WMV, M4V, 3GP en el lado vídeo; MP3, M4A, WAV, OPUS, FLAC, AAC en el lado audio. También puedes pegar una URL de YouTube, TikTok, Instagram o Google Drive y VexaScribe descarga el vídeo del lado servidor sin que tengas que hacer nada. Sin ffmpeg, sin conversiones intermedias, sin instalación local.
¿Es mejor este generador o CapCut / Submagic / VEED?
Depende del flujo de trabajo. VexaScribe si buscas transcripción + exportación multiformato (SRT/VTT/DOCX/TXT/JSON), 99 idiomas source + 133 target para traducciones, hosting UE con RGPD, procesamiento por lotes (50 archivos), al mejor precio (2 $/mes). CapCut si necesitas editor de vídeo completo integrado y subtítulos como parte del flujo de edición (gratis con marca de agua o Pro). Submagic si haces Reels/TikTok con subtítulos animados palabra-por-palabra y presets estilizados (~10 $/mes, sin transcripción bruta). VEED si quieres editor + generador en la misma app (13-24 $/mes). Para pipeline de generación pura con máxima flexibilidad de exportación y precio, VexaScribe.
¿Cómo se dimensionan las cues de subtítulos? ¿Son legibles en pantalla?
VexaScribe procesa cada exportación de subtítulos mediante un algoritmo de división de cues a nivel de palabra. Las cues están limitadas a aproximadamente 80 caracteres y 5 segundos (límite máximo de 10 segundos) — coincidiendo con el rango de subtítulos web legibles usado por Descript, Sonix y Vimeo, y con los estándares de la industria BBC y Netflix. Las divisiones prefieren primero los límites de oración, luego las comas, luego los límites de palabra. Las etiquetas de hablante se preservan en cada división. Los archivos se importan limpiamente en YouTube, Premiere Pro, Final Cut Pro, DaVinci Resolve y VLC sin limpieza manual.
¿Los subtítulos se mantienen sincronizados con el habla real?
Sí. VexaScribe usa marcas de tiempo reales a nivel de palabra del motor de transcripción — los tiempos de inicio y fin de las cues caen sobre límites de palabra reales, no sobre aproximaciones interpoladas a lo largo de un segmento largo. Las pausas dramáticas en el habla (charlas motivacionales, audiolibros) se preservan: la cue permanece en pantalla durante el silencio en lugar de producir un parpadeo de menos de un segundo seguido de pantalla en blanco. La precisión de sincronización es de ~200 ms típicamente.
Recursos relacionados
MP4 a Texto
Para transcripción de vídeo MP4 en formato texto (no subtítulos SRT).
MP3 a Texto
Para transcripción de audio MP3 puro (podcasts, entrevistas).
Vídeo a Texto
Cualquier formato de vídeo (MP4, MOV, MKV, WEBM) a texto.
Transcripción de YouTube
Pega la URL, obtén la transcripción en TXT/SRT/VTT en segundos.
Precios
Todos los planes en detalle, con equivalencias en euros y pesos.
SRT Generator (English)
Same product with English-language content and international context.
VexaScribe usa OpenAI Whisper Large-v3 para el reconocimiento de voz. En el benchmark FLEURS, el modelo alcanza aproximadamente un 5 % de tasa de error de palabra para el español (Radford et al., «Robust Speech Recognition via Large-Scale Weak Supervision», arXiv:2212.04356, Tabla 5). La precisión real depende de la calidad del audio, el número de hablantes, los acentos y la terminología técnica. «OpenAI» y «Whisper» son marcas de sus respectivos propietarios. YouTube, TikTok, Instagram, LinkedIn, Vimeo, Premiere Pro, Final Cut Pro y DaVinci Resolve son marcas de sus respectivos titulares — no existe ninguna relación comercial con VexaScribe.