Verificado em junho de 2026
Transcrever vídeo em texto
Transcrição IA para vídeos em português brasileiro — a forma mais rápida de extrair texto de vídeo sem usar ferramentas de edição. Para criadores YouTube, professores EAD, jornalistas, advogados, igrejas e equipes corporativas. Whisper Large-v3, precisão Tier 1 (~93-95%), extração automática de áudio, exportação de legendas SRT/VTT, tradução para 133 idiomas.
VexaScribe transcreve seus vídeos em português brasileiro — MP4, MOV, MKV, WebM, AVI, FLV, WMV até 5 GB e 10 horas por arquivo. O áudio é extraído automaticamente da pista de vídeo — sem ffmpeg, sem HandBrake, sem conversão manual. Tempo de processamento: 5-10 minutos por hora de vídeo, com 93-95% de precisão em áudio limpo, identificação automática de locutores e timestamps ao nível da palavra. Exportação para TXT, DOCX, SRT, VTT ou JSON. Tradução integrada para 133 idiomas — crie legendas multilíngues para YouTube sem serviços externos. Dados armazenados em AWS eu-west-2 (Londres) — conforme LGPD, sem treinamento de IA com seus arquivos. 30 minutos grátis na inscrição, sem cartão.
O essencial
- ●Todos os formatos de vídeo aceitos. MP4 (universal), MOV (iPhone — dominante no Brasil), MKV (archive HD), WebM (OBS), AVI, FLV, WMV. Limite 5 GB e 10 horas.
- ●Sem extração manual de áudio. O áudio é extraído automaticamente da pista de vídeo no servidor — sem ffmpeg, sem HandBrake.
- ●Precisão Tier 1 em PT-BR: ~93-95% em áudio limpo. Comparável ao inglês. Estúdio com microfone lavalier atinge 95-97%.
- ●5-10 minutos de processamento por 1 hora de vídeo — vs ~6h em transcrição humana manual.
- ●Exportação SRT/VTT direta. Importe legendas em Premiere Pro, DaVinci Resolve, Final Cut, CapCut, ou envie no YouTube/Vimeo.
- ●Tradução para 133 idiomas. Crie legendas multilíngues sem serviço externo — perfeito para criadores brasileiros buscando audiência internacional.
- ●Hospedagem AWS eu-west-2 (Londres), conforme LGPD. Sem treinamento de IA com seus vídeos. Crucial para uso jurídico, jornalístico e RH.
Como transcrever vídeo (3 passos)
Fluxo idêntico para qualquer formato (MP4, MOV, MKV…) ou fonte (câmera, smartphone, captura de tela, exportação YouTube/Zoom).
- 1
Upload do vídeo
Arraste seu arquivo de vídeo. Aceitos: MP4, MOV, MKV, WebM, AVI, FLV, WMV. Limite 5 GB e 10 horas. Para vídeos maiores: comprimir em MP4 H.264 1080p (HandBrake gratuito) ou dividir em segmentos.
- 2
IA extrai áudio e transcreve
O áudio é extraído automaticamente da pista de vídeo, depois processado por Whisper Large-v3. Vídeo de 1 hora é transcrito em 5-10 minutos com etiquetas de locutores e timestamps ao nível da palavra. Detecção automática de PT-BR (Brasil) vs PT-PT (Portugal).
- 3
Editar e exportar
Renomeie locutores, corrija nomes próprios e jargão técnico no editor integrado. Traduza para idioma de destino se necessário. Exporte SRT (legendas YouTube/Premiere), VTT (web HTML5), DOCX (Word), TXT (texto simples) ou JSON (dados estruturados).
Formatos de vídeo aceitos
VexaScribe aceita todos os formatos de vídeo comuns nativamente. MP4 é o mais universal (saída padrão YouTube, smartphones Android, OBS Studio), mas MOV (Apple, dominante no Brasil) e MKV (HD de alta qualidade) também são processados sem conversão prévia.
| Formato | Uso típico | Tamanho médio (1h) | Precisão PT-BR |
|---|---|---|---|
| MP4 | YouTube, Zoom/Meet/Teams, CapCut, Android, mais universal | 200-800 MB / hora | 92-95% |
| MOV | iPhone (dominante no Brasil), Final Cut, jornalismo móvel | 500 MB - 2 GB / hora | 93-96% |
| MKV | Archive HD, OBS Studio streamers e gamers | 1-4 GB / hora | 93-95% |
| WebM | OBS Studio, Loom downloads, gravações de browser | 200-600 MB / hora | 90-94% |
| AVI | Legacy Windows, EAD antigo, arquivos corporativos | 1-3 GB / hora | 89-93% |
| WMV | Windows Media Player, capturas PowerPoint legacy | 300-800 MB / hora | 88-92% |
| FLV | Vídeos Flash antigos (2005-2015) | 100-400 MB / hora | 85-90% |
Para arquivos de áudio puros (MP3, M4A, WAV, OGG), ver transcrever áudio em texto.
Extração automática de áudio (sem ffmpeg)
Você faz upload do arquivo de vídeo no formato original. Sem pré-processamento, sem conversão ffmpeg, sem HandBrake. O pipeline no servidor cuida da extração.
Pipeline técnico em 4 etapas
- 1.Decodificação do container de vídeo — leitura do MP4/MOV/MKV via ffmpeg no servidor. Nenhuma ação do usuário.
- 2.Extração da pista de áudio — separação da pista de áudio da pista de vídeo. Se múltiplas pistas existem (comentário + áudio original), a primeira é usada por padrão.
- 3.Resampling para 16 kHz mono — conversão à resolução Whisper padrão. A qualidade bruta do áudio é suficiente porque Whisper foi treinado em áudios 16 kHz.
- 4.Transcrição Whisper Large-v3 — modelo Transformer encoder-decoder, detecção automática de PT-BR, geração de tokens textuais com timestamps.
Você não paga tempo nem minutos adicionais pela extração de áudio — está incluso no tempo total de transcrição (5-10 min para 1 h de vídeo).
Precisão por sotaque do português
Português brasileiro está em Tier 1 do Whisper Large-v3, com precisão comparável ao inglês. A precisão real do vídeo depende mais da qualidade do microfone usado na gravação do que do formato vídeo em si.
| Sotaque | Precisão | Notas |
|---|---|---|
| Paulista (São Paulo) | 94-96% | Mais coberto no treinamento Whisper |
| Carioca (Rio de Janeiro) | 93-95% | Bem coberto, 'chiado' tratado corretamente |
| Sulista (RS, SC, PR) | 92-95% | Bem coberto, marcas regionais OK |
| Mineiro (Minas Gerais) | 92-94% | Algumas elisões podem reduzir precisão |
| Nordestino / Baiano | 88-92% | Revisão extra recomendada |
Nomes próprios (marcas, pessoas, lugares) e jargão técnico podem ter 20-30% de erro mesmo em áudio limpo — corrija no editor antes da exportação.
Casos de uso brasileiros
Seis famílias de uso típico de transcrição vídeo IA no Brasil, cada uma com workflows próprios.
Podcaster brasileiro com versão YouTube
Episódios semanais, multi-convidados, formato vídeo+áudio (Flow, PodPah, Inteligência Ltda style)Workflow: gravação multi-câmera + multi-pista (Riverside, SquadCast) → exportar MP4 → transcrição com diarização identifica cada convidado → exportar TXT para show notes do site (vantagem SEO: Google indexa) + SRT para legendas no YouTube. Vantagem indexação YouTube: legendas enviadas manualmente (vs auto-captions) são indexadas no algoritmo de busca, aumentando alcance orgânico em 20-40%.
Professor / criadora EAD
Cursos Hotmart, Eduzz, Kiwify, Coursify — aulas gravadas em vídeoWorkflow: captação de aula → MP4 → transcrição → exportar DOCX para apostila do curso + SRT para legendas de acessibilidade. Acessibilidade é exigência crescente no Brasil — Lei Brasileira de Inclusão (Lei 13.146/2015) e LBI fundamentam reclamações contra cursos sem legendas. Adicionar legendas eleva taxa de conclusão e nota dos alunos.
Jornalista de TV / repórter
Reportagens filmadas, entrevistas em campo, coletivas de imprensaWorkflow: gravação móvel (câmera ENG ou iPhone) → MP4/MOV → transcrição rápida para redação + extração de citações. Para proteção de fontes: hospedagem em AWS eu-west-2 (Londres, UE), sem treinamento de IA com áudios — diferencial vs Otter, hospedado nos EUA. Alinhamento com política editorial de jornalismo investigativo brasileiro.
Advogado
Audiências filmadas (CPC autoriza), depoimentos por videoconferência (CNJ Res 354/2020), provas em vídeoWorkflow: gravação de audiência via Zoom/Teams (com autorização) → MP4 → transcrição para análise preparatória → exportar DOCX para dossier do processo. LGPD-friendly: hospedagem UE, DPA disponível, sem reutilização. Para verbatim com valor processual probatório (sentenças, recursos), ainda recomenda-se transcritor humano juramentado para versão certificada — VexaScribe é adequado para análise preparatória estratégica.
Líder religioso / Igreja
Cultos transmitidos ao vivo, sermões para arquivamento, conferênciasIgrejas brasileiras (católicas, evangélicas, espíritas) têm forte presença online — transmissões semanais via YouTube/Facebook geram volume grande de conteúdo. Workflow: transmissão gravada → MP4 → transcrição → exportar TXT para devocional escrito + SRT para legendas de acessibilidade (importante para fiéis surdos/com deficiência auditiva).
Corporativo / RH / Treinamento
Treinamentos gravados, all-hands, onboarding, entrevistas estruturadas filmadasWorkflow: gravação via Teams/Meet/Zoom → MP4 → transcrição → arquivamento controlado em pasta corporativa. Para entrevistas de candidatos com consentimento (LGPD Art. 7º): análise comparativa estruturada usando exportação JSON com speaker_id + timestamps. Hospedagem UE é essencial para conformidade com LGPD em dados pessoais de funcionários.
Geração de legendas SRT e VTT
Dois formatos de exportação de legendas conforme seu destino de publicação.
Formato SRT (SubRip)
Formato universal — aceito pelo YouTube, Vimeo, Adobe Premiere Pro, DaVinci Resolve, Final Cut Pro, CapCut, OBS Studio, VLC. É o formato a usar por padrão em 95% dos casos.
Ideal para: YouTube, edição de vídeo, archive
Formato VTT (WebVTT)
Formato para lecteurs de vídeo HTML5 em sites personalizados. Integração via tag <track kind="subtitles" src="x.vtt"> dentro de <video>.
Ideal para: integração em sites, players JS personalizados
Vantagem SEO no YouTube
Legendas enviadas manualmente (.srt) são indexadas no algoritmo de busca do YouTube, diferente das legendas automáticas geradas pelo próprio YouTube. Um vídeo com SRT bem feito pode aparecer nos resultados de busca para termos mencionados no áudio, mesmo sem aparecer no título ou descrição. Aumento típico de visualizações orgânicas: 20-40%.
Para sub-titles em vários idiomas, traduza no editor VexaScribe (133 idiomas de destino) e exporte um SRT por idioma — timestamps preservados idênticos. Faça upload de cada SRT no YouTube Studio como pista de idioma separada.
LGPD para conteúdo audiovisual
Vídeo é uma das formas mais sensíveis de dado pessoal — combina voz, imagem (identificação visual) e conteúdo. A LGPD (Lei 13.709/2018) trata todos esses elementos. Pontos críticos para uso profissional:
Depoimentos jurídicos filmados
CNJ Resolução 354/2020 regulamenta audiências por videoconferência. O CPC permite gravação com autorização das partes. Workflow LGPD-friendly: consentimento explícito por escrito do depoente → processamento em provedor com localização e DPA conhecidos (VexaScribe: AWS eu-west-2 Londres) → exclusão após uso. VexaScribe oferece DPA específico para uso jurídico.
Telemedicina e telesaúde
Consultas por videoconferência regulamentadas pelo CFM Resolução 2.314/2022. Gravação requer consentimento expresso (Art. 11 LGPD para dados sensíveis de saúde). VexaScribe armazena criptografado AES-256, sem treinamento de IA, com possibilidade de exclusão imediata. Recomendação: usar exclusivamente para uso interno da consulta, não compartilhar transcrições com terceiros sem consentimento adicional.
RH e entrevistas de candidatos
Gravação de entrevistas de processo seletivo requer consentimento explícito do candidato (Art. 7º LGPD). Workflow: aviso prévio + consentimento por escrito → gravação → transcrição com diarização → arquivamento controlado → exclusão após decisão de contratação ou prazo legal (geralmente 5 anos para fins trabalhistas e fiscais).
Jornalismo e proteção de fontes
Para entrevistas com fontes confidenciais, alinhe a escolha do provedor à política editorial — verifique a localização dos dados (Otter, Sonix e Trint hospedam nos EUA; VexaScribe em AWS eu-west-2 Londres; Happy Scribe em Barcelona; VozParaTexto no Brasil). VexaScribe não treina IA com dados de usuários — compromisso explícito para jornalismo investigativo.
Ver também política de privacidade e termos de uso para os compromissos completos.
Comparativo dos serviços
Oito principais ferramentas de transcrição de vídeo usadas no Brasil. Critérios que importam: qualidade em PT-BR, extração automática de áudio, plano gratuito, preço efetivo, conformidade LGPD.
| Ferramenta | PT-BR | Extração áudio | Plano grátis | Preço | Formatos | LGPD |
|---|---|---|---|---|---|---|
| VexaScribe | ✅ Whisper Large-v3 | ✅ Auto | 30 min único | US$ 2-20/mês (~R$ 11-110) | MP4, MOV, MKV, WebM, AVI, FLV, WMV | ✅ |
| VEED.io | ✅ Localizado | ✅ Auto | Bloqueia downloads | ~US$ 24/mês Pro | MP4, MOV, M4V, WEBM, AVI, GIF | ❌ |
| VozParaTexto | ✅ Nativo BR | ✅ Auto | 30 min/mês | R$ 19,90-149,90/mês | 15+ formatos | ✅ Local |
| Sintesy | ✅ Nativo BR | ✅ Auto | 1h/dia | R$ 12,49-39,90/mês | MP4 + outros | ✅ Local |
| CapCut | ✅ | ✅ Auto | Grátis com marca d'água | Free / Pro variável | MP4 principal | ❌ USA |
| Notta | Parcial | ✅ Auto | 3 min/gravação | ~US$ 13,99/mês | MP4 | ❌ |
| Vidnoz BR | ✅ pt.vidnoz.com | ✅ Auto | Até 500 MB | Free / Pago | MP4, MOV, M4V, WebM | ❌ |
| Sonix | ✅ | ✅ Auto | 30 min sem cartão | US$ 5/hora PAYG | MP4 | ❌ |
Preços verificados em junho de 2026 nos sites oficiais. VozParaTexto e Sintesy são serviços brasileiros com preço em reais (vantagem para usuários que evitam câmbio). CapCut grátis é prático mas adiciona marca d'água no plano gratuito.
Preços e estimativa em reais
Planos VexaScribe com equivalência em volumes de vídeo transcrito. Cálculo baseado em vídeos de 1 hora em média. Cotação de referência: 1 USD ≈ R$ 5,50.
| Plano | ≈ Reais | Minutos/mês | ≈ Vídeos de 1h | Para quem |
|---|---|---|---|---|
| Teste grátis | R$ 0 | 30 min único | 1 vídeo de 30 min | Testar antes de assinar |
| Starter | ~R$ 11/mês | 200 min/mês | 3 vídeos de 1h | Criador ocasional, freelancer |
| Basic | ~R$ 28/mês | 1 000 min/mês | 16 vídeos de 1h | Criador regular, professor EAD |
| Pro | ~R$ 55/mês | 2 500 min/mês | 41 vídeos de 1h | Canal YouTube ativo, EAD, comunicação corporativa |
| Studio | ~R$ 110/mês | 6 000 min/mês | 100 vídeos de 1h | Estúdio de produção, redação, escola online |
Cobrança real em USD via cartão internacional — valores em reais são aproximados. Plano Pro: ~R$ 1,30 por vídeo de 1 hora transcrito. Ver detalhes completos em planos VexaScribe.
Perguntas frequentes
Como transcrever vídeo MP4 em texto gratuitamente?
VexaScribe oferece 30 minutos grátis na inscrição, sem cartão de crédito — qualidade Whisper Large-v3 completa, todos os formatos de exportação. Fluxo: arraste seu MP4 (ou MOV, MKV, WebM, AVI) na interface, a IA extrai o áudio automaticamente e transcreve em 5-10 minutos por hora. Para uso recorrente gratuito: TurboScribe (3 arquivos de até 30 min por dia), Vidnoz BR (até 500 MB por arquivo), CapCut (sub-titulos automáticos com marca d'água no plano grátis). Para qualidade máxima em PT-BR (~93-95% precisão), o VexaScribe Whisper Large-v3 é superior aos serviços gratuitos básicos que geralmente atingem 88-92%.
É possível transcrever vídeo MOV gravado no iPhone?
Sim, MOV é totalmente suportado pela VexaScribe sem conversão prévia. iPhone é dominante na classe média alta brasileira e jornalistas usam câmeras de iPhone para reportagens — vídeos MOV são comuns. Workflow: gravação no iPhone (Câmera ou app Filmadora) → exportar via Compartilhar → Salvar em Arquivos (ou AirDrop para Mac) → upload no VexaScribe → transcrição em 5-10 minutos por hora. A IA extrai automaticamente o áudio da pista MOV, sem necessidade de QuickTime ou ferramentas de conversão. Limite de 5 GB e 10 horas por arquivo cobre essencialmente todos os usos práticos.
Preciso extrair o áudio do vídeo antes de fazer upload?
Não. VexaScribe extrai o áudio automaticamente do arquivo de vídeo no servidor — você faz upload do MP4, MOV, MKV ou WebM diretamente, sem precisar de ffmpeg, HandBrake ou qualquer ferramenta de conversão. Pipeline interno: decodificação do container de vídeo → extração da pista de áudio → resampling para 16 kHz mono (resolução padrão Whisper) → transcrição. Esse é um diferencial real vs concorrentes que exigem extração manual ou que cobram conversão como funcionalidade premium. Você economiza tempo e evita aprender ferramentas de edição vídeo só para transcrever.
Qual a precisão para vídeos gravados em Zoom, Teams ou Google Meet?
Precisão variável conforme as condições. Reunião profissional com microfones individuais (headset ou Lapel USB): 92-95% em PT-BR. Reunião com microfone integrado do laptop em sala silenciosa: 88-92%. Reunião com múltiplos participantes compartilhando microfone em sala ruidosa: 80-87%. Os três serviços (Zoom, Teams, Meet) exportam vídeo em MP4 com áudio de qualidade aceitável para transcrição. Para máxima precisão, oriente participantes a usar headset e silenciar o microfone quando não estiverem falando — isso eleva a precisão em 5-10 pontos. A diarização do VexaScribe identifica automaticamente quem está falando (até 10 vozes distintas), permitindo gerar atas de reunião estruturadas.
Como gerar legendas SRT a partir de um vídeo?
Workflow VexaScribe: upload do vídeo (MP4, MOV, MKV) → transcrição automática com timestamps ao nível da palavra → no editor, clicar em Exportar → SRT → download do arquivo .srt. O SRT gerado segue formato padrão (HH:MM:SS,mmm) compatível com YouTube, Vimeo, Adobe Premiere Pro, DaVinci Resolve, Final Cut Pro X, CapCut, OBS Studio, VLC. Para vídeo no YouTube: faça upload do SRT em YouTube Studio → Legendas → Adicionar idioma → Importar arquivo (vantagem SEO: YouTube indexa o conteúdo das legendas enviadas manualmente, diferente das legendas automáticas). Para multi-idioma: traduza no VexaScribe e exporte um SRT por idioma — timestamps preservados.
Quanto custa transcrever 1 hora de vídeo em reais?
No plano Pro VexaScribe (US$ 10/mês, ~R$ 55/mês, 2 500 minutos incluídos): aproximadamente R$ 1,30 por hora de vídeo transcrita. Plano Starter (US$ 2/mês, ~R$ 11): cobre 3 vídeos de 1 hora por mês. Plano Basic (US$ 5/mês, ~R$ 28): cobre 16 vídeos. Para comparação: transcritor humano profissional brasileiro cobra R$ 300-900 por hora de vídeo transcrita. VexaScribe é 200-700× mais barato e mais rápido (5-10 min vs 4-6h). Equivalência aproximada — cobrança real em USD via cartão internacional. VozParaTexto (R$ 19,90-149,90/mês) e Sintesy (R$ 39,90/mês com Pix) são serviços brasileiros com cobrança direta em reais.
Posso transcrever vídeo de mais de 5 GB?
Limite por arquivo é 5 GB e 10 horas. Para vídeos maiores: (1) Comprimir em MP4 H.264 1080p com bitrate moderado (5-8 Mbps) — uma aula de 4 horas em 1080p geralmente fica em 3-4 GB após compressão padrão YouTube. HandBrake (gratuito) faz isso em alguns minutos. (2) Dividir o vídeo em segmentos menores com qualquer editor de vídeo — útil para vídeos extremamente longos (cursos completos de EAD com 8+ horas). Para 99% dos casos práticos (entrevistas, podcasts, aulas, reuniões), os limites cobrem confortavelmente. Vídeo de 2 horas em MP4 1080p geralmente fica em 1-2 GB.
Como transcrever depoimento jurídico filmado conforme a LGPD?
O CNJ (Resolução 354/2020) regulamenta audiências por videoconferência, e o CPC permite gravação de depoimentos com autorização. Workflow LGPD-friendly: (1) Obter consentimento explícito por escrito do depoente (Art. 7º LGPD). (2) Gravar e fazer upload em VexaScribe — hospedagem AWS eu-west-2 (Londres), conforme decisão de adequação UE, criptografia TLS 1.2+ e AES-256. (3) Transcrição com diarização — identifica advogado, depoente, juiz separadamente. (4) Exportar DOCX para o dossier do processo, com timestamps que servem como referência para a gravação original. (5) Excluir do servidor após uso (Art. 18, VI LGPD). Importante: para verbatim com valor processual probatório, ainda é recomendado transcritor humano juramentado — VexaScribe é adequado para análise preparatória.
Whisper Large-v3 reconhece sotaques regionais brasileiros?
Sim, com variação por região. Whisper Large-v3 foi treinado em ~5 milhões de horas de áudio multilíngue incluindo corpus PT-BR substancial. Precisões típicas em áudio limpo: paulista 94-96%, carioca 93-95%, sulista 92-95%, mineiro 92-94%, nordestino/baiano 88-92%. O sotaque tem menos peso que a qualidade do microfone — um nordestino gravado em estúdio com microfone profissional será transcrito melhor que um paulistano gravado no celular em ambiente ruidoso. Vocabulário regional bem coberto: 'mainha', 'oxe', 'véi', 'pô', 'meu', 'cabra', 'arretado' etc. Gírias muito recentes (TikTok, Twitch) podem gerar erros pontuais — corrigíveis no editor antes da exportação.
Como traduzir transcrição de vídeo para legendas multilíngues?
Workflow VexaScribe: upload do vídeo PT-BR → transcrição → no editor, clicar Traduzir → escolher idioma de destino (133 disponíveis) → exportar SRT do idioma destino. Timestamps preservados idênticos entre versões. Caso de uso típico para criadores brasileiros: gerar legendas em inglês, espanhol e francês para alcançar audiência internacional no YouTube. Workflow: 1 vídeo PT-BR → 4 arquivos SRT (PT, EN, ES, FR) — cada um faz upload separado em YouTube Studio como pista de idioma diferente. O viewer escolhe seu idioma no player. Tradução incluída em todos os planos pagos, sem cobrança por caractere ou por idioma — diferencial vs serviços que cobram tradução separada (DeepL Pro €5,49/mês, Google Translate API ~US$ 20 por milhão de caracteres).
Como extrair texto de vídeo automaticamente?
Extrair texto de vídeo é o mesmo que transcrever o vídeo — a IA escuta o áudio falado no vídeo e produz o texto correspondente. Workflow VexaScribe: upload do MP4 (ou MOV, MKV, WebM, AVI) → a IA extrai o áudio do container de vídeo automaticamente (sem ffmpeg ou ferramenta de conversão) → Whisper Large-v3 transcreve o áudio em PT-BR com precisão ~93-95% → você recebe o texto completo com timestamps em ~5-10 minutos por hora de vídeo. Exporta em TXT (texto puro), DOCX (Word), SRT (legendas) ou JSON (dados estruturados). É o caminho mais rápido para tirar texto de um vídeo sem precisar de QuickTime, HandBrake ou qualquer software de edição. Aceita arquivos até 5 GB e 10 horas — cobre desde Reels curtos até aulas de EAD completas.
Metodologia e fontes
Os números de precisão em PT-BR (~93-95% em áudio limpo, Tier 1) provêm de (1) artigo técnico Whisper da OpenAI (Radford et al., setembro de 2023), (2) benchmark Distil-Whisper Large-v3 PT-BR no Hugging Face (8,22% Word Error Rate em Common Voice Brasil), e (3) testes internos VexaScribe em 30 vídeos PT-BR padronizados (10 podcasts vídeo, 10 aulas EAD, 10 reuniões Zoom).
Os tamanhos de arquivo indicativos (200 MB a 4 GB por hora segundo formato e resolução) refletem codificações padrão: MP4 H.264 a 5-8 Mbps para 1080p, MKV não comprimido a 15-25 Mbps para HD. Verifique configurações do seu encoder se aproximar do limite de 5 GB.
Os critérios LGPD referenciados são baseados na Lei 13.709/2018, nas Resoluções CNJ 354/2020 (audiências por videoconferência) e CFM 2.314/2022 (telemedicina), e nas orientações publicadas pela ANPD em anpd.gov.br. A transferência internacional para a UE é admitida via garantias contratuais (Art. 33, II) — DPA disponível mediante solicitação.
Preços concorrentes (VEED ~US$ 24/mês, Notta ~US$ 13,99/mês, Sonix US$ 5/hora PAYG, CapCut Pro variável, Vidnoz Pago, VozParaTexto R$ 19,90-149,90/mês, Sintesy R$ 12,49-39,90/mês) refletem preços públicos publicados em junho de 2026. Verifique antes de assinar.
VexaScribe é o produto descrito. Comparações com outros serviços visam ajudar criadores, professores e profissionais brasileiros a escolher a ferramenta adequada, não denegrir a concorrência. Para o processo editorial completo ver padrões editoriais.
Teste no seu próximo vídeo
30 minutos de transcrição vídeo grátis. Sem cartão de crédito. Todos os formatos aceitos (MP4, MOV, MKV, WebM, AVI). Dados em servidor europeu (Londres), sem treinamento de IA com seus vídeos.
Guias relacionados
Transcrever áudio em texto
Para arquivos de áudio puros (MP3, M4A, WAV)
Transcrever áudio do WhatsApp
Quando o recurso nativo não basta — guia 2026
Gerador de legendas
SRT/VTT direto — YouTube SEO, Premiere, DaVinci, CapCut
Transcrição do YouTube
Cole a URL do YouTube e baixe TXT, SRT, VTT em segundos
Legendas automáticas
SRT/VTT prontos para YouTube, Premiere e DaVinci
Converter MP3 para texto
Para áudios extraídos de vídeo em MP3 ou M4A
Transcrever entrevista
Entrevistas filmadas, depoimentos por vídeo, jornalismo
Transcrição com IA
Whisper Large-v3 explicado para PT-BR
Transcrição gratuita
Comparação honesta de 8 ferramentas free
Transcrever e traduzir áudio
Texto e legendas em 80+ idiomas — sem dublagem IA
Planos VexaScribe
Preços detalhados com equivalência em reais
Funcionalidades
Todas as funcionalidades em português
Sobre nós
Equipe, missão e compromissos editoriais
Blog
Guias e dicas de transcrição em português
Video to transcript (English)
Versão em inglês desta página