Verificado em agosto de 2026
O que é transcrição? Definição, significado, tipos e exemplos
Guia direto sobre o que é transcrição em português brasileiro: definição, os quatro tipos (literal, corrigida, adaptada, fonética), exemplos reais, para que serve, diferença entre transcrição e legenda, e um glossário de 12 termos técnicos.
Antes de detalhar cada seção, a resposta rápida em um parágrafo. Transcrição é a conversão de fala (áudio ou vídeo) em texto escrito. Existem quatro tipos principais: literal (palavra por palavra, incluindo pausas), corrigida (limpa erros gramaticais), adaptada (reformula para leitura) e fonética (IPA, uso linguístico). Em 2026, é feita por IA (Whisper Large-v3, 93-95% em português) em minutos ou manualmente por profissionais. As seções seguintes aprofundam cada ponto com exemplos, tabelas comparativas e um glossário técnico.
O que é transcrição? — definição direta
Transcrição é a conversão de fala em texto escrito. O processo pega o áudio de uma pessoa falando — em uma entrevista, aula, reunião, podcast ou vídeo — e produz um documento textual que reproduz o que foi dito. O resultado pode ser um TXT simples, um DOCX formatado, uma legenda SRT com timestamps ou um JSON com metadados de falantes.
Em uso profissional, transcrição sempre envolve três decisões: (1) quanto fidelidade à fala original — literal, corrigida ou adaptada; (2) quanto detalhe estrutural — timestamps por palavra, por frase, por parágrafo, ou nenhum; (3) quem faz — um transcritor humano especializado ou um sistema de inteligência artificial baseado em ASR (reconhecimento automático de fala).
No Brasil, a área jurídica ainda usa muito o sinônimo degravação para se referir à transcrição de audiências e depoimentos gravados. O sentido é o mesmo — converter fala gravada em texto — mas o termo carrega a expectativa de fé pública processual quando exigido por juiz.
O que é transcrever? — o verbo e sua etimologia
Transcrever é o verbo correspondente ao substantivo transcrição — significa passar algo para outra forma escrita. A palavra vem do latim transcribere, formado por trans- (“através”, “de um lado para outro”) + scribere (“escrever”). O sentido literal é “escrever através”, ou seja, transferir por escrito o que estava em outra forma — antes um manuscrito copiado à mão, hoje uma fala gravada.
Uso clássico (até o século XX): transcrever era, sobretudo, copiar um texto de um suporte para outro — um monge medieval “transcrevia” um códice, um estudante “transcrevia” um trecho de livro no caderno. Uso moderno (pós-invenção do fonógrafo e do gravador): transcrever passa a designar principalmente o ato de converter fala gravada em texto — a acepção majoritária nos dicionários brasileiros atuais como Dicio, Priberam e Michaelis.
Formas conjugadas comuns: eu transcrevo, você transcreve, nós transcrevemos, particípio transcrito. A palavra é regular na maior parte dos tempos, apenas com o particípio irregular (não “transcrevido”).
Qual o significado de transcrição?
Nos dicionários brasileiros de referência (Dicio, Priberam, Michaelis), transcrição aparece com três acepções principais:
- Ato ou efeito de transcrever — o resultado escrito de converter fala em texto. É a acepção mais comum hoje.
- Reprodução literal ou parcial de um texto em outro documento — sentido clássico, ainda usado em contexto jurídico (transcrição de trecho de processo, transcrição de escritura pública).
- Em linguística, representação escrita dos sons de uma língua usando símbolos fonéticos (transcrição fonética, IPA).
Historicamente, o termo circulou primeiro na esfera dos escribas e cartorários — antes de gravadores, transcrever era sempre uma operação escrita-para-escrita. A partir da segunda metade do século XX, com a popularização do gravador magnético, o sentido de “fala gravada → texto” consolidou-se como o significado majoritário no português brasileiro.
Tipos de transcrição — literal, adaptada, corrigida, fonética
Em uso profissional e acadêmico, existem quatro tipos principais. A escolha depende do objetivo do documento final e de quem vai ler.
| Tipo | Descrição | Uso típico | Exemplo |
|---|---|---|---|
| Literal (verbatim) | Palavra por palavra, mantém erros e hesitações | Depoimento judicial, pesquisa linguística | “Eh… então, tipo, eu acho que…” |
| Corrigida | Limpa gramática, remove muletas | Ata de reunião, entrevista jornalística | “Eu acho que essa proposta…” |
| Adaptada | Reformula para leitura fluida | Livro a partir de fala, roteiro | “Considero que a proposta em análise…” |
| Fonética (IPA) | Símbolos fonéticos internacionais | Linguística acadêmica | [tɾɐ̃skɾiˈsɐ̃w] |
Transcrição literal (verbatim)
Reproduz exatamente o que foi dito — inclui hesitações (“eh…”), muletas (“né”, “tipo”, “sabe”), risos, pausas, sobreposições, erros de concordância. O objetivo é preservar não apenas o conteúdo, mas a forma exata da fala. É o padrão exigido em depoimento judicial, análise conversacional, sociolinguística e estudos de discurso.
Transcrição corrigida
Remove muletas e hesitações, ajusta a concordância verbal e nominal, mas mantém as palavras e a ordem original do falante. Não reescreve — apenas limpa. É o padrão para ata de reunião, entrevista jornalística publicada, transcrição de podcast em formato de blog post. Aproximadamente 80% dos usos comerciais de transcrição pedem este formato.
Transcrição adaptada
Reformula frases inteiras para leitura fluida, mantendo o sentido original. É usada em projetos editoriais — livros escritos a partir de entrevistas (biografias faladas, história oral publicada) e roteiros de documentário baseados em depoimentos. Exige um profissional editorial, não apenas um transcritor.
Transcrição fonética (IPA)
Representa os sons da fala usando símbolos do Alfabeto Fonético Internacional (IPA). A palavra “transcrição” em PT-BR, foneticamente, fica [tɾɐ̃skɾiˈsɐ̃w]. É uma disciplina da linguística acadêmica, usada em dicionários, ensino de idiomas, fonoaudiologia e pesquisa em fonética/fonologia. Não é o mesmo trabalho da transcrição de áudio para texto ortográfico.
Exemplos de transcrição (com trechos reais)
Três exemplos de casos comuns em português brasileiro, com descrição da fonte de áudio e do texto resultante em formato corrigido.
Entrevista jornalística
Fonte de áudio: Repórter entrevistando fonte por 45 min em coletiva de imprensa (gravador digital).
“O edital foi publicado no Diário Oficial de 3 de agosto e o prazo de impugnação corre até o dia 15. Nós já protocolamos duas questões técnicas junto à comissão de licitação, e estamos aguardando resposta formal até o fim desta semana.”
Aula gravada (EAD)
Fonte de áudio: Professora universitária, aula síncrona de 90 min no Google Meet gravada localmente.
“Bom pessoal, hoje a gente vai fechar o capítulo sobre estruturas condicionais. Lembrem que o if-else em Python não usa chaves como em JavaScript; a indentação é obrigatória e faz parte da sintaxe da linguagem.”
Reunião de trabalho
Fonte de áudio: Reunião de alinhamento entre 4 pessoas por 30 min no Zoom, exportada em MP4.
“[Ana] Se a gente conseguir fechar o QA até quinta, a gente sobe para produção na sexta de manhã. [Bruno] Fechado. Vou pedir para o time de infra reservar a janela das 9h.”
Para que serve uma transcrição? (7 casos de uso)
- ●Jornalismo. Arquivo de entrevistas, coletivas e CPIs com citações verificáveis (Abraji, Gemini Tools Kit for Journalists — outubro/2025).
- ●Pesquisa acadêmica. Grupos focais e entrevistas em profundidade importadas em NVivo, ATLAS.ti ou IRaMuTeQ; citação por ABNT NBR 10520.
- ●Jurídico (degravação). Audiências e depoimentos gravados (CNJ Resoluções 354/2020 e 105/2010). Verbatim com fé pública exige perito juramentado.
- ●Medicina (prontuários). Anamnese ditada, teleconsultas (CFM Resolução 2.314/2022). Conteúdo é dado sensível (LGPD Art. 11).
- ●Legendas de vídeo. Geração de SRT/VTT para YouTube, Premiere, DaVinci Resolve, CapCut — ver o gerador de legendas do VexaScribe.
- ●Acessibilidade. Inclusão de pessoas surdas e com deficiência auditiva (LBI Lei 13.146/2015, ABNT NBR 15290 para LSE).
- ●SEO de podcast e vídeo. Google indexa texto, não áudio. Transcrição publicada aumenta descoberta orgânica de episódios e videoaulas.
Diferença entre transcrição e legenda
Toda legenda começa como uma transcrição, mas nem toda transcrição vira legenda. A diferença está no formato, na sincronia com o áudio e no uso final.
| Critério | Transcrição | Legenda |
|---|---|---|
| Formato | TXT, DOCX (texto contínuo) | SRT, VTT (blocos com timestamps) |
| Sincronia com áudio | Opcional (pode ter ou não) | Obrigatória (in/out por bloco) |
| Uso típico | Leitura, arquivo, citação, análise | Sobreposição em vídeo (YouTube, Reels, TV) |
| Timestamps | Opcionais, geralmente por parágrafo | Obrigatórios, em milissegundos por linha |
Para uma comparação mais detalhada com fluxos de trabalho no YouTube, Premiere e CapCut, veja o guia dedicado de legendas automáticas.
Transcrição de áudio vs transcrição de vídeo vs transcrição fonética
O termo “transcrição” cobre três usos distintos no português brasileiro. Vale distinguir antes de escolher uma ferramenta ou contratar um profissional.
- ●Transcrição de áudio — converter arquivo MP3, M4A, WAV, OGG em texto. Uso majoritário no dia a dia profissional: podcast, entrevista, aula gravada, memo de voz.
- ●Transcrição de vídeo — mesma operação, mas o áudio é extraído de um MP4, MOV, MKV ou de uma URL do YouTube. Tecnicamente é a transcrição do canal de áudio do vídeo; comercialmente é vendida como “transcrição de vídeo” porque o usuário parte de um arquivo de vídeo.
- ●Transcrição fonética — disciplina da linguística: representar a pronúncia com símbolos IPA. Não tem relação com ferramentas de conversão de áudio em texto; usa manuais de fonética e dicionários especializados.
Como funciona uma transcrição (manual vs IA)
Uma transcrição pode ser produzida por dois caminhos com custos e prazos muito diferentes.
Transcrição manual (profissional humano)
- ● Tempo: cerca de 4 horas de trabalho para cada 1 hora de áudio limpo — mais em áudio ruidoso, verbatim ou terminologia técnica.
- ● Custo BR: R$ 70 a R$ 150 por hora para transcrição corrigida; R$ 150 a R$ 300 para verbatim ou nichos técnicos.
- ● Vantagem: precisão perto de 99,6% em profissional experiente; único caminho para verbatim com fé pública processual (perito juramentado em Junta Comercial).
- ● Fluxo: escuta em loop com pedal de transcrição ou atalhos de teclado, digitação simultânea, revisão final.
Transcrição por IA (Whisper Large-v3)
- ● Tempo: 5 a 10 minutos por hora de áudio, dependendo da carga do servidor.
- ● Custo: US$ 0,01-0,03 por minuto no VexaScribe (~R$ 0,05-0,17 por minuto), 30 min grátis no cadastro.
- ● Precisão: 93-95% em PT-BR em áudio limpo (benchmark FLEURS); revisão manual de 10-15 min por hora recupera nomes próprios e termos técnicos.
- ● Fluxo: upload → processamento em GPU → edição no painel → export TXT/DOCX/SRT/VTT.
Para a maioria dos casos comerciais em 2026, um fluxo híbrido — IA como primeira passada + revisão humana de 15-30 min por hora — captura mais de 95% da qualidade do trabalho puramente humano por menos de 10% do custo.
Glossário — 12 termos ligados à transcrição
Vocabulário técnico essencial para quem trabalha com transcrição por IA em português brasileiro.
- Diarização
- Identificação e separação automática de falantes em um áudio.
- Timestamp
- Marcação de tempo (00:03:42) associada a cada trecho transcrito.
- SRT (SubRip Subtitle)
- Formato de arquivo de legenda mais usado, texto simples com timestamps.
- VTT (WebVTT)
- Formato de legenda nativo HTML5 para uso no navegador.
- Whisper
- Modelo de IA de reconhecimento de fala da OpenAI, open-source, suporta 99 idiomas.
- ASR (Automatic Speech Recognition)
- Reconhecimento automático de fala; a tecnologia por trás da transcrição por IA.
- WER (Word Error Rate)
- Métrica de erro em transcrição; 5% WER = 95% de precisão.
- Verbatim
- Transcrição literal palavra por palavra, incluindo hesitações e erros.
- IPA (International Phonetic Alphabet)
- Alfabeto fonético internacional usado em transcrição linguística.
- Degravação
- Sinônimo brasileiro para transcrição, usado principalmente em contexto jurídico.
- Closed caption
- Legenda que pode ser ativada/desativada pelo espectador (distinto de burn-in).
- Forced alignment
- Alinhamento automático de texto pré-existente com o áudio correspondente.
Guias relacionadas
Transcrição com IA — como funciona
Whisper Large-v3, benchmark PT-BR e comparativo de 6 ferramentas.
Transcrever áudio em texto (ferramenta)
Upload de MP3/M4A/WAV, exportação TXT/DOCX/SRT/VTT.
Transcrever vídeo em texto (ferramenta)
MP4/MOV/MKV ou URL do YouTube, transcrição em 5-10 min por hora.
Legendas vs transcrição — diferença
Quando gerar SRT/VTT e quando basta um texto contínuo.
Transcrição para acessibilidade
LBI Art. 67, ABNT NBR 15290 e legenda para surdos (LSE).
Recursos: diarização, timestamps, SRT/VTT
O que o VexaScribe entrega em cada arquivo transcrito.
Quer testar uma transcrição por IA agora? O VexaScribe oferece 30 minutos grátis no cadastro, sem cartão de crédito.
Experimentar o VexaScribe →Perguntas frequentes sobre transcrição
Como funciona a transcrição?
A transcrição converte fala em texto por dois caminhos. (1) Manual: um transcritor escuta o áudio, pausa a cada 5-10 segundos e digita o que ouviu — leva cerca de 4 horas de trabalho para cada 1 hora de áudio, e custa entre R$ 70 e R$ 150 por hora com profissional brasileiro. (2) Por IA: um modelo de reconhecimento automático de fala (ASR) como o Whisper Large-v3 da OpenAI processa o áudio em um pipeline encoder-decoder Transformer, gera texto com pontuação e devolve o resultado em 5 a 10 minutos por hora de áudio. Ferramentas modernas ainda aplicam diarização (identificam quem falou), geram timestamps ao nível da palavra e exportam SRT, VTT ou DOCX. Em agosto de 2026, a precisão típica em português brasileiro é de 93-95% em áudio limpo (benchmark FLEURS PT-BR).
Para que serve uma transcrição?
Uma transcrição serve para transformar áudio ou vídeo em um texto pesquisável, editável e acessível. Os sete usos mais comuns em 2026 são: (1) jornalismo — arquivar entrevistas e coletivas com citações verificáveis; (2) pesquisa acadêmica — analisar grupos focais no NVivo/ATLAS.ti conforme ABNT NBR 10520; (3) jurídico — degravação de audiências e depoimentos (CNJ Resoluções 354/2020 e 105/2010); (4) medicina — prontuários ditados e teleconsultas (CFM 2.314/2022); (5) legendas de vídeo — geração de SRT/VTT para YouTube, Premiere, CapCut; (6) acessibilidade — inclusão de pessoas surdas e com deficiência auditiva (LBI Lei 13.146/2015, ABNT NBR 15290); (7) SEO de conteúdo — indexação de podcast e vídeo pelo Google, que rankeia o texto e não o áudio.
Qual a diferença entre transcrição e legenda?
Transcrição é o texto completo da fala, geralmente em um único arquivo TXT ou DOCX, sem obrigação de sincronia com o áudio — serve para leitura, arquivo e citação. Legenda é a mesma fala em texto, mas segmentada em blocos curtos de 32-42 caracteres por linha, com timestamps de entrada e saída (ex.: 00:00:12,340 --> 00:00:15,120), no formato SRT (SubRip) ou VTT (WebVTT), pensada para ser sobreposta ao vídeo. Toda legenda começa como uma transcrição; o inverso não é verdade — uma transcrição pura não tem timestamps por bloco. Ferramentas como o VexaScribe entregam os dois formatos a partir do mesmo processamento do áudio.
Quais os tipos de transcrição?
Existem quatro tipos principais de transcrição em uso profissional. (1) Literal (verbatim): palavra por palavra, mantém hesitações, muletas, erros gramaticais, pausas — usada em depoimento judicial e pesquisa linguística. (2) Corrigida (limpa): remove muletas (“né”, “tipo”, “eh”), ajusta concordância — padrão para ata de reunião e entrevista jornalística. (3) Adaptada (editada): reformula frases para leitura fluida, mantém o sentido — usada em livros a partir de fala e roteiros. (4) Fonética (IPA): usa símbolos do Alfabeto Fonético Internacional — uso acadêmico em linguística. Os três primeiros trabalham com o texto ortográfico; o quarto é uma disciplina à parte.
O que é transcrição verbatim?
Verbatim é o termo latino para “palavra por palavra” e é sinônimo de transcrição literal. Uma transcrição verbatim reproduz exatamente o que foi dito, incluindo hesitações (“eh…”, “hum…”), muletas de linguagem (“né”, “tipo”, “sabe”), risos, pausas, sobreposições e erros de concordância. É o padrão exigido em depoimentos judiciais, pesquisas linguísticas e análise de discurso conversacional, porque o “como” foi dito importa tanto quanto o “o quê”. Ferramentas de IA geram um rascunho verbatim decente, mas para uso com fé pública processual continua sendo exigido perito transcritor humano registrado em Junta Comercial.
Transcrição fonética é o mesmo que transcrição de áudio?
Não. São coisas diferentes. Transcrição fonética é uma disciplina da linguística acadêmica: representa a pronúncia usando símbolos do Alfabeto Fonético Internacional (IPA) — a palavra “transcrição” escrita foneticamente em PT-BR fica [tɾɐ̃skɾiˈsɐ̃w]. É usada em dicionários, ensino de idiomas, fonoaudiologia e pesquisa em fonética/fonologia. Transcrição de áudio (ou de vídeo) é o uso prático e profissional: converter fala em texto ortográfico normal, com pontuação, para leitura, arquivo, legenda, ata ou degravação. Este artigo trata da transcrição de áudio em texto — o uso majoritário do termo em contexto de trabalho.
Quanto custa uma transcrição profissional?
Depende do caminho escolhido. Transcritor humano brasileiro: R$ 70 a R$ 150 por hora de áudio para transcrição corrigida padrão, e R$ 150 a R$ 300 por hora para verbatim ou terminologia técnica (medicina, jurídico). Perito transcritor juramentado (fé pública processual): R$ 200 a R$ 500 por hora, registro obrigatório em Junta Comercial. Serviços de IA em agosto de 2026: TurboScribe US$ 20/mês (~R$ 110), Notta US$ 8-19/mês, Sintesy R$ 12,49-39,90/mês via Pix, VexaScribe US$ 2-20/mês (~R$ 11-110) com 30 minutos grátis no cadastro. IA é 30 a 100 vezes mais barata que humano e serve para 90% dos casos; humano continua sendo obrigatório para verbatim juramentado.
Como fazer uma transcrição rápido?
Em agosto de 2026, o caminho mais rápido é usar uma ferramenta de IA baseada em Whisper Large-v3. Fluxo: (1) grave ou tenha o arquivo de áudio/vídeo pronto (MP3, M4A, WAV, MP4, MOV); (2) faça upload em um serviço como VexaScribe (30 min grátis), TurboScribe ou Sintesy; (3) selecione português como idioma-fonte; (4) aguarde 5-10 minutos por hora de áudio; (5) revise nomes próprios e termos técnicos no editor; (6) exporte TXT, DOCX, SRT ou VTT. Para máxima velocidade em áudio limpo, priorize gravação com microfone USB ou lavalier em ambiente sem ruído — a qualidade do áudio pesa mais para o resultado final do que a marca da ferramenta.