Verificado em agosto de 2026

O que é transcrição? Definição, significado, tipos e exemplos

Guia direto sobre o que é transcrição em português brasileiro: definição, os quatro tipos (literal, corrigida, adaptada, fonética), exemplos reais, para que serve, diferença entre transcrição e legenda, e um glossário de 12 termos técnicos.

Antes de detalhar cada seção, a resposta rápida em um parágrafo. Transcrição é a conversão de fala (áudio ou vídeo) em texto escrito. Existem quatro tipos principais: literal (palavra por palavra, incluindo pausas), corrigida (limpa erros gramaticais), adaptada (reformula para leitura) e fonética (IPA, uso linguístico). Em 2026, é feita por IA (Whisper Large-v3, 93-95% em português) em minutos ou manualmente por profissionais. As seções seguintes aprofundam cada ponto com exemplos, tabelas comparativas e um glossário técnico.

4 tipos de transcriçãoExemplos reaisGlossário de 12 termos93-95% precisão PT-BR

O que é transcrição? — definição direta

Transcrição é a conversão de fala em texto escrito. O processo pega o áudio de uma pessoa falando — em uma entrevista, aula, reunião, podcast ou vídeo — e produz um documento textual que reproduz o que foi dito. O resultado pode ser um TXT simples, um DOCX formatado, uma legenda SRT com timestamps ou um JSON com metadados de falantes.

Em uso profissional, transcrição sempre envolve três decisões: (1) quanto fidelidade à fala original — literal, corrigida ou adaptada; (2) quanto detalhe estrutural — timestamps por palavra, por frase, por parágrafo, ou nenhum; (3) quem faz — um transcritor humano especializado ou um sistema de inteligência artificial baseado em ASR (reconhecimento automático de fala).

No Brasil, a área jurídica ainda usa muito o sinônimo degravação para se referir à transcrição de audiências e depoimentos gravados. O sentido é o mesmo — converter fala gravada em texto — mas o termo carrega a expectativa de fé pública processual quando exigido por juiz.

O que é transcrever? — o verbo e sua etimologia

Transcrever é o verbo correspondente ao substantivo transcrição — significa passar algo para outra forma escrita. A palavra vem do latim transcribere, formado por trans- (“através”, “de um lado para outro”) + scribere (“escrever”). O sentido literal é “escrever através”, ou seja, transferir por escrito o que estava em outra forma — antes um manuscrito copiado à mão, hoje uma fala gravada.

Uso clássico (até o século XX): transcrever era, sobretudo, copiar um texto de um suporte para outro — um monge medieval “transcrevia” um códice, um estudante “transcrevia” um trecho de livro no caderno. Uso moderno (pós-invenção do fonógrafo e do gravador): transcrever passa a designar principalmente o ato de converter fala gravada em texto — a acepção majoritária nos dicionários brasileiros atuais como Dicio, Priberam e Michaelis.

Formas conjugadas comuns: eu transcrevo, você transcreve, nós transcrevemos, particípio transcrito. A palavra é regular na maior parte dos tempos, apenas com o particípio irregular (não “transcrevido”).

Qual o significado de transcrição?

Nos dicionários brasileiros de referência (Dicio, Priberam, Michaelis), transcrição aparece com três acepções principais:

  1. Ato ou efeito de transcrever — o resultado escrito de converter fala em texto. É a acepção mais comum hoje.
  2. Reprodução literal ou parcial de um texto em outro documento — sentido clássico, ainda usado em contexto jurídico (transcrição de trecho de processo, transcrição de escritura pública).
  3. Em linguística, representação escrita dos sons de uma língua usando símbolos fonéticos (transcrição fonética, IPA).

Historicamente, o termo circulou primeiro na esfera dos escribas e cartorários — antes de gravadores, transcrever era sempre uma operação escrita-para-escrita. A partir da segunda metade do século XX, com a popularização do gravador magnético, o sentido de “fala gravada → texto” consolidou-se como o significado majoritário no português brasileiro.

Tipos de transcrição — literal, adaptada, corrigida, fonética

Em uso profissional e acadêmico, existem quatro tipos principais. A escolha depende do objetivo do documento final e de quem vai ler.

TipoDescriçãoUso típicoExemplo
Literal (verbatim)Palavra por palavra, mantém erros e hesitaçõesDepoimento judicial, pesquisa linguística“Eh… então, tipo, eu acho que…”
CorrigidaLimpa gramática, remove muletasAta de reunião, entrevista jornalística“Eu acho que essa proposta…”
AdaptadaReformula para leitura fluidaLivro a partir de fala, roteiro“Considero que a proposta em análise…”
Fonética (IPA)Símbolos fonéticos internacionaisLinguística acadêmica[tɾɐ̃skɾiˈsɐ̃w]

Transcrição literal (verbatim)

Reproduz exatamente o que foi dito — inclui hesitações (“eh…”), muletas (“né”, “tipo”, “sabe”), risos, pausas, sobreposições, erros de concordância. O objetivo é preservar não apenas o conteúdo, mas a forma exata da fala. É o padrão exigido em depoimento judicial, análise conversacional, sociolinguística e estudos de discurso.

Transcrição corrigida

Remove muletas e hesitações, ajusta a concordância verbal e nominal, mas mantém as palavras e a ordem original do falante. Não reescreve — apenas limpa. É o padrão para ata de reunião, entrevista jornalística publicada, transcrição de podcast em formato de blog post. Aproximadamente 80% dos usos comerciais de transcrição pedem este formato.

Transcrição adaptada

Reformula frases inteiras para leitura fluida, mantendo o sentido original. É usada em projetos editoriais — livros escritos a partir de entrevistas (biografias faladas, história oral publicada) e roteiros de documentário baseados em depoimentos. Exige um profissional editorial, não apenas um transcritor.

Transcrição fonética (IPA)

Representa os sons da fala usando símbolos do Alfabeto Fonético Internacional (IPA). A palavra “transcrição” em PT-BR, foneticamente, fica [tɾɐ̃skɾiˈsɐ̃w]. É uma disciplina da linguística acadêmica, usada em dicionários, ensino de idiomas, fonoaudiologia e pesquisa em fonética/fonologia. Não é o mesmo trabalho da transcrição de áudio para texto ortográfico.

Exemplos de transcrição (com trechos reais)

Três exemplos de casos comuns em português brasileiro, com descrição da fonte de áudio e do texto resultante em formato corrigido.

Entrevista jornalística

Fonte de áudio: Repórter entrevistando fonte por 45 min em coletiva de imprensa (gravador digital).

“O edital foi publicado no Diário Oficial de 3 de agosto e o prazo de impugnação corre até o dia 15. Nós já protocolamos duas questões técnicas junto à comissão de licitação, e estamos aguardando resposta formal até o fim desta semana.”

Aula gravada (EAD)

Fonte de áudio: Professora universitária, aula síncrona de 90 min no Google Meet gravada localmente.

“Bom pessoal, hoje a gente vai fechar o capítulo sobre estruturas condicionais. Lembrem que o if-else em Python não usa chaves como em JavaScript; a indentação é obrigatória e faz parte da sintaxe da linguagem.”

Reunião de trabalho

Fonte de áudio: Reunião de alinhamento entre 4 pessoas por 30 min no Zoom, exportada em MP4.

“[Ana] Se a gente conseguir fechar o QA até quinta, a gente sobe para produção na sexta de manhã. [Bruno] Fechado. Vou pedir para o time de infra reservar a janela das 9h.”

Para que serve uma transcrição? (7 casos de uso)

  • Jornalismo. Arquivo de entrevistas, coletivas e CPIs com citações verificáveis (Abraji, Gemini Tools Kit for Journalists — outubro/2025).
  • Pesquisa acadêmica. Grupos focais e entrevistas em profundidade importadas em NVivo, ATLAS.ti ou IRaMuTeQ; citação por ABNT NBR 10520.
  • Jurídico (degravação). Audiências e depoimentos gravados (CNJ Resoluções 354/2020 e 105/2010). Verbatim com fé pública exige perito juramentado.
  • Medicina (prontuários). Anamnese ditada, teleconsultas (CFM Resolução 2.314/2022). Conteúdo é dado sensível (LGPD Art. 11).
  • Legendas de vídeo. Geração de SRT/VTT para YouTube, Premiere, DaVinci Resolve, CapCut — ver o gerador de legendas do VexaScribe.
  • Acessibilidade. Inclusão de pessoas surdas e com deficiência auditiva (LBI Lei 13.146/2015, ABNT NBR 15290 para LSE).
  • SEO de podcast e vídeo. Google indexa texto, não áudio. Transcrição publicada aumenta descoberta orgânica de episódios e videoaulas.

Diferença entre transcrição e legenda

Toda legenda começa como uma transcrição, mas nem toda transcrição vira legenda. A diferença está no formato, na sincronia com o áudio e no uso final.

CritérioTranscriçãoLegenda
FormatoTXT, DOCX (texto contínuo)SRT, VTT (blocos com timestamps)
Sincronia com áudioOpcional (pode ter ou não)Obrigatória (in/out por bloco)
Uso típicoLeitura, arquivo, citação, análiseSobreposição em vídeo (YouTube, Reels, TV)
TimestampsOpcionais, geralmente por parágrafoObrigatórios, em milissegundos por linha

Para uma comparação mais detalhada com fluxos de trabalho no YouTube, Premiere e CapCut, veja o guia dedicado de legendas automáticas.

Transcrição de áudio vs transcrição de vídeo vs transcrição fonética

O termo “transcrição” cobre três usos distintos no português brasileiro. Vale distinguir antes de escolher uma ferramenta ou contratar um profissional.

  • Transcrição de áudio — converter arquivo MP3, M4A, WAV, OGG em texto. Uso majoritário no dia a dia profissional: podcast, entrevista, aula gravada, memo de voz.
  • Transcrição de vídeo — mesma operação, mas o áudio é extraído de um MP4, MOV, MKV ou de uma URL do YouTube. Tecnicamente é a transcrição do canal de áudio do vídeo; comercialmente é vendida como “transcrição de vídeo” porque o usuário parte de um arquivo de vídeo.
  • Transcrição fonética — disciplina da linguística: representar a pronúncia com símbolos IPA. Não tem relação com ferramentas de conversão de áudio em texto; usa manuais de fonética e dicionários especializados.
Nota importante: este artigo trata da transcrição de áudio em texto (uso profissional/prático), não da transcrição fonética linguística (IPA, disciplina acadêmica). Se você chegou aqui buscando sobre símbolos fonéticos internacionais para estudo de linguística, os melhores recursos em português brasileiro são os manuais de Thaïs Cristófaro Silva (“Fonética e Fonologia do Português”) e o portal Ciberdúvidas.

Como funciona uma transcrição (manual vs IA)

Uma transcrição pode ser produzida por dois caminhos com custos e prazos muito diferentes.

Transcrição manual (profissional humano)

  • Tempo: cerca de 4 horas de trabalho para cada 1 hora de áudio limpo — mais em áudio ruidoso, verbatim ou terminologia técnica.
  • Custo BR: R$ 70 a R$ 150 por hora para transcrição corrigida; R$ 150 a R$ 300 para verbatim ou nichos técnicos.
  • Vantagem: precisão perto de 99,6% em profissional experiente; único caminho para verbatim com fé pública processual (perito juramentado em Junta Comercial).
  • Fluxo: escuta em loop com pedal de transcrição ou atalhos de teclado, digitação simultânea, revisão final.

Transcrição por IA (Whisper Large-v3)

  • Tempo: 5 a 10 minutos por hora de áudio, dependendo da carga do servidor.
  • Custo: US$ 0,01-0,03 por minuto no VexaScribe (~R$ 0,05-0,17 por minuto), 30 min grátis no cadastro.
  • Precisão: 93-95% em PT-BR em áudio limpo (benchmark FLEURS); revisão manual de 10-15 min por hora recupera nomes próprios e termos técnicos.
  • Fluxo: upload → processamento em GPU → edição no painel → export TXT/DOCX/SRT/VTT.

Para a maioria dos casos comerciais em 2026, um fluxo híbrido — IA como primeira passada + revisão humana de 15-30 min por hora — captura mais de 95% da qualidade do trabalho puramente humano por menos de 10% do custo.

Glossário — 12 termos ligados à transcrição

Vocabulário técnico essencial para quem trabalha com transcrição por IA em português brasileiro.

Diarização
Identificação e separação automática de falantes em um áudio.
Timestamp
Marcação de tempo (00:03:42) associada a cada trecho transcrito.
SRT (SubRip Subtitle)
Formato de arquivo de legenda mais usado, texto simples com timestamps.
VTT (WebVTT)
Formato de legenda nativo HTML5 para uso no navegador.
Whisper
Modelo de IA de reconhecimento de fala da OpenAI, open-source, suporta 99 idiomas.
ASR (Automatic Speech Recognition)
Reconhecimento automático de fala; a tecnologia por trás da transcrição por IA.
WER (Word Error Rate)
Métrica de erro em transcrição; 5% WER = 95% de precisão.
Verbatim
Transcrição literal palavra por palavra, incluindo hesitações e erros.
IPA (International Phonetic Alphabet)
Alfabeto fonético internacional usado em transcrição linguística.
Degravação
Sinônimo brasileiro para transcrição, usado principalmente em contexto jurídico.
Closed caption
Legenda que pode ser ativada/desativada pelo espectador (distinto de burn-in).
Forced alignment
Alinhamento automático de texto pré-existente com o áudio correspondente.

Guias relacionadas

Quer testar uma transcrição por IA agora? O VexaScribe oferece 30 minutos grátis no cadastro, sem cartão de crédito.

Experimentar o VexaScribe →

Perguntas frequentes sobre transcrição

Como funciona a transcrição?

A transcrição converte fala em texto por dois caminhos. (1) Manual: um transcritor escuta o áudio, pausa a cada 5-10 segundos e digita o que ouviu — leva cerca de 4 horas de trabalho para cada 1 hora de áudio, e custa entre R$ 70 e R$ 150 por hora com profissional brasileiro. (2) Por IA: um modelo de reconhecimento automático de fala (ASR) como o Whisper Large-v3 da OpenAI processa o áudio em um pipeline encoder-decoder Transformer, gera texto com pontuação e devolve o resultado em 5 a 10 minutos por hora de áudio. Ferramentas modernas ainda aplicam diarização (identificam quem falou), geram timestamps ao nível da palavra e exportam SRT, VTT ou DOCX. Em agosto de 2026, a precisão típica em português brasileiro é de 93-95% em áudio limpo (benchmark FLEURS PT-BR).

Para que serve uma transcrição?

Uma transcrição serve para transformar áudio ou vídeo em um texto pesquisável, editável e acessível. Os sete usos mais comuns em 2026 são: (1) jornalismo — arquivar entrevistas e coletivas com citações verificáveis; (2) pesquisa acadêmica — analisar grupos focais no NVivo/ATLAS.ti conforme ABNT NBR 10520; (3) jurídico — degravação de audiências e depoimentos (CNJ Resoluções 354/2020 e 105/2010); (4) medicina — prontuários ditados e teleconsultas (CFM 2.314/2022); (5) legendas de vídeo — geração de SRT/VTT para YouTube, Premiere, CapCut; (6) acessibilidade — inclusão de pessoas surdas e com deficiência auditiva (LBI Lei 13.146/2015, ABNT NBR 15290); (7) SEO de conteúdo — indexação de podcast e vídeo pelo Google, que rankeia o texto e não o áudio.

Qual a diferença entre transcrição e legenda?

Transcrição é o texto completo da fala, geralmente em um único arquivo TXT ou DOCX, sem obrigação de sincronia com o áudio — serve para leitura, arquivo e citação. Legenda é a mesma fala em texto, mas segmentada em blocos curtos de 32-42 caracteres por linha, com timestamps de entrada e saída (ex.: 00:00:12,340 --> 00:00:15,120), no formato SRT (SubRip) ou VTT (WebVTT), pensada para ser sobreposta ao vídeo. Toda legenda começa como uma transcrição; o inverso não é verdade — uma transcrição pura não tem timestamps por bloco. Ferramentas como o VexaScribe entregam os dois formatos a partir do mesmo processamento do áudio.

Quais os tipos de transcrição?

Existem quatro tipos principais de transcrição em uso profissional. (1) Literal (verbatim): palavra por palavra, mantém hesitações, muletas, erros gramaticais, pausas — usada em depoimento judicial e pesquisa linguística. (2) Corrigida (limpa): remove muletas (“né”, “tipo”, “eh”), ajusta concordância — padrão para ata de reunião e entrevista jornalística. (3) Adaptada (editada): reformula frases para leitura fluida, mantém o sentido — usada em livros a partir de fala e roteiros. (4) Fonética (IPA): usa símbolos do Alfabeto Fonético Internacional — uso acadêmico em linguística. Os três primeiros trabalham com o texto ortográfico; o quarto é uma disciplina à parte.

O que é transcrição verbatim?

Verbatim é o termo latino para “palavra por palavra” e é sinônimo de transcrição literal. Uma transcrição verbatim reproduz exatamente o que foi dito, incluindo hesitações (“eh…”, “hum…”), muletas de linguagem (“né”, “tipo”, “sabe”), risos, pausas, sobreposições e erros de concordância. É o padrão exigido em depoimentos judiciais, pesquisas linguísticas e análise de discurso conversacional, porque o “como” foi dito importa tanto quanto o “o quê”. Ferramentas de IA geram um rascunho verbatim decente, mas para uso com fé pública processual continua sendo exigido perito transcritor humano registrado em Junta Comercial.

Transcrição fonética é o mesmo que transcrição de áudio?

Não. São coisas diferentes. Transcrição fonética é uma disciplina da linguística acadêmica: representa a pronúncia usando símbolos do Alfabeto Fonético Internacional (IPA) — a palavra “transcrição” escrita foneticamente em PT-BR fica [tɾɐ̃skɾiˈsɐ̃w]. É usada em dicionários, ensino de idiomas, fonoaudiologia e pesquisa em fonética/fonologia. Transcrição de áudio (ou de vídeo) é o uso prático e profissional: converter fala em texto ortográfico normal, com pontuação, para leitura, arquivo, legenda, ata ou degravação. Este artigo trata da transcrição de áudio em texto — o uso majoritário do termo em contexto de trabalho.

Quanto custa uma transcrição profissional?

Depende do caminho escolhido. Transcritor humano brasileiro: R$ 70 a R$ 150 por hora de áudio para transcrição corrigida padrão, e R$ 150 a R$ 300 por hora para verbatim ou terminologia técnica (medicina, jurídico). Perito transcritor juramentado (fé pública processual): R$ 200 a R$ 500 por hora, registro obrigatório em Junta Comercial. Serviços de IA em agosto de 2026: TurboScribe US$ 20/mês (~R$ 110), Notta US$ 8-19/mês, Sintesy R$ 12,49-39,90/mês via Pix, VexaScribe US$ 2-20/mês (~R$ 11-110) com 30 minutos grátis no cadastro. IA é 30 a 100 vezes mais barata que humano e serve para 90% dos casos; humano continua sendo obrigatório para verbatim juramentado.

Como fazer uma transcrição rápido?

Em agosto de 2026, o caminho mais rápido é usar uma ferramenta de IA baseada em Whisper Large-v3. Fluxo: (1) grave ou tenha o arquivo de áudio/vídeo pronto (MP3, M4A, WAV, MP4, MOV); (2) faça upload em um serviço como VexaScribe (30 min grátis), TurboScribe ou Sintesy; (3) selecione português como idioma-fonte; (4) aguarde 5-10 minutos por hora de áudio; (5) revise nomes próprios e termos técnicos no editor; (6) exporte TXT, DOCX, SRT ou VTT. Para máxima velocidade em áudio limpo, priorize gravação com microfone USB ou lavalier em ambiente sem ruído — a qualidade do áudio pesa mais para o resultado final do que a marca da ferramenta.