Verificado em julho de 2026

Legenda Descritiva (LSE) — LBI, ABNT NBR 15290 e Workflow IA + Legendista

Legenda descritiva (LSE — Legenda para Surdos e Ensurdecidos) inclui falas + sons importantes + identificação de quem fala — obrigatória pela LBI (Lei 13.146/2015 Art. 67) e regulamentada pela ABNT NBR 15290:2016. IA gera transcrição-base (~93-95% precisão PT-BR) e um legendista profissional adiciona formatação ABNT. VexaScribe cobre a primeira etapa — para produto final LSE-conforme, contrate legendista humano especialista.

O que é legenda descritiva (LSE)

Legenda descritiva — também chamada Legenda para Surdos e Ensurdecidos (LSE) ou closed caption em português — é uma legenda que inclui, além das falas:

  • Identificação de quem está falando (ex. “JOÃO:”, “MARIA:”)
  • Descrição de efeitos sonoros importantes entre colchetes (ex. “[porta rangendo]”, “[música tensa]”, “[risadas]”)
  • Marcação de música (“♪♪♪”)
  • Indicação de tom quando ambíguo (ex. “[irônico]”)

O objetivo é dar acesso completo ao conteúdo audiovisual para pessoas surdas e ensurdecidas — não apenas ao diálogo. Diferente da legenda comum (que só traduz ou transcreve falas), a LSE é um recurso de acessibilidade completo, obrigatório em contextos específicos pela LBI e regulamentado tecnicamente pela ABNT NBR 15290.

LSE vs legenda comum vs closed caption — a taxonomia

Termos frequentemente confundidos. “Legenda descritiva” = “LSE” = “Closed Caption em português” são três nomes para a mesma coisa.

TipoFalasSons/EfeitosIdentifica locutorFormatoPúblico
Legenda comum (tradicional).srt / .vttTodos, principalmente para tradução
Legenda descritiva / LSE / Closed Caption✅ [entre colchetes]✅ (LOCUTOR:).scc / .srt formatadoSurdos e ensurdecidos
Audiodescrição❌ (áudio adicional)Narra o visualFaixa de áudio separadaCegos e baixa visão
Janela de LibrasInterpretação em LibrasVídeo com intérpreteSurdos oralizados em Libras

Regras ABNT NBR 15290 para produzir uma LSE conforme

Regras técnicas obrigatórias para conformidade com o padrão brasileiro. A norma completa está no ABNT Catálogo (compra do documento oficial custa R$ 200-300).

Linha ≤ 32 caracteres

Mais conservador que WCAG (42). Fluxo de leitura em português.

Máximo 2 linhas simultâneas

Evita sobrecarga visual.

Duração ≥ 1 segundo por legenda

Evita “flash” imperceptível.

Velocidade ≤ 17 caracteres/segundo

Ritmo de leitura em PT-BR.

Cor amarela sobre fundo preto

Contraste tradicional para hearing-impaired; outras cores aceitas com contraste suficiente.

Identificação de locutor em MAIÚSCULAS

Ex: “MARIA:” antes da fala.

Efeitos sonoros entre colchetes

Ex: [Aplausos], [Porta rangendo], [Música tensa].

Música indicada com ♪♪♪

Ou “♪ [nome da música] ♪” para música identificável.

Fontes sans-serif

Arial, Helvetica. Sem serifas.

Posicionamento na base do vídeo

Reposicionar no topo se conteúdo visual crítico estiver na base.

Workflow honesto — IA + legendista humano

A IA em 2026 não gera LSE completa automaticamente. O que a IA faz e o que exige revisão humana especializada:

✅ Etapa 1 — IA faz bem

  • Transcrição das falas com timestamps ao nível da palavra
  • Diarização automática (identifica 2, 3, N vozes distintas)
  • Geração de SRT/VTT com pontuação e capitalização
  • Precisão típica em PT-BR: 93-95% (Whisper Large-v3)
  • Tempo típico: 5-10 minutos por hora de vídeo
  • Custo típico: R$ 5-20 por hora de vídeo (VexaScribe)

Ferramenta: VexaScribe ou similares baseadas em Whisper.

❌ Etapa 2 — Exige legendista humano

  • Inserção de efeitos sonoros entre colchetes [Porta bate]
  • Indicação de música com ♪♪♪
  • Marcação de tom quando ambíguo [irônico]
  • Aplicação de cor amarela e posicionamento ABNT
  • Correção de segmentação (respeitar 32 caracteres/linha)
  • Verificação humana de terminologia sensível

Tempo típico: 3-5 horas de trabalho por hora de vídeo. Custo típico: R$ 40-80/h de trabalho (freelancer) ou R$ 150-300 por hora de vídeo (agência completa).

Fluxo real recomendado: VexaScribe gera base + diarização em 5-10 min → legendista profissional adiciona formatação ABNT em 3-5h → LSE conforme entregue em 1-2 dias úteis. Economia real: 60-70% de tempo vs fluxo 100% manual (15-20h por hora de vídeo), sem perda de qualidade.

Custo típico de LSE profissional no Brasil (2026)

1. Legendagem manual completa (sem IA)

R$ 150-300 por hora de vídeo

Serviço tradicional de empresas como CPL (cpl.com.br), Videoshack (videoshack.com.br), Somos Inclua (somosinclua.com.br). Prazo típico 5-10 dias úteis. Vantagem: qualidade ABNT garantida por legendista humano especialista. Desvantagem: caro para volume, prazo longo.

2. Workflow híbrido IA + revisão humana ⭐ recomendado

R$ 60-120 por hora de vídeo

IA (VexaScribe US$ 2-20/mês ~ R$ 11-110) gera base + freelancer legendista (R$ 40-80/h) revisa e adiciona formatação ABNT. Prazo 1-2 dias úteis. Vantagem: 60% mais barato, prazo curto, qualidade ABNT mantida. Desvantagem: exige contratar/gerenciar freelancer.

3. IA sozinha sem revisão profissional

R$ 5-20 por hora de vídeo

Só custo VexaScribe. Funciona para: uso interno (treinamentos gravados, uso educacional restrito). NÃO atende ABNT para publicação externa nem conformidade LBI. Para conteúdo publicado externamente (TV, streaming, site institucional, YouTube público comercial), sempre inclua revisão profissional.

Quem produz LSE profissional no Brasil

Panorama honesto do mercado brasileiro (verificado julho de 2026). Serviços com histórico consolidado:

  • CPL (cpl.com.br) — pioneiro em closed caption/LSE no Brasil, atende TV e streaming, preço sob consulta.
  • Videoshack (videoshack.com.br) — acessibilidade audiovisual completa (LSE + audiodescrição + Libras), atende produtoras e canais.
  • Somos Inclua (somosinclua.com.br) — foco em conteúdo digital corporativo e educacional.
  • 4Estações (4estacoes.com) — serviços de acessibilidade audiovisual.
  • Cooperativas e freelancers: ABLEBRA (Associação Brasileira de Legendistas), Sintra (Sindicato Nacional dos Tradutores), grupos regionais em SP/RJ/POA.

Posicionamento honesto do VexaScribe: não competimos com CPL/Videoshack/Somos Inclua na entrega final de LSE ABNT-conforme. Somos a camada de transcrição-base + diarização + export multi-formato — a etapa que reduz o tempo do legendista humano de 15h para 3h por hora de vídeo. Somos ferramenta que os próprios legendistas podem usar para reduzir o trabalho manual repetitivo.

Perguntas frequentes

Frequently Asked Questions

O que é legenda descritiva (LSE)?

Legenda descritiva — também chamada Legenda para Surdos e Ensurdecidos (LSE) ou closed caption em português — é uma legenda que inclui além das falas: (1) identificação de quem está falando (ex. “JOÃO:”, “MARIA:”), (2) descrição de efeitos sonoros importantes entre colchetes (ex. “[porta rangendo]”, “[música tensa]”, “[risadas]”), (3) marcação de música (“♪♪♪”) e (4) indicação de tom quando ambíguo (ex. “[irônico]”). O objetivo é dar acesso completo ao conteúdo audiovisual para pessoas surdas e ensurdecidas — não apenas ao diálogo. É obrigatória em contextos específicos pela Lei Brasileira de Inclusão (LBI, Lei 13.146/2015 Art. 67) e regulamentada tecnicamente pela ABNT NBR 15290:2016. Diferente da legenda comum (que só traduz ou transcreve falas), a LSE é um recurso de acessibilidade completo.

Qual a diferença entre LSE, closed caption, legenda descritiva e legenda comum?

Termos frequentemente confundidos. (1) “Legenda descritiva” = “LSE (Legenda para Surdos e Ensurdecidos)” = “Closed Caption” (em português) — são o MESMO recurso, três nomes para a mesma coisa. Inclui falas + sons + identificação de locutor. (2) “Legenda comum” (ou “legenda tradicional” ou “open caption” quando gravada no vídeo) — só as falas, sem sons ou identificação. É o que a maioria dos vídeos de YouTube em PT tem. (3) “Legenda aberta” (open caption) = queimada no vídeo, sempre visível, não desativável. (4) “Legenda fechada” (closed caption, CC) = arquivo separado (.srt/.vtt/.scc), viewer liga/desliga. LSE pode ser aberta ou fechada — a característica que a define é o CONTEÚDO (sons+falas+locutor), não a técnica de exibição. Terminologia oficial brasileira: ABNT NBR 15290 usa “legenda oculta” para closed caption (arquivo separado) e “legendagem para surdos e ensurdecidos” ou “LSE” para o conteúdo acessível.

O que a LBI (Lei 13.146/2015) exige sobre legendas descritivas?

Artigo 67 da LBI: “Os serviços de radiodifusão de sons e imagens devem permitir o uso dos seguintes recursos, entre outros: (I) subtitulação por meio de legenda oculta; (II) janela com intérprete da Libras; (III) audiodescrição.” O Decreto 5.296/2004 (anterior à LBI mas ainda em vigor complementarmente) e o Decreto 8.386/2014 estabelecem cronogramas de implementação. O Ministério das Comunicações (Portaria 310/2006) regulamenta detalhes técnicos para TV aberta. Aplicação prática em 2026: (1) TV aberta e paga — LSE em 100% da programação de estreia (obrigação em vigor). (2) Streaming (Netflix, Prime Video, Globoplay, HBO Max) — não obrigado por lei federal específica, mas boas práticas + LGPD + expectativa do mercado. (3) Cinema — cronograma progressivo desde 2018. (4) Sites governamentais e conteúdo institucional — obrigatório desde 2019 (Decreto 9.522/2018 e Lei 12.965/2014 combinados). (5) Empresas com CA > R$ 250 milhões — obrigação de acessibilidade digital desde 2016. Sanções: multas administrativas (Anatel/Ministério Público) e ações civis públicas. Consulte um advogado especialista antes de assumir isenção — o marco legal é fragmentado.

Quais são as regras técnicas ABNT NBR 15290 para produzir uma LSE?

ABNT NBR 15290:2016 (Acessibilidade em comunicação na televisão) especifica: (1) Linha ≤ 32 caracteres por linha (mais conservador que os 42 caracteres do WCAG internacional). (2) Máximo 2 linhas simultâneas na tela. (3) Duração mínima 1 segundo por legenda (evita “flash” imperceptível). (4) Velocidade de leitura ≤ 17 caracteres por segundo (adaptada ao processamento de leitura em português). (5) Cor amarela sobre fundo preto (contraste tradicional para hearing-impaired), embora outras cores sejam aceitas com contraste suficiente. (6) Identificação de locutor em MAIÚSCULAS seguida de dois-pontos (ex. “MARIA:”). (7) Efeitos sonoros entre colchetes em posição descritiva (ex. “[Aplausos]”, “[Vidro quebrando]”). (8) Música indicada com “♪♪♪” ou “♪ [nome da música] ♪”. (9) Fontes sans-serif (Arial, Helvetica) sem serifas. (10) Posicionamento padrão na base do vídeo, com reposicionamento no topo se conteúdo visual crítico estiver na base. A norma completa está disponível no ABNT Catálogo (a compra do documento oficial custa em torno de R$ 200-300).

Uma IA como VexaScribe pode gerar LSE completa?

Não diretamente. Sendo honesto sobre o que a IA faz e não faz em 2026: (1) IA FAZ bem — transcrição das falas com timestamps, diarização automática (identifica que existem 2, 3, N vozes distintas), geração de SRT/VTT com pontuação e capitalização. Precisão típica em PT-BR: 93-95% (Whisper Large-v3). (2) IA FAZ parcialmente — identificação de nomes de locutores (a IA rotula Speaker 1/2/3, você precisa renomear para JOÃO/MARIA), formatação básica de linha. (3) IA NÃO FAZ automaticamente — inserção de efeitos sonoros entre colchetes (“[Porta bate]”), indicação de música com “♪”, marcação de tom quando ambíguo (“[irônico]”), aplicação de cor amarela e posicionamento ABNT, correção de segmentação para respeitar 32 caracteres/linha, verificação humana de terminologia sensível. Workflow real e honesto: VexaScribe gera a transcrição-base + diarização em 5-10 min por hora de vídeo → um legendista profissional (especialista em LSE) adiciona efeitos sonoros, ajusta formatação para ABNT, e revisa. Tempo total: 3-5 horas por hora de vídeo (vs 15-20 horas do fluxo 100% manual). Economia real: 60-70% de tempo, sem perda de qualidade LSE.

Qual o custo típico de produção de LSE profissional no Brasil?

Em 2026, três faixas de preço (verificado julho de 2026 com serviços brasileiros de referência). (1) Legendagem manual completa (sem IA): R$ 150-300 por hora de vídeo — serviço tradicional de empresas como CPL (cpl.com.br), Videoshack (videoshack.com.br), Somos Inclua (somosinclua.com.br). Prazo típico 5-10 dias úteis. Vantagem: qualidade ABNT garantida por legendista humano especialista. Desvantagem: caro para volume, prazo longo. (2) Workflow híbrido IA + revisão humana: R$ 60-120 por hora de vídeo — IA (VexaScribe US$ 2-20/mês ~ R$ 11-110) gera base + freelancer legendista (R$ 40-80/h) revisa e adiciona formatação ABNT. Prazo 1-2 dias úteis. Vantagem: 60% mais barato, prazo mais curto, qualidade ABNT mantida. Desvantagem: exige contratar/gerenciar freelancer. (3) IA sozinha sem revisão profissional: R$ 5-20 por hora de vídeo (só custo VexaScribe) — funciona para uso interno (treinamentos gravados, uso educacional restrito) mas NÃO atende ABNT para publicação externa nem para conformidade LBI. Para conteúdo publicado externamente (TV, streaming, site institucional, YouTube público comercial), sempre inclua revisão profissional na cadeia.

Quem produz LSE profissional no Brasil?

Panorama honesto do mercado brasileiro de LSE (verificado julho de 2026). Serviços com histórico consolidado: (1) CPL — cpl.com.br — pioneiro em closed caption/LSE no Brasil, atende TV e streaming, preço sob consulta. (2) Videoshack — videoshack.com.br — acessibilidade audiovisual completa (LSE + audiodescrição + Libras), atende produtoras e canais. (3) Somos Inclua — somosinclua.com.br — foco em conteúdo digital corporativo e educacional. (4) 4Estações — 4estacoes.com — serviços de acessibilidade audiovisual. Cooperativas e freelancers: ABLEBRA (Associação Brasileira de Legendistas), Sindicato Nacional dos Tradutores (Sintra), grupos regionais em SP/RJ/POA. VexaScribe se posiciona honestamente como camada de transcrição-base + diarização + export multi-formato — a etapa que reduz o tempo do legendista humano de 15h para 3h por hora de vídeo. Não competimos com CPL/Videoshack/Somos Inclua na entrega final de LSE ABNT-conforme — competimos como ferramenta que os próprios legendistas podem usar para reduzir seu tempo de trabalho.

LGPD e acessibilidade — cuidados com dados de pessoas com deficiência

LGPD (Lei 13.709/2018) trata dados sobre condição de deficiência como “dados sensíveis” (Art. 5 II) — mesma categoria de dados de saúde, orientação sexual e biometria. Isso importa em três cenários. (1) Legendas com informação médica ou terapêutica (ex. sessão de terapia gravada) — não colocar em serviço cloud sem análise de risco específica; considerar Whisper local ou serviço com DPA e hospedagem UE (VexaScribe hospeda em Londres, UK-GDPR). (2) Vídeo com identificação clara de pessoas com deficiência (ex. reportagem, entrevista, aula com estudante com deficiência) — mesmo consentimento adicional necessário além do consentimento geral de gravação, LGPD Art. 11. (3) Metadados sobre uso do recurso de acessibilidade (ex. sistema que registra quais usuários ativam LSE) — potencial identificação indireta de pessoas com deficiência, precisa base legal específica. VexaScribe: hospedagem AWS Londres (UK-GDPR), sem treinamento de IA nos seus áudios, DPA disponível para uso profissional, exclusão sob demanda. Para produção de LSE de conteúdo educacional, jornalístico e institucional (a maioria dos casos), estes cuidados são suficientes.

Audiodescrição é a mesma coisa que LSE?

Não — são recursos complementares para públicos diferentes. LSE (Legenda para Surdos e Ensurdecidos) é para pessoas surdas ou com deficiência auditiva: mostra falas + sons por escrito na tela. Audiodescrição (AD) é para pessoas cegas ou com baixa visão: narra o que está acontecendo visualmente por meio de uma faixa de áudio adicional (ex. “João entra na sala carregando uma mala”, “Maria sorri e balança a cabeça em desaprovação”). AD é produzida por audiodescritor profissional que escreve roteiro descrevendo o visual sem sobrepor às falas, e um locutor grava a narração. Padrão brasileiro: ABNT NBR 16452:2016 para audiodescrição. LBI Art. 67 obriga BOTH em radiodifusão pública. VexaScribe NÃO produz audiodescrição — isso exige análise visual + roteirização + locução, competências fora do escopo de transcrição de fala. Para audiodescrição profissional no Brasil: CPL, Videoshack, e cooperativas de audiodescritores (Associação Brasileira de Audiodescrição).