Voz de IA grátis para narrar vídeos: passo a passo com o edge-tts
Narração em português do Brasil, sem mensalidade e sem cadastro. Com os comandos prontos pra copiar, as duas checagens que salvam o vídeo e as letras miúdas que ninguém conta.
A versão de um café
- O edge-tts é um programa gratuito que gera narração com as vozes do Microsoft Edge.
- Em português do Brasil são 3 vozes: uma masculina e duas femininas.
- Ele entrega o áudio e a legenda com o tempo de cada frase.
- Duas checagens evitam refazer o vídeo: silêncio fora de lugar e volume desigual.
- O serviço é da Microsoft e pode mudar. Tenha um plano B.
O que é o edge-tts
O navegador Microsoft Edge tem um recurso de leitura em voz alta, com vozes neurais que soam bem naturais. O edge-tts é um programa de código aberto que usa esse mesmo serviço pela internet e grava o resultado num arquivo de áudio.
Ele não pede cadastro nem chave de acesso, e não precisa do Edge instalado. Funciona em Windows, Mac e Linux. Os comandos deste guia foram testados no Windows 11, com a versão 7.2.8 do edge-tts.
O edge-tts não é um produto da Microsoft. É um projeto independente que conversa com um serviço dela. A Microsoft pode mudar esse serviço, limitar o uso ou tirar do ar quando quiser, sem avisar ninguém. Para um canal, isso quer dizer: ótimo pra começar, arriscado como única opção.
Instalar, em 3 comandos
Abra o Prompt de Comando do Windows (tecla Windows, digite cmd, Enter) e rode um comando por vez:
winget install Python.Python.3.12
winget install Gyan.FFmpeg
pip install edge-tts
O primeiro instala o Python, que roda o edge-tts. O segundo instala o FFmpeg, que a gente usa nas checagens. O terceiro instala o edge-tts. Depois dos dois primeiros, feche e abra o Prompt de Comando de novo, pra ele enxergar os programas novos.
Seu Windows não tem o winget? Baixe o Python em python.org e o FFmpeg pela página oficial de download.
Ouvir as vozes em português
Este comando lista só as vozes do Brasil:
edge-tts --list-voices | findstr pt-BR
Na data deste guia, a resposta é esta:
| Voz | Tipo |
|---|---|
pt-BR-AntonioNeural | masculina |
pt-BR-FranciscaNeural | feminina |
pt-BR-ThalitaMultilingualNeural | feminina |
Pra ouvir uma delas, gere uma frase de teste e abra o arquivo:
edge-tts --voice pt-BR-AntonioNeural --text "Teste de voz. Um, dois, três." --write-media teste.mp3
Gerar a narração em blocos
Não gere o roteiro inteiro de uma vez. Divida em blocos de 1 a 2 minutos e salve cada um num arquivo de texto: bloco01.txt, bloco02.txt e assim por diante. Bloco curto falha menos. E se um falhar, você refaz só aquele pedaço.
Depois, um comando por bloco:
edge-tts --voice pt-BR-AntonioNeural --file bloco01.txt --write-media bloco01.mp3 --write-subtitles bloco01.srt
Saem dois arquivos: o áudio (.mp3) e a legenda (.srt), já com o tempo de cada frase.
Três cuidados no texto que fazem diferença na fala:
- Número por extenso. Escreva “oito minutos”, não “8 min”.
- Pontuação é respiração. Frase longa sem vírgula sai corrida.
- Palavra estrangeira engana a voz. Se ela ler errado, escreva do jeito que se fala. “Thumbnail” pode virar “tâmbneil” no texto da narração. Na legenda, você corrige de volta.
Quer a fala um pouco mais rápida ou mais lenta? Acrescente --rate=+5% ou --rate=-5% ao comando.
Checagem 1: caça ao silêncio
Voz de IA às vezes trava, corta o fim da frase ou deixa um buraco no meio do bloco. Ouvir tudo resolve, mas cansa. O FFmpeg acha os buracos sozinho:
ffmpeg -hide_banner -i bloco01.mp3 -af silencedetect=noise=-35dB:d=1.5 -f null - 2>&1 | findstr silence_
O filtro silencedetect avisa toda vez que o som fica abaixo de um nível (noise) por mais tempo que o combinado (d, em segundos). A pausa normal entre duas frases fica perto de 1 segundo. Por isso o comando procura silêncio de 1,5 segundo ou mais.
- Não apareceu nada: o bloco está limpo.
- Apareceu
silence_start: ouça aquele ponto. Se for buraco, gere o bloco de novo.
Checagem 2: volume igual em todos os blocos
Cada bloco sai num volume um pouco diferente. No vídeo pronto, isso vira aquele sobe e desce que faz a pessoa caçar o botão de volume. O filtro loudnorm do FFmpeg leva todos os blocos para o mesmo alvo:
ffmpeg -hide_banner -i bloco01.mp3 -af loudnorm=I=-14:TP=-1.5:LRA=11 -ar 48000 bloco01_ok.wav
O I=-14 é o alvo de volume, em LUFS. O TP=-1.5 é o teto do pico, pra voz não estourar. Pra medir como ficou:
ffmpeg -hide_banner -i bloco01_ok.wav -af loudnorm=print_format=summary -f null - 2>&1 | findstr /C:"Input Integrated"
No nosso teste, um bloco que saiu do edge-tts em -21 LUFS foi para perto de -15. Em trecho muito curto o filtro erra por volta de 1 LUFS. O que importa é que todos os blocos fiquem no mesmo nível.
É o alvo que a gente usa na fábrica do canal, e o número mais citado por quem trabalha com áudio para o YouTube. O YouTube não publica esse valor na Ajuda oficial, então trate como referência de mercado, não como regra.
A legenda que vem de brinde
O arquivo .srt que o edge-tts gera já tem o texto e o tempo de cada frase. No YouTube Studio, ele entra em Legendas, na opção de arquivo com marcação de tempo.
Se você montar o vídeo juntando os blocos, o tempo de cada legenda muda, porque cada bloco começa do zero. Aí são dois caminhos: somar a duração dos blocos anteriores ao tempo de cada arquivo, ou gerar a legenda de novo em cima do áudio final.
Precisa avisar no YouTube que a voz é de IA?
A política de transparência sobre conteúdo de IA pede a declaração quando o vídeo tem conteúdo realista gerado ou muito alterado por IA. O exemplo que envolve voz é o de fazer uma pessoa real parecer dizer o que ela não disse.
Narração com voz sintética genérica não aparece na lista do que precisa ser declarado. Mesmo assim, o canal avisa na descrição e no próprio vídeo. Custa uma linha, e ninguém se sente enganado.
Limites e plano B
- Precisa de internet. A voz é gerada num servidor, não no seu computador.
- Pode mudar sem aviso. É o ponto da caixa vermelha lá em cima.
- São poucas vozes. Muita gente usa as mesmas. O que diferencia o seu vídeo é o roteiro, não o timbre.
- Emoção é limitada. A voz lê bem, mas não interpreta. Texto com ritmo ajuda mais do que qualquer ajuste.
O plano B é ter uma segunda opção testada antes de precisar dela. O mapa do canal lista, na etapa de narração, o ElevenLabs e o Gemini TTS como alternativas. As que o canal usa estão em ferramentas.
Dá pra pular essa parte?
Dá pra fazer tudo isso na mão, e funciona. Se você cansar de repetir os comandos a cada vídeo, o Motor Simples é o programa do canal que faz a narração, as cenas, a montagem com o volume igualado e a legenda a partir do roteiro. Ele é pago e usa a mesma voz deste guia, com as mesmas letras miúdas.
Não quer comprar nada? Tudo certo. Os comandos aí de cima são seus.
Fontes
Conferidas em 29/09/2026. Regra e preço mudam: se o link disser outra coisa, vale o link.