AT AI Tools

Voz para texto (Whisper)

Transcrição de voz gratuita e privada no seu navegador. Transcreva ou traduza áudio e vídeo com o OpenAI Whisper no seu dispositivo, grave pelo microfone e exporte em TXT ou legendas SRT.

🔒 Executa completamente no seu navegador — nada é enviado

Drop an audio or video file here or click to browse

No audio selected.

The first run downloads the Whisper base model (about 77 MB, or about 200 MB with WebGPU) from Hugging Face. It is cached for next time, and your audio never leaves this device.

Advertisement

Reconhecimento de voz Whisper executado no seu dispositivo

Esta ferramenta transforma palavras faladas em texto com o Whisper, o modelo aberto de reconhecimento de voz lançado pela OpenAI. Ao contrário da maioria dos serviços de transcrição online, nada é enviado para um servidor: o áudio é descodificado pelo navegador, reamostrado para 16 kHz mono e entregue ao modelo num Web Worker em segundo plano. A página escolhe o motor mais rápido disponível: WebGPU nas placas gráficas e nos navegadores que o suportam, ou WebAssembly na CPU em todos os outros casos. Na primeira utilização, os pesos do modelo são transferidos do Hugging Face; a partir daí ficam na cache do navegador, pelo que as sessões seguintes arrancam muito mais depressa.

Pode transcrever entrevistas, aulas, podcasts, notas de voz e gravações de reuniões, ou a faixa de áudio de um ficheiro de vídeo. Os clipes curtos podem ser gravados diretamente a partir do microfone. As gravações longas são processadas em janelas sobrepostas de 30 segundos, e a barra de progresso mostra quantas janelas já estão concluídas.

Transcrições, traduções e legendas

Escolha Transcribe para obter o texto no idioma original ou Translate to English para que o Whisper escreva uma versão em inglês de uma fala noutro idioma. A deteção automática ouve os primeiros 30 segundos para identificar o idioma; se a gravação começar com música ou silêncio, selecionar o idioma manualmente dá melhores resultados. Ative os carimbos de tempo para ver quando cada frase foi dita e transfira um ficheiro de legendas SRT que pode carregar em editores de vídeo, no YouTube ou em leitores multimédia.

Dicas para resultados precisos

Um áudio nítido importa mais do que qualquer outra coisa. Grave perto do microfone, evite música de fundo e deixe falar uma pessoa de cada vez. O Whisper base é um modelo compacto, por isso nomes, jargão técnico e sotaques fortes podem precisar de uma rápida correção manual: reveja sempre o texto antes de o publicar. Se o seu dispositivo tiver pouca memória, feche outros separadores pesados antes de transcrever ficheiros longos e mantenha este separador aberto até a transcrição estar concluída.

Como usar

  1. Adicione o áudioArraste um ficheiro de áudio ou vídeo para a caixa, ou prima «Record from microphone» e fale.
  2. Escolha o idioma e a tarefaDeixe o idioma em «Auto-detect» ou selecione-o e depois escolha «Transcribe» ou «Translate to English».
  3. Execute o WhisperPrima «Transcribe». O modelo é transferido uma única vez e depois é executado no seu dispositivo enquanto a barra de progresso enche.
  4. Exporte o textoAtive os carimbos de tempo se precisar deles e depois copie a transcrição ou transfira-a como .txt ou como legendas .srt.

Perguntas frequentes

O meu áudio é enviado para um servidor?
Não. O áudio é descodificado e transcrito dentro do seu navegador. A única transferência é o próprio modelo Whisper, que vem do Hugging Face na primeira vez e fica depois guardado na cache do seu dispositivo.
Qual é o tamanho do modelo e quanto tempo demora?
O Whisper base tem cerca de 77 MB com WebAssembly (CPU) e cerca de 200 MB quando é usado o WebGPU. Após a primeira utilização, é carregado a partir da cache do navegador. Num portátil moderno, um minuto de áudio demora normalmente alguns segundos com WebGPU e mais tempo na CPU.
Que idiomas são suportados?
O Whisper reconhece cerca de 100 idiomas. A lista apresenta os mais comuns, incluindo inglês, espanhol, alemão, francês, italiano, português, neerlandês, sueco, polaco, ucraniano e russo. «Auto-detect» identifica o idioma a partir dos primeiros 30 segundos.
O que faz «Translate to English»?
O Whisper ouve a fala em qualquer idioma suportado e escreve diretamente a tradução em inglês, sem um passo de tradução separado. Os carimbos de tempo e a exportação SRT funcionam da mesma forma.
Que formatos de ficheiro funcionam?
Tudo o que o seu navegador conseguir descodificar: normalmente MP3, WAV, M4A/AAC, OGG, Opus, FLAC e a faixa de áudio de vídeos MP4 ou WebM. Se um ficheiro falhar, converta-o para MP3 ou WAV e tente novamente.
Advertisement