AT AI Tools

Da voce a testo (Whisper)

Trascrizione vocale gratuita e privata nel browser. Trascrivi o traduci audio e video con OpenAI Whisper sul tuo dispositivo, registra dal microfono ed esporta in TXT o sottotitoli SRT.

🔒 Funziona interamente nel tuo browser — nulla viene caricato

Drop an audio or video file here or click to browse

No audio selected.

The first run downloads the Whisper base model (about 77 MB, or about 200 MB with WebGPU) from Hugging Face. It is cached for next time, and your audio never leaves this device.

Advertisement

Riconoscimento vocale Whisper eseguito sul tuo dispositivo

Questo strumento trasforma le parole pronunciate in testo con Whisper, il modello open source di riconoscimento vocale rilasciato da OpenAI. A differenza della maggior parte dei servizi di trascrizione online, nulla viene inviato a un server: l'audio viene decodificato dal browser, ricampionato a 16 kHz mono e passato al modello in un Web Worker in background. La pagina sceglie il motore più veloce disponibile: WebGPU sulle schede grafiche e sui browser che lo supportano, oppure WebAssembly sulla CPU in tutti gli altri casi. Al primo utilizzo i pesi del modello vengono scaricati da Hugging Face; da quel momento restano nella cache del browser, quindi le sessioni successive partono molto più rapidamente.

Puoi trascrivere interviste, lezioni, podcast, memo vocali e registrazioni di riunioni, oppure la traccia audio di un file video. Le clip brevi possono essere registrate direttamente dal microfono. Le registrazioni lunghe vengono elaborate in finestre sovrapposte di 30 secondi e la barra di avanzamento mostra quante finestre sono già completate.

Trascrizioni, traduzioni e sottotitoli

Scegli Transcribe per ottenere il testo nella lingua originale oppure Translate to English per far scrivere a Whisper una versione inglese di un parlato in un'altra lingua. Il rilevamento automatico ascolta i primi 30 secondi per identificare la lingua; se la registrazione inizia con musica o silenzio, selezionare tu stesso la lingua dà risultati migliori. Attiva i timestamp per vedere quando è stata pronunciata ogni frase e scarica un file di sottotitoli SRT da caricare in editor video, su YouTube o nei lettori multimediali.

Consigli per risultati accurati

Un audio chiaro conta più di ogni altra cosa. Registra vicino al microfono, evita la musica di sottofondo e fai parlare una persona alla volta. Whisper base è un modello compatto, quindi nomi, termini tecnici e accenti marcati potrebbero richiedere una rapida correzione manuale: rileggi sempre prima di pubblicare. Se il tuo dispositivo ha poca memoria, chiudi le altre schede pesanti prima di trascrivere file lunghi e tieni aperta questa scheda finché la trascrizione non è completa.

Come usare

  1. Aggiungi l'audioTrascina un file audio o video nel riquadro, oppure premi «Record from microphone» e parla.
  2. Scegli lingua e operazioneLascia la lingua su «Auto-detect» o selezionala, poi scegli «Transcribe» o «Translate to English».
  3. Avvia WhisperPremi «Transcribe». Il modello viene scaricato una sola volta, poi funziona sul tuo dispositivo mentre la barra di avanzamento si riempie.
  4. Esporta il testoAttiva i timestamp se ti servono, poi copia la trascrizione o scaricala come .txt o come sottotitoli .srt.

Domande frequenti

Il mio audio viene caricato su un server?
No. L'audio viene decodificato e trascritto all'interno del browser. L'unico download è il modello Whisper stesso, che arriva da Hugging Face la prima volta e viene poi memorizzato nella cache del dispositivo.
Quanto è grande il modello e quanto tempo richiede?
Whisper base pesa circa 77 MB con WebAssembly (CPU) e circa 200 MB quando si usa WebGPU. Dopo il primo utilizzo viene caricato dalla cache del browser. Su un portatile moderno un minuto di audio richiede di solito pochi secondi con WebGPU e più tempo sulla CPU.
Quali lingue sono supportate?
Whisper riconosce circa 100 lingue. L'elenco propone le più comuni, tra cui inglese, spagnolo, tedesco, francese, italiano, portoghese, olandese, svedese, polacco, ucraino e russo. «Auto-detect» individua la lingua dai primi 30 secondi.
Cosa fa «Translate to English»?
Whisper ascolta il parlato in qualsiasi lingua supportata e scrive direttamente la traduzione inglese, senza un passaggio di traduzione separato. Timestamp ed esportazione SRT funzionano allo stesso modo.
Quali formati di file funzionano?
Tutto ciò che il browser è in grado di decodificare: di solito MP3, WAV, M4A/AAC, OGG, Opus, FLAC e la traccia audio dei video MP4 o WebM. Se un file non funziona, convertilo in MP3 o WAV e riprova.
Advertisement