AT AI Tools

Tal till text (Whisper)

Gratis och privat tal till text i webbläsaren. Transkribera eller översätt ljud och video med OpenAI Whisper direkt på din enhet – spela in med mikrofonen och exportera TXT eller SRT.

🔒 Körs helt i din webbläsare — ingenting laddas upp

Drop an audio or video file here or click to browse

No audio selected.

The first run downloads the Whisper base model (about 77 MB, or about 200 MB with WebGPU) from Hugging Face. It is cached for next time, and your audio never leaves this device.

Advertisement

Whisper-taligenkänning som körs på din enhet

Det här verktyget omvandlar tal till text med Whisper, den öppna taligenkänningsmodellen som OpenAI har släppt. Till skillnad från de flesta transkriberingstjänster på nätet skickas ingenting till en server: webbläsaren avkodar ljudet, samplar om det till 16 kHz mono och skickar det till modellen i en Web Worker i bakgrunden. Sidan väljer den snabbaste motorn som finns – WebGPU på grafikkort och i webbläsare som stöder det, annars WebAssembly på processorn. Första gången laddas modellvikterna ned från Hugging Face; därefter ligger de kvar i webbläsarens cache, så att senare sessioner startar mycket snabbare.

Du kan transkribera intervjuer, föreläsningar, poddar, röstmemon och mötesinspelningar, eller ljudspåret i en videofil. Korta klipp kan spelas in direkt med mikrofonen. Långa inspelningar bearbetas i överlappande fönster på 30 sekunder, och förloppsindikatorn visar hur många fönster som är klara. Eftersom allt sker lokalt passar verktyget även för konfidentiella inspelningar som du inte vill lämna över till en molntjänst.

Transkriptioner, översättningar och undertexter

Välj Transcribe för att få text på originalspråket eller Translate to English för att låta Whisper skriva en engelsk version av tal på ett annat språk. ”Auto-detect” lyssnar på de första 30 sekunderna för att identifiera språket; om inspelningen börjar med musik eller tystnad blir resultatet bättre om du väljer språket själv. Slå på tidsstämplar för att se när varje mening sades, och ladda ned en SRT-undertextfil som du kan använda i videoredigerare, på YouTube eller i mediaspelare.

Tips för exakta resultat

Tydligt ljud är viktigare än allt annat. Spela in nära mikrofonen, undvik bakgrundsmusik och låt en person i taget prata. Whisper base är en kompakt modell, så namn, facktermer och kraftiga brytningar kan behöva en snabb manuell rättning – korrekturläs alltid innan du publicerar. Om din enhet har lite minne, stäng andra tunga flikar innan du transkriberar långa filer, och håll den här fliken öppen tills transkriptionen är klar. Använd gärna en extern mikrofon eller ett headset om du spelar in i ett rum med eko.

Hur man använder

  1. Lägg till ljudSläpp en ljud- eller videofil i rutan, eller tryck på ”Record from microphone” och börja prata.
  2. Välj språk och uppgiftLåt språket stå på ”Auto-detect” eller välj det själv, och välj sedan ”Transcribe” eller ”Translate to English”.
  3. Kör WhisperTryck på ”Transcribe”. Modellen laddas ned en gång och körs sedan på din enhet medan förloppsindikatorn fylls.
  4. Exportera textenSlå på tidsstämplar om du behöver dem och kopiera sedan transkriptionen eller ladda ned den som .txt-fil eller .srt-undertexter.

Vanliga frågor

Laddas mitt ljud upp till en server?
Nej. Ljudet avkodas och transkriberas i din webbläsare. Det enda som laddas ned är själva Whisper-modellen, som hämtas från Hugging Face första gången och sedan cachas på din enhet.
Hur stor är modellen och hur lång tid tar det?
Whisper base är ungefär 77 MB med WebAssembly (processor) och ungefär 200 MB när WebGPU används. Efter första körningen laddas den från webbläsarens cache. På en modern bärbar dator tar en minut ljud oftast bara några sekunder med WebGPU och längre på processorn.
Vilka språk stöds?
Whisper känner igen ungefär 100 språk. Listan innehåller de vanligaste, bland annat engelska, spanska, tyska, franska, italienska, portugisiska, nederländska, svenska, polska, ukrainska och ryska. ”Auto-detect” gissar språket utifrån de första 30 sekunderna.
Vad gör ”Translate to English”?
Whisper lyssnar på tal på vilket språk som helst som stöds och skriver den engelska översättningen direkt, utan ett separat översättningssteg. Tidsstämplar och SRT-export fungerar på samma sätt.
Vilka filformat fungerar?
Allt som din webbläsare kan avkoda: vanligtvis MP3, WAV, M4A/AAC, OGG, Opus, FLAC och ljudspåret i MP4- eller WebM-videor. Om en fil inte fungerar kan du konvertera den till MP3 eller WAV och försöka igen.
Advertisement