Mowa na tekst (Whisper)
Darmowa i prywatna zamiana mowy na tekst w przeglądarce. Transkrybuj lub tłumacz audio i wideo z OpenAI Whisper działającym na Twoim urządzeniu — nagraj z mikrofonu i eksportuj TXT lub napisy SRT.
🔒 Działa całkowicie w Twojej przeglądarce — nic nie jest przesyłaneRozpoznawanie mowy Whisper działające na Twoim urządzeniu
To narzędzie zamienia wypowiadane słowa na tekst za pomocą Whisper — otwartego modelu rozpoznawania mowy udostępnionego przez OpenAI. W przeciwieństwie do większości internetowych usług transkrypcji nic nie jest wysyłane na serwer: dźwięk jest dekodowany przez przeglądarkę, przepróbkowywany do 16 kHz mono i przekazywany do modelu w działającym w tle Web Workerze. Strona wybiera najszybszy dostępny silnik — WebGPU na kartach graficznych i w przeglądarkach, które go obsługują, albo WebAssembly na procesorze we wszystkich pozostałych przypadkach. Przy pierwszym uruchomieniu wagi modelu są pobierane z Hugging Face; potem pozostają w pamięci podręcznej przeglądarki, więc kolejne sesje startują znacznie szybciej.
Możesz transkrybować wywiady, wykłady, podcasty, notatki głosowe i nagrania ze spotkań, a także ścieżkę dźwiękową pliku wideo. Krótkie fragmenty nagrasz bezpośrednio z mikrofonu. Długie nagrania są przetwarzane w nakładających się 30-sekundowych oknach, a pasek postępu pokazuje, ile okien zostało już ukończonych. Dzięki temu nawet godzinny wykład da się spisać bez wysyłania go komukolwiek.
Transkrypcje, tłumaczenia i napisy
Wybierz Transcribe, aby otrzymać tekst w oryginalnym języku, lub Translate to English, aby Whisper napisał angielską wersję wypowiedzi w innym języku. Automatyczne wykrywanie analizuje pierwsze 30 sekund, by rozpoznać język; jeśli nagranie zaczyna się od muzyki lub ciszy, samodzielny wybór języka da lepsze wyniki. Włącz znaczniki czasu, aby zobaczyć, kiedy padło każde zdanie, i pobierz plik napisów SRT, który wczytasz do edytorów wideo, YouTube lub odtwarzaczy multimedialnych.
Wskazówki dla dokładnych wyników
Czysty dźwięk ma większe znaczenie niż cokolwiek innego. Nagrywaj blisko mikrofonu, unikaj muzyki w tle i pozwól mówić jednej osobie naraz. Whisper base to kompaktowy model, więc nazwiska, żargon i silne akcenty mogą wymagać szybkiej ręcznej poprawki — zawsze przeczytaj tekst przed publikacją. Jeśli Twoje urządzenie ma mało pamięci, zamknij inne wymagające karty przed transkrypcją długich plików i nie zamykaj tej karty, dopóki transkrypcja nie zostanie ukończona. Przy bardzo długich nagraniach warto podzielić je na kilka krótszych plików i przetwarzać je po kolei.
Jak używać
- Dodaj audioUpuść plik audio lub wideo na pole albo naciśnij „Record from microphone” i zacznij mówić.
- Wybierz język i zadaniePozostaw język na „Auto-detect” lub wybierz go ręcznie, a następnie wybierz „Transcribe” albo „Translate to English”.
- Uruchom WhisperNaciśnij „Transcribe”. Model pobiera się jednorazowo, a potem działa na Twoim urządzeniu, podczas gdy wypełnia się pasek postępu.
- Wyeksportuj tekstW razie potrzeby włącz znaczniki czasu, a następnie skopiuj transkrypcję lub pobierz ją jako plik .txt albo napisy .srt.