Poradnik Windows
Whisper na Windows bez terminala
Whisper to model rozpoznawania mowy, który działa na Twoim komputerze. Klasyczna droga prowadzi przez Pythona, menedżer pakietów, ffmpeg w zmiennej PATH i sterowniki karty graficznej. Nie musi tak być: aplikacja może przynieść to wszystko ze sobą i pobrać model sama. Poniżej, co dokładnie jest potrzebne, który model wybrać i ile miejsca zajmie.
Krótka odpowiedź
Instalujesz ScreenBrief z Microsoft Store, wybierasz model transkrypcji z listy i klikasz pobieranie. Konwerter multimediów jest w paczce z aplikacją, więc nie instalujesz ffmpeg osobno. Nie ma kroku z Pythonem ani z wierszem poleceń.
- Zainstaluj aplikację ze Sklepu i przejdź krótką konfigurację: język, model transkrypcji, opcjonalnie dostawca AI do streszczeń.
- Wybierz model. Konfiguracja kończy się od razu; nie musisz czekać na pobranie, żeby zacząć korzystać z aplikacji.
- Pobierz model teraz w ustawieniach albo zostaw to pierwszej transkrypcji, która pobierze go sama. Rozmiar pliku jest podany przed startem, a pobieranie można przerwać.
- Wczytaj nagranie. Transkrypcja liczy się na Twoim komputerze, a wynik trafia do biblioteki.
Czego nie musisz instalować
- Pythona ani menedżera pakietów. Silnik rozpoznawania mowy jest skompilowany i dołączony do aplikacji.
- ffmpeg. Aplikacja ma własną kopię i sama przygotowuje dźwięk z pliku wideo.
- Sterowników CUDA „na wszelki wypadek”. Transkrypcja działa na procesorze, a wsparcie karty graficznej jest osobną, świadomą decyzją.
- Wiersza poleceń. Nie ma kroku, w którym przepisujesz polecenie z cudzego wpisu na blogu.
To jest właśnie różnica, o którą zwykle chodzi w pytaniu „Whisper bez terminala”. Model i silnik zostają na Twoim dysku tak samo jak przy instalacji ręcznej; zmienia się tylko sposób ich dostarczenia.
Który model wybrać i ile waży
Do wyboru są trzy modele Whispera w formacie GGML. Różnią się rozmiarem pliku, czasem liczenia i jakością na trudnym materiale: szumie, nakładających się głosach, rzadkich nazwach.
- Base, około 150 MB. Najszybszy, podstawowa jakość. Dobry do szybkiego przeglądu długiego nagrania i do słabszych komputerów.
- Small, około 490 MB. Kompromis między szybkością a jakością i domyślny wybór w konfiguracji. Od niego zacznij.
- Large v3 turbo w wersji skwantowanej, około 870 MB. Najlepsza jakość, najdłuższy czas liczenia na procesorze.
Model zmienisz później w ustawieniach; pobrane pliki zostają, więc powrót do mniejszego modelu nie wymaga ponownego pobierania. Przy wolnym łączu zacznij od mniejszego i podmień go, gdy będzie okazja.
Skąd bierze się plik modelu
Model pobiera się z publicznego repozytorium whisper.cpp na Hugging Face, z konkretnej, przypiętej wersji repozytorium, a nie z ruchomej gałęzi. Po pobraniu aplikacja sprawdza sumę kontrolną SHA-256 pliku względem wartości zapisanej w programie.
Dzięki temu podmiana bajtów pod znaną nazwą pliku nie przejdzie niezauważona, a przerwane pobieranie nie zostanie wzięte za kompletny model. Pobieranie możesz zatrzymać przyciskiem; niedokończony plik jest sprzątany.
Kiedy pomaga karta graficzna
Na nowej instalacji na Windows urządzenie transkrypcji jest ustawione na „Automatycznie (zalecane)”, a w ustawieniach widać sekcję „Silnik GPU”. Przycisk „Sprawdź teraz” uruchamia tę samą sondę, której używa przetwarzanie, i mówi, czy karta nadaje się do pracy oraz dlaczego instalacja jest albo nie jest dostępna.
Do wyboru są dwa silniki. Vulkan obejmuje karty NVIDIA, AMD i Intela. CUDA dotyczy kart NVIDIA i wymaga doinstalowania około 2,8 GB zweryfikowanych plików z paczki aplikacji; po restarcie przetwarzania pole „Aktywny silnik” pokazuje, co faktycznie działa.
Bez karty graficznej też się uda, tylko wolniej. Duży model na procesorze potrafi liczyć długo i aplikacja uprzedza o tym w trakcie pracy.
Co zostaje na dysku
Na Twoim komputerze
- Plik modelu Whispera, raz pobrany i używany przy kolejnych transkrypcjach.
- Nagrania w bibliotece aplikacji i policzone z nich transkrypty ze znacznikami czasu.
- Baza aplikacji: streszczenia, decyzje, zadania i historia czatu.
Wychodzi tylko na Twoje życzenie
- Jednorazowe pobranie pliku modelu z Hugging Face przy pierwszym użyciu.
- Tekst transkryptu do zewnętrznego dostawcy AI, jeśli wybierzesz go do streszczeń i czatu zamiast modelu lokalnego.
- Dźwięk do zewnętrznego dostawcy, jeśli zamiast lokalnego Whispera wybierzesz transkrypcję przez API.
Szczegóły opisuje poradnik o transkrypcji bez chmury. Jeśli także streszczenie ma powstać na Twoim komputerze, zobacz poradnik o Ollamie.
Kiedy to nie jest dobry wybór
- Gdy potrzebujesz Whispera w skrypcie albo w potoku na serwerze. Do tego właśnie służy instalacja z wiersza poleceń i nic jej nie zastąpi.
- Gdy chcesz zmieniać parametry dekodowania z ręki przy każdym uruchomieniu. Aplikacja dobiera je sama.
- Gdy pracujesz poza Windows. Poradnik opisuje wersję dla Windows 10 i 11 ze Sklepu.
Sprawdź na własnym nagraniu
Pierwsze 5 transkrypcji jest darmowe, a przy modelu lokalnym nie potrzebujesz żadnego klucza API.
Pobierz z Microsoft StoreOpis dotyczy ScreenBrief 0.7.8. Szczegóły postępowania z danymi: polityka prywatności.