Poradnik Windows

Whisper na Windows bez terminala

Napisane 11 września 2026 na podstawie ScreenBrief 0.7.8. Artflow Management.

Whisper to model rozpoznawania mowy, który działa na Twoim komputerze. Klasyczna droga prowadzi przez Pythona, menedżer pakietów, ffmpeg w zmiennej PATH i sterowniki karty graficznej. Nie musi tak być: aplikacja może przynieść to wszystko ze sobą i pobrać model sama. Poniżej, co dokładnie jest potrzebne, który model wybrać i ile miejsca zajmie.

Krótka odpowiedź

Instalujesz ScreenBrief z Microsoft Store, wybierasz model transkrypcji z listy i klikasz pobieranie. Konwerter multimediów jest w paczce z aplikacją, więc nie instalujesz ffmpeg osobno. Nie ma kroku z Pythonem ani z wierszem poleceń.

  1. Zainstaluj aplikację ze Sklepu i przejdź krótką konfigurację: język, model transkrypcji, opcjonalnie dostawca AI do streszczeń.
  2. Wybierz model. Konfiguracja kończy się od razu; nie musisz czekać na pobranie, żeby zacząć korzystać z aplikacji.
  3. Pobierz model teraz w ustawieniach albo zostaw to pierwszej transkrypcji, która pobierze go sama. Rozmiar pliku jest podany przed startem, a pobieranie można przerwać.
  4. Wczytaj nagranie. Transkrypcja liczy się na Twoim komputerze, a wynik trafia do biblioteki.
Biblioteka z gotowymi nagraniami: lista, typ, czas trwania i status. Cała praca odbywa się w oknie aplikacji.
Biblioteka z gotowymi nagraniami: lista, typ, czas trwania i status. Cała praca odbywa się w oknie aplikacji.

Czego nie musisz instalować

  • Pythona ani menedżera pakietów. Silnik rozpoznawania mowy jest skompilowany i dołączony do aplikacji.
  • ffmpeg. Aplikacja ma własną kopię i sama przygotowuje dźwięk z pliku wideo.
  • Sterowników CUDA „na wszelki wypadek”. Transkrypcja działa na procesorze, a wsparcie karty graficznej jest osobną, świadomą decyzją.
  • Wiersza poleceń. Nie ma kroku, w którym przepisujesz polecenie z cudzego wpisu na blogu.

To jest właśnie różnica, o którą zwykle chodzi w pytaniu „Whisper bez terminala”. Model i silnik zostają na Twoim dysku tak samo jak przy instalacji ręcznej; zmienia się tylko sposób ich dostarczenia.

Który model wybrać i ile waży

Do wyboru są trzy modele Whispera w formacie GGML. Różnią się rozmiarem pliku, czasem liczenia i jakością na trudnym materiale: szumie, nakładających się głosach, rzadkich nazwach.

  • Base, około 150 MB. Najszybszy, podstawowa jakość. Dobry do szybkiego przeglądu długiego nagrania i do słabszych komputerów.
  • Small, około 490 MB. Kompromis między szybkością a jakością i domyślny wybór w konfiguracji. Od niego zacznij.
  • Large v3 turbo w wersji skwantowanej, około 870 MB. Najlepsza jakość, najdłuższy czas liczenia na procesorze.

Model zmienisz później w ustawieniach; pobrane pliki zostają, więc powrót do mniejszego modelu nie wymaga ponownego pobierania. Przy wolnym łączu zacznij od mniejszego i podmień go, gdy będzie okazja.

Skąd bierze się plik modelu

Model pobiera się z publicznego repozytorium whisper.cpp na Hugging Face, z konkretnej, przypiętej wersji repozytorium, a nie z ruchomej gałęzi. Po pobraniu aplikacja sprawdza sumę kontrolną SHA-256 pliku względem wartości zapisanej w programie.

Dzięki temu podmiana bajtów pod znaną nazwą pliku nie przejdzie niezauważona, a przerwane pobieranie nie zostanie wzięte za kompletny model. Pobieranie możesz zatrzymać przyciskiem; niedokończony plik jest sprzątany.

Kiedy pomaga karta graficzna

Na nowej instalacji na Windows urządzenie transkrypcji jest ustawione na „Automatycznie (zalecane)”, a w ustawieniach widać sekcję „Silnik GPU”. Przycisk „Sprawdź teraz” uruchamia tę samą sondę, której używa przetwarzanie, i mówi, czy karta nadaje się do pracy oraz dlaczego instalacja jest albo nie jest dostępna.

Do wyboru są dwa silniki. Vulkan obejmuje karty NVIDIA, AMD i Intela. CUDA dotyczy kart NVIDIA i wymaga doinstalowania około 2,8 GB zweryfikowanych plików z paczki aplikacji; po restarcie przetwarzania pole „Aktywny silnik” pokazuje, co faktycznie działa.

Bez karty graficznej też się uda, tylko wolniej. Duży model na procesorze potrafi liczyć długo i aplikacja uprzedza o tym w trakcie pracy.

Co zostaje na dysku

Na Twoim komputerze

  • Plik modelu Whispera, raz pobrany i używany przy kolejnych transkrypcjach.
  • Nagrania w bibliotece aplikacji i policzone z nich transkrypty ze znacznikami czasu.
  • Baza aplikacji: streszczenia, decyzje, zadania i historia czatu.

Wychodzi tylko na Twoje życzenie

  • Jednorazowe pobranie pliku modelu z Hugging Face przy pierwszym użyciu.
  • Tekst transkryptu do zewnętrznego dostawcy AI, jeśli wybierzesz go do streszczeń i czatu zamiast modelu lokalnego.
  • Dźwięk do zewnętrznego dostawcy, jeśli zamiast lokalnego Whispera wybierzesz transkrypcję przez API.

Szczegóły opisuje poradnik o transkrypcji bez chmury. Jeśli także streszczenie ma powstać na Twoim komputerze, zobacz poradnik o Ollamie.

Kiedy to nie jest dobry wybór

  • Gdy potrzebujesz Whispera w skrypcie albo w potoku na serwerze. Do tego właśnie służy instalacja z wiersza poleceń i nic jej nie zastąpi.
  • Gdy chcesz zmieniać parametry dekodowania z ręki przy każdym uruchomieniu. Aplikacja dobiera je sama.
  • Gdy pracujesz poza Windows. Poradnik opisuje wersję dla Windows 10 i 11 ze Sklepu.

Sprawdź na własnym nagraniu

Pierwsze 5 transkrypcji jest darmowe, a przy modelu lokalnym nie potrzebujesz żadnego klucza API.

Pobierz z Microsoft Store

Windows 10/11 · darmowe pobranie

Opis dotyczy ScreenBrief 0.7.8. Szczegóły postępowania z danymi: polityka prywatności.