Poradnik

Transkrypcja spotkania, przy której nagranie nie opuszcza komputera

Napisane 3 września 2026 na podstawie ScreenBrief 0.7.7. Artflow Management.

Transkrypcję nagrania można policzyć w całości na swoim komputerze. Plik wskazujesz aplikacji, która stoi na Twoim dysku, więc nagranie nigdzie nie jedzie: bez konta, bez przesyłania na serwer. Poniżej dokładnie, jak to wygląda w praktyce, co jednak opuszcza komputer i kiedy lepiej wybrać coś innego.

Krótka odpowiedź

Potrzebujesz programu, który ma wbudowany model rozpoznawania mowy i uruchamia go u siebie, a nie na cudzym serwerze. ScreenBrief robi to tak: wskazujesz mu plik audio albo wideo z własnego dysku lub nagrywasz ekran, a transkrypcja liczy się lokalnie, na Twoim procesorze albo karcie graficznej. Nie ma logowania, nie ma konta, a plik nie jest wysyłany na żaden serwer.

  1. Pobierz aplikację i uruchom ją. Nie zakłada konta.
  2. Wskaż aplikacji nagranie leżące na dysku albo nagraj ekran razem z dźwiękiem systemowym.
  3. Pierwsza transkrypcja pobiera model mowy. To jedyny moment, w którym cokolwiek jest ściągane z internetu.
  4. Transkrypt pojawia się z podziałem na mówców i znacznikami czasu, a nagranie zostaje w katalogu na Twoim dysku.
Ten sam materiał po transkrypcji: po lewej transkrypt z mówcami i minutami, po prawej streszczenie wygenerowane z niego.
Ten sam materiał po transkrypcji: po lewej transkrypt z mówcami i minutami, po prawej streszczenie wygenerowane z niego.

Co zostaje na dysku, a co jednak wychodzi

To jest sedno sprawy i miejsce, w którym większość opisów kłamie przez pominięcie. Uczciwy podział wygląda tak:

Zostaje u Ciebie

  • Plik audio albo wideo, w katalogu użytkownika na Twoim dysku
  • Transkrypt i baza SQLite z całą biblioteką
  • Cała transkrypcja, bo liczy się na Twoim sprzęcie
  • Podział na mówców, liczony lokalnie drugim modelem

Opuszcza komputer

  • Jednorazowe pobranie modelu mowy z publicznego repozytorium Hugging Face
  • Jednorazowe pobranie modelu do rozpoznawania mówców
  • Fragmenty transkryptu przy streszczeniach i czacie, jeśli wskażesz zewnętrznego dostawcę AI. Lokalna Ollama nie wysyła nic
  • Cały dźwięk, jeśli sam wybierzesz transkrypcję przez API, na przykład OpenAI, Deepgram, AssemblyAI albo Groq

Dwie ostatnie pozycje po prawej to Twoje decyzje w ustawieniach, nie domyślne zachowanie. Domyślnie transkrypcja jest lokalna, a streszczenia czekają, aż wskażesz dostawcę.

Jaki model się pobiera i ile waży

Model to jedyna rzecz, którą trzeba ściągnąć, i warto wiedzieć, na co się godzisz. Do wyboru są trzy, a domyślnie włączony jest najdokładniejszy:

UstawienieModelRozmiarPo co
Najszybszywhisper base~148 MBsłaby sprzęt, szybki szkic
Kompromiswhisper small~488 MBrównowaga czasu i jakości
Najlepsza jakośćlarge-v3-turbo q8~874 MBustawienie domyślne

Pobranie jest jednorazowe i model zostaje na dysku. Zmiana ustawienia na mniejszy model kosztuje trochę dokładności, głównie na nazwach własnych i skrótach.

Ile to trwa na Twoim sprzęcie

Nie ma sensownej odpowiedzi w minutach, bo zależy od procesora, karty graficznej i długości nagrania. Zamiast wierzyć czyimś benchmarkom, zmierz to raz u siebie: puść domyślny model na jednym krótkim nagraniu i sprawdź, ile zajęło. Dopiero ten jeden pomiar mówi, czy warto zejść na mniejszy model, czy przenieść transkrypcję do zewnętrznego dostawcy.

Karta graficzna jest używana, jeśli ją masz. Szczegóły o obsługiwanych układach są w FAQ na stronie głównej.

Kiedy lokalna transkrypcja nie jest dobrym wyborem

Uczciwie: bywa. Trzy sytuacje, w których lepiej wybrać coś innego:

  • Masz bardzo dużo długich nagrań, potrzebujesz wyniku od razu, a komputer jest słaby. Transkrypcja przez API będzie szybsza, kosztem tego, że dźwięk wychodzi.
  • Pracujesz na maszynie, na której nie możesz zapisać kilkuset megabajtów modelu.
  • Potrzebujesz gwarancji umownej od dostawcy usługi, a nie samego faktu, że plik nie opuszcza komputera.

Transkrypt to dopiero początek

Sam transkrypt rzadko jest celem. Z tego samego nagrania powstają streszczenia, lista podjętych decyzji, zadania oraz czat, który przy każdej odpowiedzi podaje sekundę nagrania, z której ją wziął. Co dokładnie wychodzi z jednego nagrania, pokazuje strona główna, a warunki i ceny są w cenniku.

Sprawdź to na własnym nagraniu

Pierwsze 5 transkrypcji jest darmowe i przy lokalnym modelu nie wymaga żadnego klucza API.

Pobierz z Microsoft Store

Windows 10/11 · darmowe pobranie

Opis dotyczy ScreenBrief 0.7.8. Szczegóły postępowania z danymi: polityka prywatności.