Transkrypcja i AI

Autorec transkrybuje nagrania lokalnie za pomocą whisper.cpp, a opcjonalnie tworzy też podsumowania AI przez dowolne API zgodne z OpenAI.

Jak działa transkrypcja

  1. Po zakończeniu nagrania autorec wyodrębnia ścieżkę dźwiękową. Dzieje się to samo, jeśli opcja Automatycznie transkrybuj nagrania jest włączona (domyślnie jest wyłączona). W przeciwnym razie uruchom transkrypcję z okna wyświetlanego po nagraniu albo z biblioteki.
  2. Dźwięk przetwarza wybrany model Whisper, w całości na twoim komputerze
  3. Obok wideo powstają dwa pliki:
    • .txt – transkrypcja w postaci zwykłego tekstu
    • .srt – plik napisów ze znacznikami czasu (można go wyłączyć w Ustawieniach)

Podczas transkrypcji żadne dane audio ani wideo nie opuszczają twojego komputera. Transkrypcja korzysta z GPU, jeśli jest dostępne (Vulkan na Linuksie i Windowsie, Metal na macOS), a w przeciwnym razie z procesora. Opcja Wymuś CPU w Ustawieniach pomija GPU.

Języki

Autorec transkrybuje spotkania po polsku i w 16 innych językach: angielskim, niemieckim, hiszpańskim, francuskim, włoskim, portugalskim, niderlandzkim, szwedzkim, tureckim, rosyjskim, ukraińskim, arabskim, hindi, chińskim, japońskim i koreańskim. Język mowy autorec rozpoznaje w pierwszych sekundach nagrania, więc większość rozmów nie wymaga żadnej konfiguracji. Jeśli twoje rozmowy zawsze toczą się w jednym języku, wybierz go w Ustawienia > Transkrypcja, w polu Język mowy. Język ustawiony na stałe chroni przed błędnym rozpoznaniem przy krótkim lub zaszumionym nagraniu albo gdy rozmowa zaczyna się od kilku słów w innym języku.

Wszystkie pięć modeli rozumie każdy z tych języków. W językach innych niż angielski modele medium i large są jednak wyraźnie dokładniejsze od mniejszych.

Modele Whisper

Modele nie pobierają się automatycznie: model wybierasz i pobierasz w Ustawieniach. Są zapisywane w ~/.local/share/autorec/models/ (Linux i macOS) lub w %LOCALAPPDATA%\autorec\models\ (Windows).

ModelRozmiarSzybkośćDokładnośćNajlepszy do
tiny~75 MBNajszybszyPodstawowaSzybkie notatki, słabsze komputery
base~142 MBSzybkiDobraDomyślny – polecany dla większości osób
small~466 MBUmiarkowanyLepszaGdy dokładność liczy się bardziej niż szybkość
medium~1,5 GBWolnyWysokaJęzyki inne niż angielski, trudne nagrania
large~3 GBNajwolniejszyNajlepszaMaksymalna dokładność, mocny sprzęt

Pobieranie modeli

  1. Otwórz Ustawienia (ikona koła zębatego w oknie autorec)
  2. Przejdź do sekcji Transkrypcja
  3. Wybierz rozmiar modelu
  4. Kliknij Pobierz – model pobiera się raz i służy potem do wszystkich kolejnych transkrypcji

Podsumowania AI

Podsumowania AI korzystają z API w chmurze, żeby na podstawie tekstu transkrypcji utworzyć tytuł i podsumowanie. Wysyłany jest tylko tekst, bez dźwięku i obrazu.

Konfiguracja

  1. Otwórz Ustawienia > Podsumowanie AI
  2. W polu Dostawca wybierz usługę (uzupełni to bazowy URL i podpowie modele) albo wybierz Custom i wpisz Bazowy URL API (np. https://api.openai.com/v1)
  3. Wpisz swój klucz w polu Klucz API
  4. W polu Model wybierz model (domyślnie gpt-4o-mini)
  5. Włącz Automatycznie podsumowuj po transkrypcji

Prompt podsumowania można edytować, więc zamiast ogólnego podsumowania możesz prosić o decyzje, zadania do wykonania albo terminy.

Zgodne usługi

Działa każda usługa z endpointem chat completions zgodnym z OpenAI:

  • OpenAIhttps://api.openai.com/v1
  • OpenRouterhttps://openrouter.ai/api/v1
  • Modele lokalne (Ollama, LM Studio itp.) – użyj swojego lokalnego endpointu

Co powstaje

Dla każdego nagrania z transkrypcją autorec tworzy:

  • Tytuł – krótki, opisowy tytuł spotkania
  • Podsumowanie – zwięzłe streszczenie najważniejszych omówionych kwestii

Oba pojawiają się w bibliotece nagrań i w widoku szczegółów nagrania, więc potrzebne spotkanie łatwo znajdziesz bez ponownego oglądania.