Transkrypcja i AI
Autorec transkrybuje nagrania lokalnie za pomocą whisper.cpp, a opcjonalnie tworzy też podsumowania AI przez dowolne API zgodne z OpenAI.
Jak działa transkrypcja
- Po zakończeniu nagrania autorec wyodrębnia ścieżkę dźwiękową. Dzieje się to samo, jeśli opcja Automatycznie transkrybuj nagrania jest włączona (domyślnie jest wyłączona). W przeciwnym razie uruchom transkrypcję z okna wyświetlanego po nagraniu albo z biblioteki.
- Dźwięk przetwarza wybrany model Whisper, w całości na twoim komputerze
- Obok wideo powstają dwa pliki:
.txt– transkrypcja w postaci zwykłego tekstu.srt– plik napisów ze znacznikami czasu (można go wyłączyć w Ustawieniach)
Podczas transkrypcji żadne dane audio ani wideo nie opuszczają twojego komputera. Transkrypcja korzysta z GPU, jeśli jest dostępne (Vulkan na Linuksie i Windowsie, Metal na macOS), a w przeciwnym razie z procesora. Opcja Wymuś CPU w Ustawieniach pomija GPU.
Języki
Autorec transkrybuje spotkania po polsku i w 16 innych językach: angielskim, niemieckim, hiszpańskim, francuskim, włoskim, portugalskim, niderlandzkim, szwedzkim, tureckim, rosyjskim, ukraińskim, arabskim, hindi, chińskim, japońskim i koreańskim. Język mowy autorec rozpoznaje w pierwszych sekundach nagrania, więc większość rozmów nie wymaga żadnej konfiguracji. Jeśli twoje rozmowy zawsze toczą się w jednym języku, wybierz go w Ustawienia > Transkrypcja, w polu Język mowy. Język ustawiony na stałe chroni przed błędnym rozpoznaniem przy krótkim lub zaszumionym nagraniu albo gdy rozmowa zaczyna się od kilku słów w innym języku.
Wszystkie pięć modeli rozumie każdy z tych języków. W językach innych niż angielski modele medium i large są jednak wyraźnie dokładniejsze od mniejszych.
Modele Whisper
Modele nie pobierają się automatycznie: model wybierasz i pobierasz w Ustawieniach. Są zapisywane w ~/.local/share/autorec/models/ (Linux i macOS) lub w %LOCALAPPDATA%\autorec\models\ (Windows).
| Model | Rozmiar | Szybkość | Dokładność | Najlepszy do |
|---|---|---|---|---|
| tiny | ~75 MB | Najszybszy | Podstawowa | Szybkie notatki, słabsze komputery |
| base | ~142 MB | Szybki | Dobra | Domyślny – polecany dla większości osób |
| small | ~466 MB | Umiarkowany | Lepsza | Gdy dokładność liczy się bardziej niż szybkość |
| medium | ~1,5 GB | Wolny | Wysoka | Języki inne niż angielski, trudne nagrania |
| large | ~3 GB | Najwolniejszy | Najlepsza | Maksymalna dokładność, mocny sprzęt |
Pobieranie modeli
- Otwórz Ustawienia (ikona koła zębatego w oknie autorec)
- Przejdź do sekcji Transkrypcja
- Wybierz rozmiar modelu
- Kliknij Pobierz – model pobiera się raz i służy potem do wszystkich kolejnych transkrypcji
Podsumowania AI
Podsumowania AI korzystają z API w chmurze, żeby na podstawie tekstu transkrypcji utworzyć tytuł i podsumowanie. Wysyłany jest tylko tekst, bez dźwięku i obrazu.
Konfiguracja
- Otwórz Ustawienia > Podsumowanie AI
- W polu Dostawca wybierz usługę (uzupełni to bazowy URL i podpowie modele) albo wybierz Custom i wpisz Bazowy URL API (np.
https://api.openai.com/v1) - Wpisz swój klucz w polu Klucz API
- W polu Model wybierz model (domyślnie
gpt-4o-mini) - Włącz Automatycznie podsumowuj po transkrypcji
Prompt podsumowania można edytować, więc zamiast ogólnego podsumowania możesz prosić o decyzje, zadania do wykonania albo terminy.
Zgodne usługi
Działa każda usługa z endpointem chat completions zgodnym z OpenAI:
- OpenAI –
https://api.openai.com/v1 - OpenRouter –
https://openrouter.ai/api/v1 - Modele lokalne (Ollama, LM Studio itp.) – użyj swojego lokalnego endpointu
Co powstaje
Dla każdego nagrania z transkrypcją autorec tworzy:
- Tytuł – krótki, opisowy tytuł spotkania
- Podsumowanie – zwięzłe streszczenie najważniejszych omówionych kwestii
Oba pojawiają się w bibliotece nagrań i w widoku szczegółów nagrania, więc potrzebne spotkanie łatwo znajdziesz bez ponownego oglądania.