Транскрипція та ШІ
Autorec транскрибує записи локально за допомогою whisper.cpp і, якщо ви захочете, створює підсумки від ШІ через будь-який API, сумісний з OpenAI.
Як працює транскрипція
- Коли запис завершено, autorec витягує з нього звукову доріжку. Це відбувається автоматично, якщо ввімкнено Автоматично транскрибувати записи (типово цей параметр вимкнено); інакше запустіть транскрибування з діалогу після запису або з бібліотеки.
- Вибрана модель Whisper обробляє звук повністю на вашому комп’ютері
- Поруч із відео з’являються два файли:
.txt— транскрипція звичайним текстом.srt— файл субтитрів із часовими мітками (можна вимкнути в налаштуваннях)
Під час транскрибування ні звук, ні відео не залишають вашого комп’ютера. Якщо є GPU, транскрипція виконується на ньому (Vulkan на Linux і Windows, Metal на macOS), якщо ні — на процесорі; параметр Лише CPU в налаштуваннях примусово обходить GPU.
Мови
Autorec транскрибує зустрічі українською та ще 16 мовами: англійською, німецькою, іспанською, французькою, італійською, португальською, нідерландською, польською, шведською, турецькою, російською, арабською, гінді, китайською, японською та корейською. Мову розмови autorec визначає за першими секундами звуку, тож більшість дзвінків не потребує жодного налаштування. Якщо ваші дзвінки завжди однією мовою, виберіть її в полі Мова розмови в розділі Налаштування > Транскрипція. Зафіксована мова вбереже від хибного визначення на короткому чи зашумленому записі або коли дзвінок починається кількома словами іншою мовою.
Усі п’ять моделей розуміють кожну з цих мов. Для будь-якої мови, крім англійської, medium або large помітно точніші за менші моделі.
Моделі Whisper
Моделі не завантажуються автоматично: ви вибираєте модель і завантажуєте її в налаштуваннях. Вони зберігаються в ~/.local/share/autorec/models/ (Linux і macOS) або в %LOCALAPPDATA%\autorec\models\ (Windows).
| Модель | Розмір | Швидкість | Точність | Для чого найкраще |
|---|---|---|---|---|
| tiny | ~75 МБ | Найшвидша | Базова | Швидкі нотатки, слабкі комп’ютери |
| base | ~142 МБ | Швидка | Добра | Типова — підходить більшості користувачів |
| small | ~466 МБ | Помірна | Краща | Коли точність важливіша за швидкість |
| medium | ~1,5 ГБ | Повільна | Висока | Інші мови, крім англійської, складний звук |
| large | ~3 ГБ | Найповільніша | Найкраща | Максимальна точність, потужне обладнання |
Завантаження моделей
- Відкрийте Налаштування — значок шестерні у вікні autorec
- Перейдіть до розділу Транскрипція
- Виберіть розмір моделі
- Натисніть Завантажити — модель завантажується один раз і використовується для всіх наступних транскрипцій
Підсумки від ШІ
Підсумки від ШІ створюються через хмарний API: на основі тексту транскрипції він генерує назву й підсумок. Надсилається лише текст — ні звук, ні відео.
Налаштування
- Відкрийте Налаштування > Підсумок від ШІ
- Виберіть Провайдера — він підставить базову URL-адресу й запропонує моделі — або виберіть Custom і введіть Базову URL-адресу API (наприклад,
https://api.openai.com/v1) - Введіть свій Ключ API
- Виберіть Модель (типово —
gpt-4o-mini) - Увімкніть Автоматично підсумовувати після транскрипції
Промпт для підсумку можна редагувати, тож замість загального підсумку ви можете просити рішення, завдання чи дедлайни.
Сумісні сервіси
Підійде будь-який сервіс з ендпоінтом chat completions, сумісним з OpenAI:
- OpenAI —
https://api.openai.com/v1 - OpenRouter —
https://openrouter.ai/api/v1 - Локальні моделі (Ollama, LM Studio тощо) — вкажіть свій локальний ендпоінт
Що створюється
Для кожного транскрибованого запису autorec створює:
- Назву — коротку й змістовну назву зустрічі
- Підсумок — стислий виклад головних обговорених тем
Обидва відображаються у відеобібліотеці та на сторінці відео, тож потрібну зустріч легко знайти, не переглядаючи її знову.