Транскрипція та ШІ

Autorec транскрибує записи локально за допомогою whisper.cpp і, якщо ви захочете, створює підсумки від ШІ через будь-який API, сумісний з OpenAI.

Як працює транскрипція

  1. Коли запис завершено, autorec витягує з нього звукову доріжку. Це відбувається автоматично, якщо ввімкнено Автоматично транскрибувати записи (типово цей параметр вимкнено); інакше запустіть транскрибування з діалогу після запису або з бібліотеки.
  2. Вибрана модель Whisper обробляє звук повністю на вашому комп’ютері
  3. Поруч із відео з’являються два файли:
    • .txt — транскрипція звичайним текстом
    • .srt — файл субтитрів із часовими мітками (можна вимкнути в налаштуваннях)

Під час транскрибування ні звук, ні відео не залишають вашого комп’ютера. Якщо є GPU, транскрипція виконується на ньому (Vulkan на Linux і Windows, Metal на macOS), якщо ні — на процесорі; параметр Лише CPU в налаштуваннях примусово обходить GPU.

Мови

Autorec транскрибує зустрічі українською та ще 16 мовами: англійською, німецькою, іспанською, французькою, італійською, португальською, нідерландською, польською, шведською, турецькою, російською, арабською, гінді, китайською, японською та корейською. Мову розмови autorec визначає за першими секундами звуку, тож більшість дзвінків не потребує жодного налаштування. Якщо ваші дзвінки завжди однією мовою, виберіть її в полі Мова розмови в розділі Налаштування > Транскрипція. Зафіксована мова вбереже від хибного визначення на короткому чи зашумленому записі або коли дзвінок починається кількома словами іншою мовою.

Усі п’ять моделей розуміють кожну з цих мов. Для будь-якої мови, крім англійської, medium або large помітно точніші за менші моделі.

Моделі Whisper

Моделі не завантажуються автоматично: ви вибираєте модель і завантажуєте її в налаштуваннях. Вони зберігаються в ~/.local/share/autorec/models/ (Linux і macOS) або в %LOCALAPPDATA%\autorec\models\ (Windows).

МодельРозмірШвидкістьТочністьДля чого найкраще
tiny~75 МБНайшвидшаБазоваШвидкі нотатки, слабкі комп’ютери
base~142 МБШвидкаДобраТипова — підходить більшості користувачів
small~466 МБПомірнаКращаКоли точність важливіша за швидкість
medium~1,5 ГБПовільнаВисокаІнші мови, крім англійської, складний звук
large~3 ГБНайповільнішаНайкращаМаксимальна точність, потужне обладнання

Завантаження моделей

  1. Відкрийте Налаштування — значок шестерні у вікні autorec
  2. Перейдіть до розділу Транскрипція
  3. Виберіть розмір моделі
  4. Натисніть Завантажити — модель завантажується один раз і використовується для всіх наступних транскрипцій

Підсумки від ШІ

Підсумки від ШІ створюються через хмарний API: на основі тексту транскрипції він генерує назву й підсумок. Надсилається лише текст — ні звук, ні відео.

Налаштування

  1. Відкрийте Налаштування > Підсумок від ШІ
  2. Виберіть Провайдера — він підставить базову URL-адресу й запропонує моделі — або виберіть Custom і введіть Базову URL-адресу API (наприклад, https://api.openai.com/v1)
  3. Введіть свій Ключ API
  4. Виберіть Модель (типово — gpt-4o-mini)
  5. Увімкніть Автоматично підсумовувати після транскрипції

Промпт для підсумку можна редагувати, тож замість загального підсумку ви можете просити рішення, завдання чи дедлайни.

Сумісні сервіси

Підійде будь-який сервіс з ендпоінтом chat completions, сумісним з OpenAI:

  • OpenAIhttps://api.openai.com/v1
  • OpenRouterhttps://openrouter.ai/api/v1
  • Локальні моделі (Ollama, LM Studio тощо) — вкажіть свій локальний ендпоінт

Що створюється

Для кожного транскрибованого запису autorec створює:

  • Назву — коротку й змістовну назву зустрічі
  • Підсумок — стислий виклад головних обговорених тем

Обидва відображаються у відеобібліотеці та на сторінці відео, тож потрібну зустріч легко знайти, не переглядаючи її знову.